pdf-rescue-mcp
Server Configuration
Describes the environment variables required to run the server.
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||
Instructions
Guidance the server publishes about itself, which clients place ahead of the tool catalog so the model reads it before choosing anything.
This server publishes no instructions, or was last inspected before Glama recorded them.
Capabilities
Features and capabilities supported by this server
Protocol revision2025-11-25
| Capability | Details |
|---|---|
| tools | {
"listChanged": false
} |
| prompts | {
"listChanged": false
} |
| resources | {
"subscribe": false,
"listChanged": false
} |
| experimental | {} |
Tools
Functions exposed to the LLM to take actions
| Name | Description |
|---|---|
| rescue_pdfA | 首选入口:直接处理用户关于单个PDF的请求,不要让用户选择内部工具。传入PDF路径和用户原话,会自动诊断、规划,并按文档类型和预计耗时完成前台提取或启动可恢复后台任务;也可用同一入口查询进度、质检、恢复任务和查看页面证据。前台提取时每页实时推送进度(页数、百分比、剩余时间)。 |
| run_health_checkA | 检查当前设备、内存、显卡和OCR相关依赖,给出推荐处理模式。快速模式不加载OCR模型,立即返回。 |
| inspect_pdf_text_layerC | 判断PDF是否已经包含完整可用文本层,识别扫描、混合、损坏和密码保护PDF。 |
| diagnose_pdfA | 检查PDF类型、乱码风险、扫描页比例和建议处理动作。 |
| plan_pdf_jobB | 根据当前设备和PDF状态规划速度与品质平衡的处理路线;密码不会写入记录。 |
| extract_book_textB | 提取PDF为可校验的正文、分段文本、页面记录和质量审计。OCR 在独立工作进程中运行,工具立即返回,不会阻塞 MCP。用 get_job_status 查看进度和工作进程心跳。 |
| extract_book_backgroundA | 启动可恢复的整本书后台提取任务,立即返回任务目录和进程信息,适合长时间扫描书籍。 |
| get_page_evidenceB | 读取指定页的识别文本、置信度、识别块和警告。 |
| get_term_glossaryA | 返回当前可审计的书名限定词表,供智能体依据页面证据补充明确错字。 |
| update_term_glossaryA | 依据已核对的页面证据,向书名限定词表加入一条明确错字替换;不支持不确定或跨行替换。 |
| export_page_image_evidenceB | 把指定页渲染成图片,保存到审计目录,并返回图像路径、页面记录和来源PDF;支持密码保护PDF。 |
| get_job_statusB | 读取书籍提取任务的运行时间、剩余时间、书籍名、总处理页数、处理进度、处理速度、CPU/内存资源占用率,以及低置信页、失败页和质量报告位置。监测以独立工作进程的心跳为准,不会把 Windows 包装器 PID 当作 OCR 进程。 |
| get_processing_historyB | 汇总指定目录下的PDF处理历史、状态、页数和质量指标;默认隐藏本地完整路径。 |
| share_processing_historyC | 生成可分享的处理历史JSON、Markdown和HTML文件,默认脱敏本地路径。 |
| resume_jobA | 检查任务是否疑似中断;确认中断后复用逐页缓存,从断点继续。恢复会启动独立 OCR 工作进程,立即返回,不阻塞 MCP。 |
| cancel_jobA | 请求正在运行的书籍任务在当前页边界安全停止。请求会持久化;OCR 无响应时监管层会按跨平台进程树策略清理,MCP 不会被阻塞。 |
| audit_job_qualityB | 巡检已输出页面或运行中逐页缓存,发现低置信页、缺页、分裂标题残留和图表噪声残留。 |
| get_iteration_planA | 基于当前任务状态、质量巡检和监管事件生成版本化改善建议。该工具只提出可审计建议,绝不会自动改写OCR规则、更新代码或重跑任务。 |
| scan_pdf_libraryB | 递归扫描目录中的PDF书籍,抽样检查文本层,生成书库清单和建议输出目录。 |
| batch_extract_libraryA | 按目录批量提取PDF书籍,在后台调度独立OCR worker,立即返回。用 get_batch_status 查看书本完成数、页数进度和资源调度。并发数会结合CPU线程、系统内存和每个worker的实际占用动态调整;支持断点续传。 |
| get_batch_statusA | 查看批量提取的整体进度,返回书本完成数/总数、当前书籍运行时间、剩余时间、总处理页数、处理进度、处理速度,以及固定监测格式中的逐 worker 任务列表(v=完成,-=执行中)。每个活动 worker 都包含监督层实际页速、真实心跳确认 PID、OCR线程预算、进程线程、CPU整机占比、CPU等效核心和RSS内存。总 CPU 比例按整机逻辑 CPU 归一化,不把多核累计值误报为百分比。 |
| stop_batchA | 停止批量提取(当前正在处理的书籍会继续完成,不再启动下一本)。 |
| plan_ocr_capacity_profileA | 规划 1/2/3/4 线程单 worker 与多 worker 的隔离 OCR 吞吐基准。只创建配置和私有样本计划;发现任意生产 OCR 正在运行时会标记为延期,不会占用当前任务资源。 |
| start_ocr_capacity_profileA | 在机器没有任何生产 OCR 时后台运行已规划的容量基准。每个候选使用独立、不重叠的私有 PDF 页样本;调用立即返回,OCR 不会阻塞 MCP。 |
| get_ocr_capacity_profileA | 读取容量基准的候选、逐 worker 线程资源样本、页吞吐、质量门禁和建议;不改变任何运行中任务。 |
| activate_ocr_capacity_profileA | 显式激活已完成基准给出的建议,供之后启动的批处理 worker 使用。不会热改、重启或中断已经运行的 OCR worker。 |
Prompts
Interactive templates invoked by user choice
| Name | Description |
|---|---|
No prompts | |
Resources
Contextual data attached and managed by the client
| Name | Description |
|---|---|
No resources | |
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/albertm88/pdf-rescue-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server