pdf-rescue-mcp
Server Configuration
Describes the environment variables required to run the server.
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||
Capabilities
Features and capabilities supported by this server
| Capability | Details |
|---|---|
| tools | {
"listChanged": false
} |
| prompts | {
"listChanged": false
} |
| resources | {
"subscribe": false,
"listChanged": false
} |
| experimental | {} |
Tools
Functions exposed to the LLM to take actions
| Name | Description |
|---|---|
| rescue_pdfA | 首选入口:直接处理用户关于单个PDF的请求,不要让用户选择内部工具。传入PDF路径和用户原话,会自动诊断、规划,并按文档类型和预计耗时完成前台提取或启动可恢复后台任务;也可用同一入口查询进度、质检、恢复任务和查看页面证据。前台提取时每页实时推送进度(页数、百分比、剩余时间)。 |
| run_health_checkA | 检查当前设备、内存、显卡和OCR相关依赖,给出推荐处理模式。快速模式不加载OCR模型,立即返回。 |
| inspect_pdf_text_layerC | 判断PDF是否已经包含完整可用文本层,识别扫描、混合、损坏和密码保护PDF。 |
| diagnose_pdfA | 检查PDF类型、乱码风险、扫描页比例和建议处理动作。 |
| plan_pdf_jobB | 根据当前设备和PDF状态规划速度与品质平衡的处理路线;密码不会写入记录。 |
| extract_book_textB | 提取PDF为可校验的正文、分段文本、页面记录和质量审计。OCR 在独立工作进程中运行,工具立即返回,不会阻塞 MCP。用 get_job_status 查看进度和工作进程心跳。 |
| extract_book_backgroundA | 启动可恢复的整本书后台提取任务,立即返回任务目录和进程信息,适合长时间扫描书籍。 |
| get_page_evidenceB | 读取指定页的识别文本、置信度、识别块和警告。 |
| get_term_glossaryA | 返回当前可审计的书名限定词表,供智能体依据页面证据补充明确错字。 |
| update_term_glossaryA | 依据已核对的页面证据,向书名限定词表加入一条明确错字替换;不支持不确定或跨行替换。 |
| export_page_image_evidenceB | 把指定页渲染成图片,保存到审计目录,并返回图像路径、页面记录和来源PDF;支持密码保护PDF。 |
| get_job_statusB | 读取书籍提取任务的运行时间、剩余时间、书籍名、总处理页数、处理进度、处理速度、CPU/内存资源占用率,以及低置信页、失败页和质量报告位置。监测以独立工作进程的心跳为准,不会把 Windows 包装器 PID 当作 OCR 进程。 |
| get_processing_historyB | 汇总指定目录下的PDF处理历史、状态、页数和质量指标;默认隐藏本地完整路径。 |
| share_processing_historyC | 生成可分享的处理历史JSON、Markdown和HTML文件,默认脱敏本地路径。 |
| resume_jobA | 检查任务是否疑似中断;确认中断后复用逐页缓存,从断点继续。恢复会启动独立 OCR 工作进程,立即返回,不阻塞 MCP。 |
| cancel_jobA | 请求正在运行的书籍任务在当前页边界安全停止。请求会持久化;OCR 无响应时监管层会按跨平台进程树策略清理,MCP 不会被阻塞。 |
| audit_job_qualityB | 巡检已输出页面或运行中逐页缓存,发现低置信页、缺页、分裂标题残留和图表噪声残留。 |
| get_iteration_planA | 基于当前任务状态、质量巡检和监管事件生成版本化改善建议。该工具只提出可审计建议,绝不会自动改写OCR规则、更新代码或重跑任务。 |
| scan_pdf_libraryB | 递归扫描目录中的PDF书籍,抽样检查文本层,生成书库清单和建议输出目录。 |
| batch_extract_libraryA | 按目录批量提取PDF书籍,在后台调度独立OCR worker,立即返回。用 get_batch_status 查看书本完成数、页数进度和资源调度。并发数会结合CPU线程、系统内存和每个worker的实际占用动态调整;支持断点续传。 |
| get_batch_statusA | 查看批量提取的整体进度,返回书本完成数/总数、当前书籍运行时间、剩余时间、总处理页数、处理进度、处理速度,以及固定监测格式中的逐 worker 任务列表(v=完成,-=执行中)。每个活动 worker 都包含监督层实际页速、真实心跳确认 PID、OCR线程预算、进程线程、CPU整机占比、CPU等效核心和RSS内存。总 CPU 比例按整机逻辑 CPU 归一化,不把多核累计值误报为百分比。 |
| stop_batchA | 停止批量提取(当前正在处理的书籍会继续完成,不再启动下一本)。 |
| plan_ocr_capacity_profileA | 规划 1/2/3/4 线程单 worker 与多 worker 的隔离 OCR 吞吐基准。只创建配置和私有样本计划;发现任意生产 OCR 正在运行时会标记为延期,不会占用当前任务资源。 |
| start_ocr_capacity_profileA | 在机器没有任何生产 OCR 时后台运行已规划的容量基准。每个候选使用独立、不重叠的私有 PDF 页样本;调用立即返回,OCR 不会阻塞 MCP。 |
| get_ocr_capacity_profileA | 读取容量基准的候选、逐 worker 线程资源样本、页吞吐、质量门禁和建议;不改变任何运行中任务。 |
| activate_ocr_capacity_profileA | 显式激活已完成基准给出的建议,供之后启动的批处理 worker 使用。不会热改、重启或中断已经运行的 OCR worker。 |
Prompts
Interactive templates invoked by user choice
| Name | Description |
|---|---|
No prompts | |
Resources
Contextual data attached and managed by the client
| Name | Description |
|---|---|
No resources | |
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/albertm88/pdf-rescue-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server