Skip to main content
Glama
albertm88

pdf-rescue-mcp

by albertm88

Server Configuration

Describes the environment variables required to run the server.

NameRequiredDescriptionDefault

No arguments

Capabilities

Features and capabilities supported by this server

CapabilityDetails
tools
{
  "listChanged": false
}
prompts
{
  "listChanged": false
}
resources
{
  "subscribe": false,
  "listChanged": false
}
experimental
{}

Tools

Functions exposed to the LLM to take actions

NameDescription
rescue_pdfA

首选入口:直接处理用户关于单个PDF的请求,不要让用户选择内部工具。传入PDF路径和用户原话,会自动诊断、规划,并按文档类型和预计耗时完成前台提取或启动可恢复后台任务;也可用同一入口查询进度、质检、恢复任务和查看页面证据。前台提取时每页实时推送进度(页数、百分比、剩余时间)。

run_health_checkA

检查当前设备、内存、显卡和OCR相关依赖,给出推荐处理模式。快速模式不加载OCR模型,立即返回。

inspect_pdf_text_layerC

判断PDF是否已经包含完整可用文本层,识别扫描、混合、损坏和密码保护PDF。

diagnose_pdfA

检查PDF类型、乱码风险、扫描页比例和建议处理动作。

plan_pdf_jobB

根据当前设备和PDF状态规划速度与品质平衡的处理路线;密码不会写入记录。

extract_book_textB

提取PDF为可校验的正文、分段文本、页面记录和质量审计。OCR 在独立工作进程中运行,工具立即返回,不会阻塞 MCP。用 get_job_status 查看进度和工作进程心跳。

extract_book_backgroundA

启动可恢复的整本书后台提取任务,立即返回任务目录和进程信息,适合长时间扫描书籍。

get_page_evidenceB

读取指定页的识别文本、置信度、识别块和警告。

get_term_glossaryA

返回当前可审计的书名限定词表,供智能体依据页面证据补充明确错字。

update_term_glossaryA

依据已核对的页面证据,向书名限定词表加入一条明确错字替换;不支持不确定或跨行替换。

export_page_image_evidenceB

把指定页渲染成图片,保存到审计目录,并返回图像路径、页面记录和来源PDF;支持密码保护PDF。

get_job_statusB

读取书籍提取任务的运行时间、剩余时间、书籍名、总处理页数、处理进度、处理速度、CPU/内存资源占用率,以及低置信页、失败页和质量报告位置。监测以独立工作进程的心跳为准,不会把 Windows 包装器 PID 当作 OCR 进程。

get_processing_historyB

汇总指定目录下的PDF处理历史、状态、页数和质量指标;默认隐藏本地完整路径。

share_processing_historyC

生成可分享的处理历史JSON、Markdown和HTML文件,默认脱敏本地路径。

resume_jobA

检查任务是否疑似中断;确认中断后复用逐页缓存,从断点继续。恢复会启动独立 OCR 工作进程,立即返回,不阻塞 MCP。

cancel_jobA

请求正在运行的书籍任务在当前页边界安全停止。请求会持久化;OCR 无响应时监管层会按跨平台进程树策略清理,MCP 不会被阻塞。

audit_job_qualityB

巡检已输出页面或运行中逐页缓存,发现低置信页、缺页、分裂标题残留和图表噪声残留。

get_iteration_planA

基于当前任务状态、质量巡检和监管事件生成版本化改善建议。该工具只提出可审计建议,绝不会自动改写OCR规则、更新代码或重跑任务。

scan_pdf_libraryB

递归扫描目录中的PDF书籍,抽样检查文本层,生成书库清单和建议输出目录。

batch_extract_libraryA

按目录批量提取PDF书籍,在后台调度独立OCR worker,立即返回。用 get_batch_status 查看书本完成数、页数进度和资源调度。并发数会结合CPU线程、系统内存和每个worker的实际占用动态调整;支持断点续传。

get_batch_statusA

查看批量提取的整体进度,返回书本完成数/总数、当前书籍运行时间、剩余时间、总处理页数、处理进度、处理速度,以及固定监测格式中的逐 worker 任务列表(v=完成,-=执行中)。每个活动 worker 都包含监督层实际页速、真实心跳确认 PID、OCR线程预算、进程线程、CPU整机占比、CPU等效核心和RSS内存。总 CPU 比例按整机逻辑 CPU 归一化,不把多核累计值误报为百分比。

stop_batchA

停止批量提取(当前正在处理的书籍会继续完成,不再启动下一本)。

plan_ocr_capacity_profileA

规划 1/2/3/4 线程单 worker 与多 worker 的隔离 OCR 吞吐基准。只创建配置和私有样本计划;发现任意生产 OCR 正在运行时会标记为延期,不会占用当前任务资源。

start_ocr_capacity_profileA

在机器没有任何生产 OCR 时后台运行已规划的容量基准。每个候选使用独立、不重叠的私有 PDF 页样本;调用立即返回,OCR 不会阻塞 MCP。

get_ocr_capacity_profileA

读取容量基准的候选、逐 worker 线程资源样本、页吞吐、质量门禁和建议;不改变任何运行中任务。

activate_ocr_capacity_profileA

显式激活已完成基准给出的建议,供之后启动的批处理 worker 使用。不会热改、重启或中断已经运行的 OCR worker。

Prompts

Interactive templates invoked by user choice

NameDescription

No prompts

Resources

Contextual data attached and managed by the client

NameDescription

No resources

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/albertm88/pdf-rescue-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server