Skip to main content
Glama

OCR MCP Server

MCP-инструмент для распознавания текста в документах на основе Claude Vision — не требует сторонних OCR-движков, таких как Tesseract/PaddleOCR, напрямую использует мультимодальные визуальные возможности большой языковой модели для извлечения текста.

Python MCP Claude

✨ Возможности

  • Ноль зависимостей от OCR-движков — не нужно устанавливать Tesseract или PaddleOCR, вся способность распознавания обеспечивается Claude Vision API

  • Три инструмента — распознавание изображений, интеллектуальное распознавание PDF, принудительный OCR сканов

  • Умный фолбэк — для текстовых PDF напрямую извлекается встроенный текст (без затрат на API); сканы автоматически преобразуются в изображения и обрабатываются через Vision

  • Структурированный вывод — поддержка таблиц Markdown, JSON и обычного текста; подходит для таблиц, форм, рукописного текста и других сценариев

  • Подключай и работай — после настройки Claude Desktop вызов осуществляется напрямую на естественном языке

Related MCP server: mcp-upstage

🛠 Инструменты

Инструмент

Назначение

recognize_image

Распознаёт текст на изображениях: печатный и рукописный текст, таблицы; вывод в Markdown/JSON

recognize_pdf

Умная обработка PDF: из текстовых PDF напрямую извлекает встроенный текст (экономия токенов), сканы автоматически обрабатываются через Vision OCR

recognize_pdf_ocr

Принудительный Vision OCR всей страницы; подходит для чистых сканов/рукописных PDF

📦 Установка

# 克隆仓库
git clone https://github.com/你的用户名/ocr-mcp-server.git
cd ocr-mcp-server

# 安装依赖(仅 mcp / anthropic / PyMuPDF)
pip install -r requirements.txt

# 设置 Anthropic API Key
export ANTHROPIC_API_KEY="sk-ant-xxxxx"

⚙️ Настройка Claude Desktop

Отредактируйте claude_desktop_config.json:

  • macOS: ~/Library/Application Support/Claude/

  • Windows: %APPDATA%\Claude\

{
  "mcpServers": {
    "ocr": {
      "command": "python",
      "args": ["/你的绝对路径/ocr-mcp-server/server.py"],
      "env": {
        "ANTHROPIC_API_KEY": "sk-ant-xxxxx"
      }
    }
  }
}

Перезапустите Claude Desktop — и можно пользоваться.

🚀 Использование

В Claude Desktop инструменты запускаются напрямую на естественном языке:

  • "Распознай текст на этом изображении" → автоматически вызывается recognize_image

  • "Извлеки таблицы из этого PDF" → автоматически вызывается recognize_pdf

  • "Что написано в этом скане?" → автоматически вызывается recognize_pdf_ocr

🧠 Как это работает

图片  ──→ base64 编码 ──→ Claude Vision API ──→ 结构化文本
PDF   ──→ PyMuPDF 检测文字层
            ├─ 有文字层 → 直接提取(零成本)
            └─ 扫描件   ──→ 转图片 ──→ base64 ──→ Vision API

Основная идея: вместо традиционного OCR-конвейера используется визуальное понимание LLM — оно лучше разбирается в сложной вёрстке, таблицах, рукописном тексте, печатях и т.п., сохраняя смысловую структуру.

🔧 Технологический стек

  • mcp — официальный Python SDK для протокола MCP (FastMCP)

  • anthropic — официальный клиент Claude API

  • PyMuPDF — рендеринг PDF и извлечение встроенного текста

📄 Лицензия

MIT

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/zhang2gongzi/ocr-mcp-server'

If you have feedback or need assistance with the MCP directory API, please join our Discord server