Skip to main content
Glama

OCR MCP Service

中文 | 日本語

MCP-сервис OCR на базе PaddleOCR, поддерживающий распознавание текста и таблиц.

Возможности

  • Распознавание текста OCR: Распознавание текстового содержимого на изображениях, поддержка китайского, английского и других языков.

  • Распознавание таблиц: Распознавание таблиц на изображениях и возврат структурированных данных.

  • Распознавание рукописного текста: Распознавание рукописного текста на изображениях.

  • Распознавание формул: Распознавание математических формул на изображениях и возврат в формате LaTeX.

  • Поддержка множества форматов: Поддержка JPG, PNG, BMP, TIFF, WebP и других форматов изображений.

  • Поддержка URL: Поддержка как локальных путей к файлам, так и сетевых URL.

  • Протокол MCP: Стандартный MCP-сервис, может быть интегрирован в MCP-совместимые ИИ-ассистенты.

Related MCP server: mcp_ocr

Установка

Установка через pip

pip install ocr-mcp

Установка из исходного кода

git clone https://github.com/LinuxLinking/OCR_MCP.git
cd OCR_MCP
pip install -e .

Использование

Запуск в качестве MCP-сервиса

# Run directly
ocr-mcp

# Or run via Python module
python -m ocr_mcp

Интеграция с Claude Desktop

Добавьте в файл конфигурации Claude Desktop:

{
  "mcpServers": {
    "ocr": {
      "command": "ocr-mcp",
      "args": []
    }
  }
}

Описание инструментов MCP

ocr_recognize

Распознавание текстового содержимого на изображениях.

Параметры:

  • source (обязательный): Источник изображения, локальный путь к файлу или URL.

  • language (необязательный): Язык распознавания, по умолчанию ch (китайский), поддерживает en, japan, korean и др.

  • use_angle_cls (необязательный): Включить ли классификацию направления текста, по умолчанию true.

Пример вывода:

1. Hello World (confidence: 98.50%)
2. 你好世界 (confidence: 97.20%)

ocr_table

Распознавание содержимого таблиц на изображениях и возврат структурированных данных.

Параметры:

  • source (обязательный): Источник изображения, локальный путь к файлу или URL.

  • language (необязательный): Язык распознавания, по умолчанию ch.

Пример вывода:

+--------+-----+------+
| Name   | Age | City |
+--------+-----+------+
| Alice  | 25  | NYC  |
+--------+-----+------+
| Bob    | 30  | LA   |
+--------+-----+------+

ocr_handwrite

Распознавание рукописного текста на изображениях.

Параметры:

  • source (обязательный): Источник изображения, локальный путь к файлу или URL.

  • language (необязательный): Язык распознавания, по умолчанию ch.

Пример вывода:

1. Hello World (confidence: 85.50%)
2. 你好 (confidence: 82.30%)

ocr_formula

Распознавание математических формул на изображениях и возврат в формате LaTeX.

Параметры:

  • source (обязательный): Источник изображения, локальный путь к файлу или URL.

Пример вывода:

Formula 1:
  LaTeX: E = mc^2
Formula 2:
  LaTeX: \int_{0}^{\infty} e^{-x^2} dx = \frac{\sqrt{\pi}}{2}

Разработка

Установка зависимостей для разработки

pip install -e ".[dev]"

Запуск тестов

pytest tests/ -v

Структура проекта

OCR_MCP/
├── src/ocr_mcp/
│   ├── __init__.py          # Package initialization
│   ├── __main__.py          # Module entry point
│   ├── server.py            # MCP service main entry (dispatch layer)
│   ├── ocr_engine.py        # Subprogram 1: Text recognition engine
│   ├── table_parser.py      # Subprogram 2: Table recognition engine
│   ├── formula_engine.py    # Subprogram 3: Formula recognition engine
│   └── utils.py             # Utility functions
├── tests/
│   └── test_ocr.py          # Test files
├── pyproject.toml           # Project configuration
├── LICENSE                  # MIT License
└── README.md                # Project documentation

Архитектура

Этот проект использует параллельную архитектуру подпрограмм, с 4 инструментами распознавания, которые независимы и могут вызываться отдельно:

┌─────────────────────────────────────────────────────────┐
│                   MCP Server (Dispatch Layer)            │
├──────────────┬──────────────┬─────────────┬─────────────┤
│ Subprogram 1 │ Subprogram 2 │ Subprogram 3│ Subprogram 4│
│ocr_recognize │  ocr_table   │ocr_handwrite│ ocr_formula │
│Text Recognition│Table Recognition│Handwriting Recognition│Formula Recognition│
└──────────────┴──────────────┴─────────────┴─────────────┘
       ↓              ↓              ↓              ↓
   OCREngine     TableParser    OCREngine    FormulaEngine

Возможности:

  • Каждая подпрограмма работает независимо, без зависимостей.

  • Поддерживает параллельные вызовы, может обрабатывать несколько задач одновременно.

  • Создает независимые экземпляры для каждого вызова, чтобы избежать конфликтов состояния.

  • Можно индивидуально расширять или заменять любую подпрограмму.

Зависимости

  • PaddleOCR: Основной движок распознавания OCR.

  • PaddlePaddle: Фреймворк глубокого обучения.

  • OpenCV: Обработка изображений.

  • MCP: Сервисный фреймворк Model Context Protocol.

Лицензия

Этот проект распространяется с открытым исходным кодом под лицензией MIT.

Связанные ссылки

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • F
    license
    Not graded
    quality
    D
    maintenance
    Provides OCR services powered by Google's Gemini API to extract text from images via file paths or base64 strings. It enables high-accuracy text recognition and CAPTCHA processing through simple MCP tools.
    7
  • A
    license
    A
    quality
    A
    maintenance
    Modular OCR MCP server supporting Apple Vision, PaddleOCR, and PaddleOCR-VL backends. Enables text, layout, table, formula, and chart extraction from images via natural language.
    14
    MIT
  • A
    license
    Not graded
    quality
    B
    maintenance
    Enables image analysis via OpenAI-compatible vision APIs, supporting local files, URLs, and base64 inputs with intelligent tiling for high-resolution images. Provides a secure, configurable MCP stdio server for structured vision analysis.
    1,264
    1
    MIT

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • OCR.space MCP — wraps the OCR.space API (ocr.space) for image/PDF → text OCR.

  • ImagePay MCP: 40 x402 paid API tools (OCR, PDF, image, QR, tabular, web). Pay per call on Base.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/LinuxLinking/ocr-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server