Skip to main content
Glama

Servicio OCR MCP

中文 | 日本語

Servicio OCR basado en MCP impulsado por PaddleOCR, que admite reconocimiento de texto y reconocimiento de tablas.

Características

  • Reconocimiento de texto OCR: Reconocer contenido de texto en imágenes, compatible con chino, inglés y otros idiomas

  • Reconocimiento de tablas: Reconocer tablas en imágenes y devolver datos estructurados

  • Reconocimiento de escritura a mano: Reconocer texto manuscrito en imágenes

  • Reconocimiento de fórmulas: Reconocer fórmulas matemáticas en imágenes y devolver formato LaTeX

  • Soporte multi-formato: Compatible con JPG, PNG, BMP, TIFF, WebP y otros formatos de imagen

  • Soporte de URL: Compatible con rutas de archivo locales y URLs de red

  • Protocolo MCP: Servicio MCP estándar, se puede integrar en asistentes de IA compatibles con MCP

Related MCP server: mcp_ocr

Instalación

Instalar mediante pip

pip install ocr-mcp

Instalar desde el código fuente

git clone https://github.com/LinuxLinking/OCR_MCP.git
cd OCR_MCP
pip install -e .

Uso

Ejecutar como servicio MCP

# Run directly
ocr-mcp

# Or run via Python module
python -m ocr_mcp

Integrar con Claude Desktop

Añadir al archivo de configuración de Claude Desktop:

{
  "mcpServers": {
    "ocr": {
      "command": "ocr-mcp",
      "args": []
    }
  }
}

Descripción de la herramienta MCP

ocr_recognize

Reconocer contenido de texto en imágenes.

Parámetros:

  • source (obligatorio): Origen de la imagen, ruta de archivo local o URL

  • language (opcional): Idioma de reconocimiento, por defecto ch (chino), compatible con en, japan, korean, etc.

  • use_angle_cls (opcional): Si habilitar la clasificación de dirección del texto, por defecto true

Ejemplo de salida:

1. Hello World (confidence: 98.50%)
2. 你好世界 (confidence: 97.20%)

ocr_table

Reconocer contenido de tablas en imágenes y devolver datos estructurados.

Parámetros:

  • source (obligatorio): Origen de la imagen, ruta de archivo local o URL

  • language (opcional): Idioma de reconocimiento, por defecto ch

Ejemplo de salida:

+--------+-----+------+
| Name   | Age | City |
+--------+-----+------+
| Alice  | 25  | NYC  |
+--------+-----+------+
| Bob    | 30  | LA   |
+--------+-----+------+

ocr_handwrite

Reconocer contenido de texto manuscrito en imágenes.

Parámetros:

  • source (obligatorio): Origen de la imagen, ruta de archivo local o URL

  • language (opcional): Idioma de reconocimiento, por defecto ch

Ejemplo de salida:

1. Hello World (confidence: 85.50%)
2. 你好 (confidence: 82.30%)

ocr_formula

Reconocer fórmulas matemáticas en imágenes y devolver formato LaTeX.

Parámetros:

  • source (obligatorio): Origen de la imagen, ruta de archivo local o URL

Ejemplo de salida:

Formula 1:
  LaTeX: E = mc^2
Formula 2:
  LaTeX: \int_{0}^{\infty} e^{-x^2} dx = \frac{\sqrt{\pi}}{2}

Desarrollo

Instalar dependencias de desarrollo

pip install -e ".[dev]"

Ejecutar pruebas

pytest tests/ -v

Estructura del proyecto

OCR_MCP/
├── src/ocr_mcp/
│   ├── __init__.py          # Package initialization
│   ├── __main__.py          # Module entry point
│   ├── server.py            # MCP service main entry (dispatch layer)
│   ├── ocr_engine.py        # Subprogram 1: Text recognition engine
│   ├── table_parser.py      # Subprogram 2: Table recognition engine
│   ├── formula_engine.py    # Subprogram 3: Formula recognition engine
│   └── utils.py             # Utility functions
├── tests/
│   └── test_ocr.py          # Test files
├── pyproject.toml           # Project configuration
├── LICENSE                  # MIT License
└── README.md                # Project documentation

Arquitectura

Este proyecto utiliza una arquitectura paralela de subprogramas, con 4 herramientas de reconocimiento que son independientes y se pueden llamar por separado:

┌─────────────────────────────────────────────────────────┐
│                   MCP Server (Dispatch Layer)            │
├──────────────┬──────────────┬─────────────┬─────────────┤
│ Subprogram 1 │ Subprogram 2 │ Subprogram 3│ Subprogram 4│
│ocr_recognize │  ocr_table   │ocr_handwrite│ ocr_formula │
│Text Recognition│Table Recognition│Handwriting Recognition│Formula Recognition│
└──────────────┴──────────────┴─────────────┴─────────────┘
       ↓              ↓              ↓              ↓
   OCREngine     TableParser    OCREngine    FormulaEngine

Características:

  • Cada subprograma se ejecuta de forma independiente sin dependencias

  • Admite llamadas paralelas, puede procesar múltiples tareas simultáneamente

  • Crea instancias independientes para cada llamada para evitar conflictos de estado

  • Puede extender o reemplazar individualmente cualquier subprograma

Dependencias

  • PaddleOCR: Motor de reconocimiento OCR principal

  • PaddlePaddle: Marco de aprendizaje profundo

  • OpenCV: Procesamiento de imágenes

  • MCP: Marco de servicio del Protocolo de Contexto de Modelo

Licencia

Este proyecto es de código abierto bajo la Licencia MIT.

Enlaces relacionados

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • F
    license
    Not graded
    quality
    D
    maintenance
    Provides OCR services powered by Google's Gemini API to extract text from images via file paths or base64 strings. It enables high-accuracy text recognition and CAPTCHA processing through simple MCP tools.
    7
  • A
    license
    A
    quality
    A
    maintenance
    Modular OCR MCP server supporting Apple Vision, PaddleOCR, and PaddleOCR-VL backends. Enables text, layout, table, formula, and chart extraction from images via natural language.
    14
    MIT
  • A
    license
    Not graded
    quality
    B
    maintenance
    Enables image analysis via OpenAI-compatible vision APIs, supporting local files, URLs, and base64 inputs with intelligent tiling for high-resolution images. Provides a secure, configurable MCP stdio server for structured vision analysis.
    1,264
    1
    MIT

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • OCR.space MCP — wraps the OCR.space API (ocr.space) for image/PDF → text OCR.

  • ImagePay MCP: 40 x402 paid API tools (OCR, PDF, image, QR, tabular, web). Pay per call on Base.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/LinuxLinking/ocr-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server