ocr-mcp
Servicio OCR MCP
Servicio OCR basado en MCP impulsado por PaddleOCR, que admite reconocimiento de texto y reconocimiento de tablas.
Características
Reconocimiento de texto OCR: Reconocer contenido de texto en imágenes, compatible con chino, inglés y otros idiomas
Reconocimiento de tablas: Reconocer tablas en imágenes y devolver datos estructurados
Reconocimiento de escritura a mano: Reconocer texto manuscrito en imágenes
Reconocimiento de fórmulas: Reconocer fórmulas matemáticas en imágenes y devolver formato LaTeX
Soporte multi-formato: Compatible con JPG, PNG, BMP, TIFF, WebP y otros formatos de imagen
Soporte de URL: Compatible con rutas de archivo locales y URLs de red
Protocolo MCP: Servicio MCP estándar, se puede integrar en asistentes de IA compatibles con MCP
Related MCP server: mcp_ocr
Instalación
Instalar mediante pip
pip install ocr-mcpInstalar desde el código fuente
git clone https://github.com/LinuxLinking/OCR_MCP.git
cd OCR_MCP
pip install -e .Uso
Ejecutar como servicio MCP
# Run directly
ocr-mcp
# Or run via Python module
python -m ocr_mcpIntegrar con Claude Desktop
Añadir al archivo de configuración de Claude Desktop:
{
"mcpServers": {
"ocr": {
"command": "ocr-mcp",
"args": []
}
}
}Descripción de la herramienta MCP
ocr_recognize
Reconocer contenido de texto en imágenes.
Parámetros:
source(obligatorio): Origen de la imagen, ruta de archivo local o URLlanguage(opcional): Idioma de reconocimiento, por defectoch(chino), compatible conen,japan,korean, etc.use_angle_cls(opcional): Si habilitar la clasificación de dirección del texto, por defectotrue
Ejemplo de salida:
1. Hello World (confidence: 98.50%)
2. 你好世界 (confidence: 97.20%)ocr_table
Reconocer contenido de tablas en imágenes y devolver datos estructurados.
Parámetros:
source(obligatorio): Origen de la imagen, ruta de archivo local o URLlanguage(opcional): Idioma de reconocimiento, por defectoch
Ejemplo de salida:
+--------+-----+------+
| Name | Age | City |
+--------+-----+------+
| Alice | 25 | NYC |
+--------+-----+------+
| Bob | 30 | LA |
+--------+-----+------+ocr_handwrite
Reconocer contenido de texto manuscrito en imágenes.
Parámetros:
source(obligatorio): Origen de la imagen, ruta de archivo local o URLlanguage(opcional): Idioma de reconocimiento, por defectoch
Ejemplo de salida:
1. Hello World (confidence: 85.50%)
2. 你好 (confidence: 82.30%)ocr_formula
Reconocer fórmulas matemáticas en imágenes y devolver formato LaTeX.
Parámetros:
source(obligatorio): Origen de la imagen, ruta de archivo local o URL
Ejemplo de salida:
Formula 1:
LaTeX: E = mc^2
Formula 2:
LaTeX: \int_{0}^{\infty} e^{-x^2} dx = \frac{\sqrt{\pi}}{2}Desarrollo
Instalar dependencias de desarrollo
pip install -e ".[dev]"Ejecutar pruebas
pytest tests/ -vEstructura del proyecto
OCR_MCP/
├── src/ocr_mcp/
│ ├── __init__.py # Package initialization
│ ├── __main__.py # Module entry point
│ ├── server.py # MCP service main entry (dispatch layer)
│ ├── ocr_engine.py # Subprogram 1: Text recognition engine
│ ├── table_parser.py # Subprogram 2: Table recognition engine
│ ├── formula_engine.py # Subprogram 3: Formula recognition engine
│ └── utils.py # Utility functions
├── tests/
│ └── test_ocr.py # Test files
├── pyproject.toml # Project configuration
├── LICENSE # MIT License
└── README.md # Project documentationArquitectura
Este proyecto utiliza una arquitectura paralela de subprogramas, con 4 herramientas de reconocimiento que son independientes y se pueden llamar por separado:
┌─────────────────────────────────────────────────────────┐
│ MCP Server (Dispatch Layer) │
├──────────────┬──────────────┬─────────────┬─────────────┤
│ Subprogram 1 │ Subprogram 2 │ Subprogram 3│ Subprogram 4│
│ocr_recognize │ ocr_table │ocr_handwrite│ ocr_formula │
│Text Recognition│Table Recognition│Handwriting Recognition│Formula Recognition│
└──────────────┴──────────────┴─────────────┴─────────────┘
↓ ↓ ↓ ↓
OCREngine TableParser OCREngine FormulaEngineCaracterísticas:
Cada subprograma se ejecuta de forma independiente sin dependencias
Admite llamadas paralelas, puede procesar múltiples tareas simultáneamente
Crea instancias independientes para cada llamada para evitar conflictos de estado
Puede extender o reemplazar individualmente cualquier subprograma
Dependencias
PaddleOCR: Motor de reconocimiento OCR principal
PaddlePaddle: Marco de aprendizaje profundo
OpenCV: Procesamiento de imágenes
MCP: Marco de servicio del Protocolo de Contexto de Modelo
Licencia
Este proyecto es de código abierto bajo la Licencia MIT.
Enlaces relacionados
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityDmaintenanceProvides OCR services powered by Google's Gemini API to extract text from images via file paths or base64 strings. It enables high-accuracy text recognition and CAPTCHA processing through simple MCP tools.7
- AlicenseAqualityAmaintenanceModular OCR MCP server supporting Apple Vision, PaddleOCR, and PaddleOCR-VL backends. Enables text, layout, table, formula, and chart extraction from images via natural language.14MIT
- AlicenseNot gradedqualityBmaintenanceEnables image analysis via OpenAI-compatible vision APIs, supporting local files, URLs, and base64 inputs with intelligent tiling for high-resolution images. Provides a secure, configurable MCP stdio server for structured vision analysis.1,2641MIT
- AlicenseAqualityAmaintenanceEnables non-vision LLMs to understand images, extract text via OCR, and parse documents through a unified MCP interface, with local-first processing and optional OpenAI-compatible channels.3MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
OCR.space MCP — wraps the OCR.space API (ocr.space) for image/PDF → text OCR.
ImagePay MCP: 40 x402 paid API tools (OCR, PDF, image, QR, tabular, web). Pay per call on Base.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/LinuxLinking/ocr-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server