mimo-vision-mcp
mimo-vision-mcp
Dale capacidad de visión a los LLM solo de texto a través de MCP, impulsado por modelos de visión como Xiaomi MiMo-V2.5.
A través de MCP (Model Context Protocol), se expone la capacidad de comprensión de imágenes de modelos de visión (como MiMo-V2.5 de Xiaomi) a LLM de texto que no poseen capacidades multimodales. Cuando el modelo de texto se encuentra con imágenes/capturas de pantalla/rutas de imagen, puede llamar activamente a herramientas como analyze_image, describe_image, extract_text_from_image para obtener capacidades de visión.
🚀 Inicio con un clic (los principiantes pueden empezar en 1 minuto, sin necesidad de escribir ningún comando)
Este proyecto incluye un inicio con un clic vía WebUI, todo con operaciones de ratón, configuración automática del entorno, sin necesidad de línea de comandos:
Descarga / clona este proyecto en tu máquina local
Haz doble clic en
start-webui.bat(Windows): el script creará automáticamente.env(a partir de.env.example), instalará el entorno/dependencias, iniciará el servicio y abrirá el navegador automáticamenteUna vez abierto el navegador, introduce tu API Key en la página web → haz clic en «Aplicar a CLI», o simplemente arrastra una imagen → elige un modelo de visión → haz clic en «Prueba de vista previa» para ver al modelo de visión "describir la imagen"
En el primer inicio se instalarán las dependencias automáticamente (requiere conexión a internet, unos 1~2 minutos); después, con doble clic se abre al instante. No necesitas saber Python, ni escribir
pipa mano, ni crear.envmanualmente: el script lo hace todo automáticamente.
La integración completa de la capacidad de visión del LLM de texto en la línea de comandos se describe a continuación en Integración con opencode.
Related MCP server: mimo-vision-mcp
Principio
El modelo de texto se encarga de la "orquestación", el modelo de visión se encarga de "ver", y MCP es la interfaz que conecta ambos: los datos de imagen no pasan por el modelo de texto.
用户给图片路径/URL
→ ① 文本 LLM 根据工具列表 + 调用指引,决定调用 analyze_image
→ ② opencode / 任意 MCP 客户端(stdio)
→ ③ mimo-vision MCP server(图片归一化 + 转发请求)
→ ④ 视觉模型(MiMo-V2.5 等,经 OpenCode Go / 自定义供应商)真正"看"图
→ ⑤ 文本结果原路返回,文本模型转述给用户Características
Inicio con un clic: haz doble clic en
start-webui.baty listo; instala dependencias, inicia el servicio y abre el navegador automáticamente, sin barreras para principiantesListo para usar: integra OpenCode Go por defecto; solo necesitas una API Key para empezar, y también puedes cambiar al proveedor oficial de Xiaomi o a cualquier proveedor personalizado
Basado en el protocolo compatible con OpenAI, transporte local stdio, compatible con cualquier cliente MCP como opencode / Claude Desktop / Cursor
Entrada de imágenes flexible: ruta local / URL http(s) / data URI base64 / base64 puro son todos válidos
Soporta múltiples imágenes, detección automática de formato (JPEG/PNG/GIF/WebP/BMP), validación del límite de 50MB
Selección automática del protocolo de API según el modelo:
gpt-*/grok-*usan Responses API, el resto usa chat/completions (se puede forzar)WebUI integrado como panel de configuración: selección visual de modelos, prueba de vista previa, sincronización con CLI sin reiniciar
Mensajes de error amigables si no hay API key, sin fallos
Estructura de directorios
mimo-vision-mcp/
├── mimo_vision_mcp/
│ ├── config.py # 配置读取(.env 实时重读)+ 应用到 MCP
│ ├── image_loader.py # 图片输入归一化 + MIME 探测
│ ├── providers.py # 供应商注册表 + call_vision(chat/responses 适配)
│ └── server.py # FastMCP server + 3 个工具
├── webui/ # WebUI 配置面板(FastAPI + 单页 HTML)
├── tests/ # 单元测试
├── .github/workflows/ci.yml
├── opencode.example.json # opencode 接入配置示例
├── AGENTS.md # 文本模型的调用指引
├── start-webui.bat # 🚀 一键启动(Windows,双击即用)
├── LICENSE
└── pyproject.tomlInstalación
python -m venv .venv
# Windows: .\.venv\Scripts\python.exe -m pip install -e ".[dev]"
.venv/bin/python -m pip install -e ".[dev]"Configuración de la API Key
Este proyecto usa por defecto el plan OpenCode Go para llamar a MiMo-V2.5 (modelo mimo-v2.5, endpoint compatible con OpenAI https://opencode.ai/zen/go/v1).
Suscríbete a Go en opencode.ai/auth y copia la API Key
Copia
.env.examplea.envy rellénalo:MIMO_API_KEY=你的-opencode-go-key
También se puede sobrescribir mediante variables de entorno (config.py relee .env en cada llamada):
Variable | Descripción | Valor por defecto |
| API Key (también se puede usar | vacío |
| ID del proveedor |
|
| ID del modelo de visión |
|
| Endpoint compatible con OpenAI |
|
|
| automático |
| Límite de salida por llamada |
|
| Tiempo de espera de la solicitud (segundos) |
|
Cambiar el modelo de visión: en OpenCode Go, los modelos multimodales más rápidos se pueden configurar cambiando
MIMO_MODELagpt-5.6-luna(usa/responses) ominimax-m3. Ten en cuenta quemimo-v2.5-proes un modelo solo de texto y no puede ver imágenes.
Ejecutar el servidor MCP
# 方式一:控制台脚本
mimo-vision-mcp
# 方式二:模块运行
python -m mimo_vision_mcp.serverIntegración con opencode
Consulta opencode.example.json para registrar mimo-vision como servidor MCP stdio local:
{
"$schema": "https://opencode.ai/config.json",
"mcp": {
"mimo-vision": {
"type": "local",
"command": ["<你的python路径>", "-m", "mimo_vision_mcp.server"],
"enabled": true,
"environment": { "MIMO_API_KEY": "{env:MIMO_API_KEY}" }
}
},
"experimental": { "mcp_timeout": 120000 }
}Nota:
experimental.mcp_timeout(por defecto 30s) controla el tiempo de espera de las llamadas a herramientas MCP. Las solicitudes de visión pueden tardar decenas de segundos, así que ajústalo a más de 120s; no configurestimeoutpor separado enmcp.mimo-vision, ya que sobrescribiríamcp_timeouty provocaría tiempos de espera. Después de cambiar la configuración, reinicia opencode para que surta efecto.
Este proyecto también incluye AGENTS.md (guía de llamadas para el modelo de texto), que se puede inyectar en cada sesión mediante la configuración global "instructions": ["<ruta>/AGENTS.md"], para que el modelo de texto puro llame activamente a las herramientas cuando encuentre imágenes.
Descripción de herramientas
Herramienta | Descripción |
| Preguntas y respuestas generales sobre imágenes, admite múltiples imágenes |
| Describe el contenido de la imagen en detalle |
| Extrae texto de la imagen (OCR) |
Cada elemento de images admite:
Ruta absoluta local:
C:/Users/xx/Pictures/a.pngURL pública:
https://example.com/a.jpgdata URI base64:
data:image/png;base64,....Cadena base64 pura
Devuelve JSON: { "result": "...", "error": "", "model": "...", "usage": {...} }
WebUI (frontend interactivo · inicio con un clic)
Entrada recomendada para principiantes: interfaz gráfica, sube imágenes, elige modelo, ve los resultados, todo con el ratón.
Inicio con un clic (lo más sencillo, sin necesidad de comandos)
Haz doble clic en start-webui.bat (Windows):
El script comprueba/crea el entorno automáticamente e instala las dependencias
Inicia el servicio automáticamente y abre el navegador
Si el servicio ya está en ejecución, solo abre el navegador, sin iniciar duplicados
Para usuarios que no usan Windows, inicio manual:
python -m pip install -e ".[web]" && python -m webui.app, y luego abre http://127.0.0.1:8000 en el navegador (el puerto se puede cambiar conMIMO_WEBUI_PORT).
Funciones de la interfaz
La parte superior «Modelo activo CLI / MCP» muestra el proveedor/modelo/estilo que usa realmente el LLM de línea de comandos
Después de elegir el modelo, haz clic en «Aplicar a CLI (sincronizar con MCP)»; la configuración se escribe en
.env, sin reiniciar, y la próxima llamada del CLI usará el nuevo modeloLa parte inferior «Prueba de vista previa (no afecta al CLI)» sirve para probar el resultado primero
La API Key se guarda en el localStorage del navegador; al hacer clic en «Aplicar a CLI» también se puede escribir en
.env
Pruebas
python -m pytest -qPreguntas frecuentes
¿No sé programar / no quiero escribir comandos?: haz doble clic en
start-webui.bat; el script creará.env, instalará dependencias, iniciará el servicio y abrirá el navegador automáticamente, todo con el ratón¿Dónde se rellena la API Key?: después de clonar no hay
.env(el repositorio solo contiene la plantilla vacía.env.example). Al hacer doble clic en el script de inicio se genera.envautomáticamente; luego rellena la Key en la página web y haz clic en «Aplicar a CLI», o edita directamenteMIMO_API_KEYen.envDevuelve "API Key no configurada": configura
MIMO_API_KEYen.env(o rellénala directamente en el WebUI y haz clic en «Aplicar a CLI»)Formato de imagen no compatible: solo se admiten JPEG/PNG/GIF/WebP/BMP
Error "no se puede analizar" con entrada base64: asegúrate de que la entrada sea base64 válido y que el formato esté dentro de los admitidos
Tiempo de espera agotado en llamadas a herramientas MCP: ajusta
experimental.mcp_timeouta más de 120000ms
Licencia
Referencias
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityBmaintenanceBridges a vision model to enable text-only models like DeepSeek to describe images, extract text, and compare images via MCP tools.57910MIT
- FlicenseNot gradedqualityBmaintenanceEnables image understanding and OCR through Xiaomi's MiMo vision language model, providing tools for image description, Q&A, and text recognition via MCP. Supports both image URLs and local file paths.
- AlicenseAqualityBmaintenanceEnables non-multimodal models to see images by providing MCP tools for image understanding and OCR, backed by any OpenAI-compatible vision model.2MIT
- AlicenseAqualityCmaintenanceEnables text-only reasoning models to see images by wrapping vision-language models as MCP tools, supporting image description, OCR, chart analysis, and custom questioning within MCP-compatible IDEs.4MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Multimodal video analysis MCP — transcription, vision, and OCR for any video URL.
100+ MCP tools for AI agents: content metadata, trade intelligence, business-expertise analysis.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/mikulovesuki/mimo-vision-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server