Vision MCP
Vision MCP
Permite que los LLM sin capacidad visual (como GLM) también puedan procesar imágenes en Claude Code / Codex.
Cómo funciona
Cuando el modelo principal encuentra una imagen, llama a la herramienta describe_image proporcionada por este MCP:
La herramienta lee el archivo de imagen local
Llama al modelo de visión que hayas configurado (Qwen-VL / GPT-4o / GLM-4V / Doubao o cualquier interfaz compatible con OpenAI)
Devuelve la descripción textual al modelo principal
El modelo principal continúa el razonamiento basándose en el texto
El modelo principal nunca toca el binario de la imagen, por lo que los modelos de solo texto también pueden usarlo.
El proyecto tiene cero dependencias de terceros (solo biblioteca estándar de Python), funciona con Python 3.8+ y no requiere instalación con pip.
Related MCP server: Image-Vision MCP Server
Instalación con un clic
git clone https://github.com/Ruiba0/Vision-MCP.git
cd vision-mcp
python3 install.pyEn Windows no existe el comando
python3, usapython install.py; lo mismo aplica para todos lospython3a continuación.
El script de instalación completará de forma interactiva:
Te permite introducir la URL base / nombre del modelo / clave API del modelo de visión (con referencia de proveedores comunes)
Registra el MCP en Claude Code (
claude mcp add)Registra el MCP en Codex (escribe en
~/.codex/config.toml)Añade reglas de procesamiento de imágenes en
~/.claude/CLAUDE.mdy~/.codex/AGENTS.md
El script es idempotente y se puede ejecutar repetidamente.
Instalación manual
Si no quieres usar el script de instalación:
Configura el modelo de visión
Copia
config.example.jsoncomoconfig.jsone introduce la configuración de tu modelo de visión:{ "vision_api_base": "https://dashscope.aliyuncs.com/compatible-mode/v1", "vision_model": "qwen-vl-max", "vision_api_key": "sk-你的key", "max_image_bytes": 10485760 }Regístrate en Claude Code
claude mcp add --scope user vision -- python3 /绝对路径/server.pyAñade
--scope userpara que esté disponible globalmente (si no lo añades, solo tendrá efecto en el directorio actual).Regístrate en Codex
Edita
~/.codex/config.tomly añade:[mcp_servers.vision] command = "python3" args = ["/绝对路径/server.py"]Añade reglas de procesamiento de imágenes
Añade el siguiente contenido en
~/.claude/CLAUDE.mdy~/.codex/AGENTS.md(para que el modelo principal llame activamente a la herramienta cuando encuentre imágenes):## 图片处理 当用户提到图片文件路径(.png/.jpg/.jpeg/.gif/.webp/.bmp),或要求查看/分析/识别某个图片文件时: - 先判断当前主模型自身是否具备视觉能力 - 具备视觉(如 Claude Sonnet/Opus、GPT-4o、Qwen-VL 等多模态模型)→ 直接读取图片并分析 - 不具备视觉(如 GLM 等纯文本模型)→ 调用 vision MCP 的 describe_image 工具,传入图片路径和问题 - 不确定自身是否支持视觉时,默认调用 describe_image 工具作为兜底 - 用户明确要求"用 MCP 看"或"调视觉模型"时,无论主模型是否支持视觉,都调用 describe_image 工具
Modelos de visión compatibles
Se puede usar cualquier modelo de visión compatible con el protocolo de OpenAI:
Plataforma | vision_api_base | vision_model |
Qwen-VL (阿里 DashScope) |
|
|
GLM-4V (智谱) |
|
|
GPT-4o (OpenAI) |
|
|
Doubao (火山引擎) |
|
|
Si necesitas usar el protocolo nativo de Anthropic (como Claude), debes modificar vision_client.py por tu cuenta; actualmente solo se admite el protocolo compatible con OpenAI.
Cómo usar
Después de la instalación, reinicia Claude Code / Codex y en la conversación:
"Ve a ~/Desktop/diagram.png y mira esta imagen"
"Analiza el error en ~/Screenshots/error.jpg"
"Reconoce todo el texto en ~/Documents/notes/page1.jpeg"
(En Windows, la ruta tiene la forma D:/temp/diagram.png, escríbela según tu sistema)
El modelo principal llamará automáticamente a la herramienta describe_image, que devuelve la descripción textual del modelo de visión, y el modelo principal continúa respondiendo basándose en la descripción.
Parámetros de la herramienta
describe_image(path: str, question: str = "详细描述这张图片的内容") -> str
path: ruta absoluta del archivo de imagen, admite png/jpg/jpeg/gif/webp/bmpquestion: la pregunta que quieres hacer al modelo de visión, se puede ajustar según el escenario ("reconocer texto", "describir el diseño", "analizar gráficos", etc.)
Estructura del proyecto
vision-mcp/
├── server.py # MCP 服务(内置 stdio JSON-RPC 实现,无 SDK 依赖)
├── vision_client.py # 视觉模型调用(OpenAI 兼容协议,urllib 实现)
├── config.example.json # 配置模板(提交到 git)
├── config.json # 你的实际配置(gitignored)
├── install.py # 一键安装脚本
└── README.mdPreguntas frecuentes
P: La llamada reporta 视觉模型连接失败
Comprueba si la ruta de vision_api_base es correcta. La herramienta añade /chat/completions después de la URL base, así que la URL base no debe llevar el sufijo /chat/completions.
P: La llamada reporta HTTP 401
La clave API no es válida o no tienes permiso para ese modelo. Comprueba si vision_api_key y vision_model coinciden con la plataforma correspondiente.
P: El modelo principal no llama a la herramienta automáticamente
Confirma que las reglas de procesamiento de imágenes en CLAUDE.md / AGENTS.md se han añadido. Las palabras clave de las reglas (imagen, ver, analizar) guiarán al modelo principal para que llame a describe_image.
P: Quiero cambiar el modelo de visión
Edita config.json y modifica los tres campos; no necesitas tocar el código. O vuelve a ejecutar python3 install.py para reconfigurar.
Dependencias
Python 3.8+ (solo biblioteca estándar, no es necesario instalar ningún paquete con pip)
Licencia
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceEnables text-only LLMs to analyze images by routing them to an OpenAI-compatible vision backend, supporting local files, URLs, and data URLs.34MIT
- FlicenseNot gradedqualityCmaintenanceEnables text-only language models to 'see' and describe images by calling multimodal APIs (OpenAI, Anthropic) for image analysis.
- FlicenseNot gradedqualityCmaintenanceEnables text-only models to perceive images via a vision-language model, supporting image analysis with simple descriptions or structured JSON for technical diagrams.
- AlicenseNot gradedqualityCmaintenanceEnables text-only LLMs to understand images by converting them into text descriptions, supporting multiple vision backends like cloud APIs, local models, and OCR engines.1MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
LLM chat, text summarization and AI image generation
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Ruiba0/Vision-MCP'
If you have feedback or need assistance with the MCP directory API, please join our Discord server