vision-bridge-mcp
vision-bridge-mcp
Dale ojos a tu agente OpenCode solo de texto.
Los modelos solo de texto de OpenCode (p. ej. DeepSeek V4) no pueden leer imágenes, así que si adjuntas una captura de pantalla de un error, un boceto de pizarra o una foto de un mockup de interfaz, el agente no tiene ni idea de lo que contiene. vision-bridge-mcp es un pequeño servidor MCP que se conecta directamente a OpenCode y le proporciona dos nuevas herramientas: analyze_image (descripción general / preguntas y respuestas visuales) y ocr_image (transcripción exacta de texto), ambas respaldadas por la API de Gemini (gemini-3.6-flash por defecto; puedes sobrescribirlo con GEMINI_MODEL si Google lo retira más adelante; consulta https://ai.google.dev/gemini-api/docs/models para ver los IDs de modelos actuales).
Una vez configurado, solo tienes que decirle al agente que mire un archivo:
Look at ./screenshots/error.png and tell me what's failing.y él mismo llamará a analyze_image — sin copiar y pegar manualmente en una ventana de chat, sin pasos adicionales de CLI.
Requisitos
Node.js 18 o superior
Una clave de API de Gemini gratuita — consíguela en https://aistudio.google.com/apikey (plan gratuito: 1.500 solicitudes/día, sin necesidad de tarjeta de crédito)
Related MCP server: Vision MCP Server
Instalación
No es necesario clonar el repositorio. Añade esto a tu configuración de OpenCode (opencode.json en la raíz de tu proyecto, o ~/.config/opencode/opencode.json para una configuración global):
{
"$schema": "https://opencode.ai/config.json",
"mcp": {
"vision-bridge": {
"type": "local",
"command": ["npx", "-y", "vision-bridge-mcp"],
"environment": {
"GEMINI_API_KEY": "your-api-key-here"
}
}
}
}Reinicia OpenCode (o ejecuta opencode mcp para reconectar) y las herramientas analyze_image y ocr_image aparecerán automáticamente. npx descarga y almacena en caché el paquete la primera vez que se ejecuta — no hay nada que compilar ni instalar manualmente.
¿Prefieres una variable de entorno en lugar de codificar la clave en el archivo de configuración? Establece
GEMINI_API_KEYen tu perfil de shell y elimina el bloque"environment"— el servidor la leerá del entorno del proceso de cualquier forma.
Ejecutarlo de forma independiente (para desarrollo o pruebas)
git clone https://github.com/YOUR_GITHUB_USERNAME/vision-bridge-mcp.git
cd vision-bridge-mcp
npm install
cp .env.example .env # then fill in GEMINI_API_KEY
npm startEl servidor habla MCP sobre stdio, así que por sí solo se queda esperando a que un cliente (como OpenCode) se conecte — eso es lo esperado.
Herramientas
analyze_image
Comprensión de imágenes de propósito general. Dale una ruta y, opcionalmente, un prompt personalizado.
Parámetro | Obligatorio | Descripción |
| sí | Ruta a una imagen local (absoluta, o relativa al directorio de trabajo actual de OpenCode) |
| no | Instrucción personalizada. Por defecto, una descripción centrada en el desarrollador. |
ocr_image
Transcribe el texto visible tal cual — útil para diálogos de error, capturas de terminal o notas fotografiadas.
Parámetro | Obligatorio | Descripción |
| sí | Ruta a una imagen local (absoluta, o relativa al directorio de trabajo actual de OpenCode) |
Ambas herramientas admiten PNG, JPEG, WEBP, GIF y HEIC/HEIF, hasta 20MB por defecto.
Configuración
Toda la configuración se realiza mediante variables de entorno (establécelas directamente, en un archivo .env para uso independiente, o en el bloque "environment" de tu entrada MCP en opencode.json):
Variable | Obligatorio | Valor por defecto | Descripción |
| sí | — | Tu clave de API de Gemini |
| no |
| Cualquier modelo de Gemini con soporte de visión |
| no |
| Rechaza imágenes más grandes que este tamaño |
El servidor se inicia incluso sin GEMINI_API_KEY configurada (para que opencode mcp pueda seguir listando las herramientas) — solo da error, con un mensaje claro, en el momento en que se llama a una herramienta sin tener una clave configurada.
Manejo de errores
Cada llamada a una herramienta o bien tiene éxito con un resultado de texto, o bien falla con isError: true y un mensaje específico y accionable — un archivo inexistente, un formato no compatible, un archivo que supera el límite de tamaño, una clave de API faltante o inválida, o un error de la API de Gemini. El servidor nunca se bloquea ante una llamada incorrecta.
Desarrollo
npm install
npm test # unit tests (node's built-in test runner, no network needed)
npm run lintLa suite de pruebas cubre la resolución de rutas, la detección de tipos MIME y la validación de archivos (archivos inexistentes, directorios, archivos vacíos, archivos sobredimensionados) — la lógica de manejo de entrada con más probabilidad de fallar en el uso real. La llamada a la API de Gemini en sí no está simulada ni probada aquí, ya que requiere una clave activa; si quieres verificar esa parte, establece GEMINI_API_KEY y ejecuta npm start, y luego conéctate con cualquier cliente MCP (o el MCP Inspector).
Publicación (mantenedores)
npm login
npm publish --access publicPrimero incrementa la version en package.json — npx -y vision-bridge-mcp siempre se resuelve a la última versión publicada.
Contribuciones
Consulta CONTRIBUTING.md.
Licencia
MIT — consulta LICENSE.
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Tools
Related MCP Servers
- FlicenseAqualityNot gradedmaintenanceEnables AI agents to analyze images through vision AI providers (Gemini, OpenAI, Claude), performing tasks like image description, object detection with bounding boxes, region-specific analysis, and precise color extraction without consuming context window with raw pixels.4
- AlicenseAqualityDmaintenanceEnables AI agents to analyze images, extract text, compare images, and analyze video through any OpenAI-compatible vision model.455019MIT
- AlicenseAqualityAmaintenanceEnables text-only coding agents to analyze local images using a dedicated vision provider, returning markdown and structured JSON evidence for screenshots, diagrams, UI mockups, and error captures.1114711MIT
- AlicenseNot gradedqualityCmaintenanceEnables AI agents to analyze images using any OpenAI-compatible vision API, providing tools for image analysis, OCR, error diagnosis, diagram understanding, and chart analysis.MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Generate images, GIFs, and PDFs from HTML, URLs, or templates — from your AI agent.
15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/yanuadin/vision-bridge-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server