vision-bridge-mcp
vision-bridge-mcp
Verleihen Sie Ihrem reinen Text-OpenCode-Agenten Augen.
OpenCodes reine Textmodelle (z. B. DeepSeek V4) können keine Bilder lesen – wenn Sie also einen Screenshot einer Fehlermeldung, eine Whiteboard-Skizze oder ein Foto eines UI-Entwurfs anhängen, hat der Agent keine Ahnung, was darauf zu sehen ist. vision-bridge-mcp ist ein kleiner MCP-Server, der sich direkt in OpenCode einfügt und ihm zwei neue Werkzeuge zur Verfügung stellt: analyze_image (allgemeine Beschreibung / visuelle Fragen & Antworten) und ocr_image (exakte Texttranskription), beide unterstützt von der Gemini-API (gemini-3.6-flash standardmäßig – überschreibbar mit GEMINI_MODEL, falls Google es später einstellt; aktuelle Modell-IDs finden Sie unter https://ai.google.dev/gemini-api/docs/models).
Ist es erst einmal konfiguriert, brauchen Sie dem Agenten nur noch zu sagen, er solle sich eine Datei ansehen:
Look at ./screenshots/error.png and tell me what's failing.und er ruft selbstständig analyze_image auf – kein manuelles Kopieren und Einfügen in ein Chat-Fenster, kein separater CLI-Schritt.
Voraussetzungen
Node.js 18 oder höher
Ein kostenloser Gemini-API-Schlüssel – einen erhalten Sie unter https://aistudio.google.com/apikey (kostenlose Stufe: 1.500 Anfragen/Tag, keine Kreditkarte erforderlich)
Related MCP server: Vision MCP Server
Installation
Kein Klonen erforderlich. Fügen Sie Folgendes zu Ihrer OpenCode-Konfiguration hinzu (opencode.json im Projektstamm oder ~/.config/opencode/opencode.json für eine globale Einrichtung):
{
"$schema": "https://opencode.ai/config.json",
"mcp": {
"vision-bridge": {
"type": "local",
"command": ["npx", "-y", "vision-bridge-mcp"],
"environment": {
"GEMINI_API_KEY": "your-api-key-here"
}
}
}
}Starten Sie OpenCode neu (oder führen Sie opencode mcp zum erneuten Verbinden aus), und die Werkzeuge analyze_image und ocr_image erscheinen automatisch. npx lädt das Paket beim ersten Ausführen herunter und speichert es zwischen – nichts muss von Hand erstellt oder installiert werden.
Ziehen Sie eine Umgebungsvariable vor, anstatt den Schlüssel in der Konfigurationsdatei fest zu kodieren? Setzen Sie stattdessen
GEMINI_API_KEYin Ihrem Shell-Profil und entfernen Sie den Block"environment"– der Server liest ihn so oder so aus der Prozessumgebung.
Eigenständig ausführen (für Entwicklung oder Tests)
git clone https://github.com/YOUR_GITHUB_USERNAME/vision-bridge-mcp.git
cd vision-bridge-mcp
npm install
cp .env.example .env # then fill in GEMINI_API_KEY
npm startDer Server spricht MCP über stdio, also wartet er für sich allein nur darauf, dass sich ein Client (wie OpenCode) verbindet – das ist normal.
Werkzeuge
analyze_image
Allgemeines Bildverständnis. Geben Sie einen Pfad und optional eine benutzerdefinierte Eingabeaufforderung an.
Parameter | Erforderlich | Beschreibung |
| ja | Pfad zu einem lokalen Bild (absolut oder relativ zum Arbeitsverzeichnis von OpenCode) |
| nein | Benutzerdefinierte Anweisung. Standardmäßig eine entwicklerorientierte Beschreibung. |
ocr_image
Transkribiert sichtbaren Text wörtlich – nützlich für Fehlerdialoge, Terminal-Screenshots oder abfotografierte Notizen.
Parameter | Erforderlich | Beschreibung |
| ja | Pfad zu einem lokalen Bild (absolut oder relativ zum Arbeitsverzeichnis von OpenCode) |
Beide Werkzeuge unterstützen PNG, JPEG, WEBP, GIF und HEIC/HEIF, standardmäßig bis zu 20 MB.
Konfiguration
Die gesamte Konfiguration erfolgt über Umgebungsvariablen (setzen Sie sie direkt, in einer .env-Datei für den eigenständigen Gebrauch oder im Block "environment" Ihres opencode.json-MCP-Eintrags):
Variable | Erforderlich | Standard | Beschreibung |
| ja | — | Ihr Gemini-API-Schlüssel |
| nein |
| Ein beliebiges Gemini-Modell mit Vision-Unterstützung |
| nein |
| Bilder ablehnen, die größer sind als dieser Wert |
Der Server startet auch ohne gesetztes GEMINI_API_KEY (damit opencode mcp die Werkzeuge weiterhin auflisten kann) – er meldet erst dann einen Fehler mit einer klaren Meldung, wenn ein Werkzeug tatsächlich ohne konfigurierten Schlüssel aufgerufen wird.
Fehlerbehandlung
Jeder Werkzeugaufruf endet entweder mit einem Textergebnis oder schlägt mit isError: true und einer spezifischen, umsetzbaren Meldung fehl – bei einer fehlenden Datei, einem nicht unterstützten Format, einer Datei über dem Größenlimit, einem fehlenden/ungültigen API-Schlüssel oder einem vorgelagerten Gemini-Fehler. Der Server stürzt bei einem fehlerhaften Aufruf nie ab.
Entwicklung
npm install
npm test # unit tests (node's built-in test runner, no network needed)
npm run lintDie Testsuite deckt Pfadauflösung, MIME-Typ-Erkennung und Dateivalidierung ab (fehlende Dateien, Verzeichnisse, leere Dateien, zu große Dateien) – also die Eingabeverarbeitungslogik, die im realen Einsatz am ehesten bricht. Der Gemini-API-Aufruf selbst wird hier nicht gemockt/getestet, da er einen echten Schlüssel erfordert; wenn Sie diesen Pfad überprüfen möchten, setzen Sie GEMINI_API_KEY und führen Sie npm start aus, und verbinden Sie sich dann mit einem beliebigen MCP-Client (oder dem MCP Inspector).
Veröffentlichung (Maintainer)
npm login
npm publish --access publicErhöhen Sie zuerst die version in package.json – npx -y vision-bridge-mcp löst immer die neueste veröffentlichte Version auf.
Mitwirken
Siehe CONTRIBUTING.md.
Lizenz
MIT – siehe LICENSE.
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Tools
Related MCP Servers
- FlicenseAqualityNot gradedmaintenanceEnables AI agents to analyze images through vision AI providers (Gemini, OpenAI, Claude), performing tasks like image description, object detection with bounding boxes, region-specific analysis, and precise color extraction without consuming context window with raw pixels.4
- AlicenseAqualityDmaintenanceEnables AI agents to analyze images, extract text, compare images, and analyze video through any OpenAI-compatible vision model.455019MIT
- AlicenseAqualityAmaintenanceEnables text-only coding agents to analyze local images using a dedicated vision provider, returning markdown and structured JSON evidence for screenshots, diagrams, UI mockups, and error captures.1114711MIT
- AlicenseNot gradedqualityCmaintenanceEnables AI agents to analyze images using any OpenAI-compatible vision API, providing tools for image analysis, OCR, error diagnosis, diagram understanding, and chart analysis.MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Generate images, GIFs, and PDFs from HTML, URLs, or templates — from your AI agent.
15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/yanuadin/vision-bridge-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server