Skip to main content
Glama

vision-bridge-mcp

Verleihen Sie Ihrem reinen Text-OpenCode-Agenten Augen.

OpenCodes reine Textmodelle (z. B. DeepSeek V4) können keine Bilder lesen – wenn Sie also einen Screenshot einer Fehlermeldung, eine Whiteboard-Skizze oder ein Foto eines UI-Entwurfs anhängen, hat der Agent keine Ahnung, was darauf zu sehen ist. vision-bridge-mcp ist ein kleiner MCP-Server, der sich direkt in OpenCode einfügt und ihm zwei neue Werkzeuge zur Verfügung stellt: analyze_image (allgemeine Beschreibung / visuelle Fragen & Antworten) und ocr_image (exakte Texttranskription), beide unterstützt von der Gemini-API (gemini-3.6-flash standardmäßig – überschreibbar mit GEMINI_MODEL, falls Google es später einstellt; aktuelle Modell-IDs finden Sie unter https://ai.google.dev/gemini-api/docs/models).

Ist es erst einmal konfiguriert, brauchen Sie dem Agenten nur noch zu sagen, er solle sich eine Datei ansehen:

Look at ./screenshots/error.png and tell me what's failing.

und er ruft selbstständig analyze_image auf – kein manuelles Kopieren und Einfügen in ein Chat-Fenster, kein separater CLI-Schritt.

Voraussetzungen

  • Node.js 18 oder höher

  • Ein kostenloser Gemini-API-Schlüssel – einen erhalten Sie unter https://aistudio.google.com/apikey (kostenlose Stufe: 1.500 Anfragen/Tag, keine Kreditkarte erforderlich)

Related MCP server: Vision MCP Server

Installation

Kein Klonen erforderlich. Fügen Sie Folgendes zu Ihrer OpenCode-Konfiguration hinzu (opencode.json im Projektstamm oder ~/.config/opencode/opencode.json für eine globale Einrichtung):

{
  "$schema": "https://opencode.ai/config.json",
  "mcp": {
    "vision-bridge": {
      "type": "local",
      "command": ["npx", "-y", "vision-bridge-mcp"],
      "environment": {
        "GEMINI_API_KEY": "your-api-key-here"
      }
    }
  }
}

Starten Sie OpenCode neu (oder führen Sie opencode mcp zum erneuten Verbinden aus), und die Werkzeuge analyze_image und ocr_image erscheinen automatisch. npx lädt das Paket beim ersten Ausführen herunter und speichert es zwischen – nichts muss von Hand erstellt oder installiert werden.

Ziehen Sie eine Umgebungsvariable vor, anstatt den Schlüssel in der Konfigurationsdatei fest zu kodieren? Setzen Sie stattdessen GEMINI_API_KEY in Ihrem Shell-Profil und entfernen Sie den Block "environment" – der Server liest ihn so oder so aus der Prozessumgebung.

Eigenständig ausführen (für Entwicklung oder Tests)

git clone https://github.com/YOUR_GITHUB_USERNAME/vision-bridge-mcp.git
cd vision-bridge-mcp
npm install
cp .env.example .env   # then fill in GEMINI_API_KEY
npm start

Der Server spricht MCP über stdio, also wartet er für sich allein nur darauf, dass sich ein Client (wie OpenCode) verbindet – das ist normal.

Werkzeuge

analyze_image

Allgemeines Bildverständnis. Geben Sie einen Pfad und optional eine benutzerdefinierte Eingabeaufforderung an.

Parameter

Erforderlich

Beschreibung

image_path

ja

Pfad zu einem lokalen Bild (absolut oder relativ zum Arbeitsverzeichnis von OpenCode)

prompt

nein

Benutzerdefinierte Anweisung. Standardmäßig eine entwicklerorientierte Beschreibung.

ocr_image

Transkribiert sichtbaren Text wörtlich – nützlich für Fehlerdialoge, Terminal-Screenshots oder abfotografierte Notizen.

Parameter

Erforderlich

Beschreibung

image_path

ja

Pfad zu einem lokalen Bild (absolut oder relativ zum Arbeitsverzeichnis von OpenCode)

Beide Werkzeuge unterstützen PNG, JPEG, WEBP, GIF und HEIC/HEIF, standardmäßig bis zu 20 MB.

Konfiguration

Die gesamte Konfiguration erfolgt über Umgebungsvariablen (setzen Sie sie direkt, in einer .env-Datei für den eigenständigen Gebrauch oder im Block "environment" Ihres opencode.json-MCP-Eintrags):

Variable

Erforderlich

Standard

Beschreibung

GEMINI_API_KEY

ja

Ihr Gemini-API-Schlüssel

GEMINI_MODEL

nein

gemini-3.6-flash

Ein beliebiges Gemini-Modell mit Vision-Unterstützung

VISION_BRIDGE_MAX_IMAGE_MB

nein

20

Bilder ablehnen, die größer sind als dieser Wert

Der Server startet auch ohne gesetztes GEMINI_API_KEY (damit opencode mcp die Werkzeuge weiterhin auflisten kann) – er meldet erst dann einen Fehler mit einer klaren Meldung, wenn ein Werkzeug tatsächlich ohne konfigurierten Schlüssel aufgerufen wird.

Fehlerbehandlung

Jeder Werkzeugaufruf endet entweder mit einem Textergebnis oder schlägt mit isError: true und einer spezifischen, umsetzbaren Meldung fehl – bei einer fehlenden Datei, einem nicht unterstützten Format, einer Datei über dem Größenlimit, einem fehlenden/ungültigen API-Schlüssel oder einem vorgelagerten Gemini-Fehler. Der Server stürzt bei einem fehlerhaften Aufruf nie ab.

Entwicklung

npm install
npm test    # unit tests (node's built-in test runner, no network needed)
npm run lint

Die Testsuite deckt Pfadauflösung, MIME-Typ-Erkennung und Dateivalidierung ab (fehlende Dateien, Verzeichnisse, leere Dateien, zu große Dateien) – also die Eingabeverarbeitungslogik, die im realen Einsatz am ehesten bricht. Der Gemini-API-Aufruf selbst wird hier nicht gemockt/getestet, da er einen echten Schlüssel erfordert; wenn Sie diesen Pfad überprüfen möchten, setzen Sie GEMINI_API_KEY und führen Sie npm start aus, und verbinden Sie sich dann mit einem beliebigen MCP-Client (oder dem MCP Inspector).

Veröffentlichung (Maintainer)

npm login
npm publish --access public

Erhöhen Sie zuerst die version in package.jsonnpx -y vision-bridge-mcp löst immer die neueste veröffentlichte Version auf.

Mitwirken

Siehe CONTRIBUTING.md.

Lizenz

MIT – siehe LICENSE.

Install Server
A
license - permissive license
D
quality
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • F
    license
    A
    quality
    Not graded
    maintenance
    Enables AI agents to analyze images through vision AI providers (Gemini, OpenAI, Claude), performing tasks like image description, object detection with bounding boxes, region-specific analysis, and precise color extraction without consuming context window with raw pixels.
    4
  • A
    license
    Not graded
    quality
    C
    maintenance
    Enables AI agents to analyze images using any OpenAI-compatible vision API, providing tools for image analysis, OCR, error diagnosis, diagram understanding, and chart analysis.
    MIT

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Generate images, GIFs, and PDFs from HTML, URLs, or templates — from your AI agent.

  • 15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/yanuadin/vision-bridge-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server