ollama-vision-mcp
ollama-vision-mcp
Englisch · 中文
Ein minimaler Brückendienst, der lokale Bildverarbeitungsfunktionen für VS Code Copilot mit reinen Textmodellen (z. B. DeepSeek) bereitstellt.
Wenn Copilot ein reines Textmodell verwendet, kann es Bilder nicht direkt „sehen“. Dieser MCP-Server schließt diese Lücke: Sie legen einen Screenshot in einen Ordner; Copilot liest das Bild über diese Brücke → sendet es an ein lokales Ollama-Vision-Modell → erhält eine Textbeschreibung zurück, die das reine Textmodell verstehen kann.
VS Code Copilot Chat (Agent mode, text-only model)
│ MCP stdio
▼
ollama-vision-mcp (this package)
│ Read local image → base64 → POST /v1/chat/completions
▼
Ollama (local vision model, e.g., qwen2.5vl:7b)Tools
Tool | Parameter | Beschreibung |
|
| Liest ein Bild und erzeugt eine Textbeschreibung. |
|
| Listet Bilddateien auf, die zum Lesen verfügbar sind. |
|
| Extrahiert Text aus dem Bild per OCR. |
| — | Zeigt die aktuelle Konfiguration, den Ollama-Verbindungsstatus und die Liste der verfügbaren Modelle an. |
Related MCP server: Hybrid Vision MCP Server
Umfang dieses Tools
Dieses Paket ist nur eine Brückenschicht. Es kommuniziert mit Ollama ausschließlich über HTTP (OpenAI-kompatible /v1/chat/completions und /v1/models).
Es übernimmt nicht:
Installation von Ollama, Start von
ollama serve, Herunterladen von Modellen oder Verwaltung der Modellkonfiguration;Zugriff auf die Zwischenablage, interne IDE-Mechanismen oder andere Netzwerkdienste als Ihr lokales Ollama.
Sie sind vollständig für die Installation von Ollama und das Herunterladen von Modellen verantwortlich (siehe Voraussetzungen).
Voraussetzungen
Sie müssen Folgendes selbst einrichten:
Python 3.10+
Ollama installiert und ausgeführt:
ollama serveMindestens ein Vision-Modell heruntergeladen; empfohlen:
bash
ollama pull qwen2.5vl:7bWeitere Optionen:
qwen3-vl:8b,gemma3:12b,llama3.2-vision:11b,llava:7b. Wählen Sie ein für Ihre GPU geeignetes Modell; geben Sie es später über die UmgebungsvariableVISION_MCP_MODELan.
🚀 Schnellinstallation (Empfohlen)
Führen Sie einen einzigen Befehl im Repository-Stammverzeichnis aus, um Installation und Konfiguration abzuschließen:
bash
cd ollama-vision-mcp
python setup_mcp.pyDas Skript wird automatisch:
Eine dedizierte virtuelle Umgebung (
.venv) erstellen und dieses Paket installieren (ohne die globale Umgebung zu beeinträchtigen).Den lokalen Ollama-Dienst erkennen und die verfügbaren Vision-Modelle auflisten.
Sie interaktiv durch die Einstellung von
base_url,model,inbox,max_tokens, Bildkomprimierung und einem optionalen API-Schlüssel führen.Die Konfiguration in die Projektdatei
.vscode/mcp.jsonund/oder die benutzerweite globale MCP-Datei (%APPDATA%\Code\User\mcp.json) schreiben, zusammengeführt mit vorhandenen Einstellungen, ohne Ihre anderen MCP-Server zu überschreiben.
Nicht-interaktive Nutzung (geeignet für CI/Skripte):
bash
python setup_mcp.py --yes --project --model qwen2.5vl:7b
python setup_mcp.py --print # Only prints the config JSON, does not write to fileNach der Installation laden Sie das Fenster in VS Code neu (Strg+Umschalt+P → „Developer: Reload Window“), damit die Konfiguration wirksam wird.
Wenn Sie es bereits ausgeführt haben, können Sie es auch einfach mit dem Befehl
ollama-vision-setupneu konfigurieren.
Installation überprüfen
Geben Sie in VS Code Copilot Chat (Agent-Modus) ein:
text
Run vision_statusWenn das zurückgegebene JSON "ollama": { "ok": true, ... } und die Modellliste enthält, ist die Verbindung erfolgreich.
Wenn ok falsch ist, starten Sie zuerst Ollama (ollama serve) und versuchen Sie es erneut.
Verwendung
Legen Sie Screenshots in das Inbox-Verzeichnis des Projekts (Standard:
.ai/inbox). Der Server erstellt dieses Verzeichnis bei Bedarf automatisch.Stellen Sie eine Frage in Copilot Chat, zum Beispiel:
„Schauen Sie sich die Screenshots im Posteingang an und sagen Sie mir, worum es bei diesem Fehler geht.“
Der Agent ruft automatisch
list_images→describe_imageauf und antwortet basierend auf der Textbeschreibung.
Den Agenten intelligenter machen (optional): Kopieren Sie die vorgefertigte Anweisungsdatei .github/instructions/ollama-vision/vision-tools.instructions.md in denselben Pfad in Ihrem Projekt. Sie vermittelt dem Agenten den vollständigen Vision-Workflow – Aufrufreihenfolge (list_images → describe_image → extract_text), Modusauswahl, Fehlerbehebung und Anleitung, Screenshots in den Posteingang zu legen. Als VS-Code-Dateianweisung wird sie bei Bedarf immer dann erkannt, wenn die Aufgabe Bilder betrifft, und funktioniert daher ohne Einrichtung sofort.
Referenz der Umgebungsvariablen
Variable | Standard | Beschreibung |
|
| OpenAI-kompatible Basis-URL von Ollama |
|
| Zu verwendendes Vision-Modell |
| leer (verwendet tatsächlich | API-Schlüssel (von Ollama ignoriert) |
|
| Standardverzeichnis für |
|
| Maximale Ausgabetokens für das Vision-Modell |
|
| Wenn Bild > 50 KB, automatisch auf 768px JPEG skalieren |
|
| Denken für Denkmodelle aktiviert lassen ( |
Kompatibilitäts-Aliasse: VISION_MODEL, VISION_BASE_URL, VISION_INBOX, VISION_API_KEY
Manuelle Installation (Alternative)
Wenn Sie die volle manuelle Kontrolle über jeden Schritt benötigen, beachten Sie den folgenden Ablauf.
1. Umgebung erstellen und installieren
bash
cd ollama-vision-mcp
python -m venv .venv
.venv\Scripts\activate # Windows
# source .venv/bin/activate # macOS / Linux
pip install -e .Nach der Installation erhalten Sie zwei Befehle:
ollama-vision-mcp— startet den MCP-Serverollama-vision-setup— interaktive Konfigurationsabkürzung
2. Bei VS Code registrieren
Kopieren Sie Folgendes in die .vscode/mcp.json Ihres Projekts (nur Projekt) oder in die benutzerweite Datei %APPDATA%\Code\User\mcp.json (alle Projekte). Stellen Sie sicher, dass Sie command auf den absoluten Pfad des Python-Interpreters Ihrer virtuellen Umgebung ändern:
json
{
"servers": {
"ollama-vision": {
"type": "stdio",
"command": "D:/MyRepos/ollama-vision-mcp/.venv/Scripts/python.exe",
"args": ["-m", "ollama_vision_mcp"],
"env": {
"VISION_MCP_BASE_URL": "http://localhost:11434/v1",
"VISION_MCP_MODEL": "qwen2.5vl:7b",
"VISION_MCP_INBOX": ".ai/inbox"
}
}
}
}⚠️
commandmuss der absolute Pfad zum Python-Interpreter innerhalb der virtuellen Umgebung sein. Sie können auchollama-vision-setup --projectausführen, um diese Datei automatisch zu generieren. Der Server verwendet beim Aufrufos.getcwd(), daher werden relative Pfade (wiepathund das Inbox-Verzeichnis) relativ zum Projektstamm aufgelöst, in dem der Server gestartet wird.
Rauchtest
Führen Sie das folgende Skript aus, um die Ollama-Konnektivität zu überprüfen, den Inhalt des Posteingangs aufzulisten und einen echten Vision-Aufruf für das erste Bild durchzuführen:
bash
python examples/smoke_test.pyLizenz
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseAqualityCmaintenanceMCP server enabling LLM clients without vision capability to process images by delegating to local Ollama vision models. Supports describing images, OCR, asking questions, and processing clipboard images.4
- FlicenseNot gradedqualityBmaintenanceBridges local vision engines (Tesseract.js OCR and Sharp preprocessing) with Ollama vision models for image analysis, comparison, text localization, and browser screenshot annotation over MCP-compliant HTTP/SSE transports.
- AlicenseNot gradedqualityBmaintenanceMCP server for local Ollama vision analysis, enabling text-only agents like Claude Code to inspect images via a single tool. Processes images locally with Ollama, keeping image bytes on the machine and returning text reports.2MIT
- AlicenseAqualityBmaintenanceProvides vision understanding capabilities such as image analysis, OCR, object localization, and video frame analysis, plus optional image generation and editing, to coding agents via OpenAI-compatible multimodal models. Runs as a local MCP server with HTTP and stdio transports, configurable for clients like Codex, Claude Code, Kimi, and Cursor.3187MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
A comprehensive Model Context Protocol (MCP) server that enables AI assistants to interact with yo…
MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/masterLazy/ollama-vision-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server