Vision MCP
Vision MCP
Ermöglicht LLMs ohne visuelle Fähigkeiten (wie GLM), Bilder in Claude Code / Codex zu verarbeiten.
Funktionsweise
Wenn das Hauptmodell auf ein Bild stößt, ruft es das von diesem MCP bereitgestellte Tool describe_image auf:
Das Tool liest die lokale Bilddatei
Es ruft das von dir konfigurierte Vision-Modell auf (Qwen-VL / GPT-4o / GLM-4V / Doubao oder jede beliebige OpenAI-kompatible Schnittstelle)
Es gibt eine Textbeschreibung an das Hauptmodell zurück
Das Hauptmodell setzt seine Überlegungen auf der Grundlage des Texts fort
Das Hauptmodell kommt während des gesamten Ablaufs nicht mit den Binärdaten des Bilds in Berührung, sodass es auch von reinen Textmodellen verwendet werden kann.
Das Projekt hat keinerlei Drittanbieter-Abhängigkeiten (reine Python-Standardbibliothek), läuft ab Python 3.8+ und benötigt keine pip-Installation.
Related MCP server: Image-Vision MCP Server
Ein-Klick-Installation
git clone https://github.com/Ruiba0/Vision-MCP.git
cd vision-mcp
python3 install.pyUnter Windows gibt es keinen
python3-Befehl; verwende stattdessenpython install.py. Das Gleiche gilt für allepython3-Befehle weiter unten.
Das Installationsskript führt die folgenden Schritte interaktiv durch:
Lässt dich die Base-URL / den Modellnamen / den API-Key des Vision-Modells eintragen (mit Referenzen zu gängigen Anbietern)
Registriert das MCP bei Claude Code (
claude mcp add)Registriert das MCP bei Codex (schreibt in
~/.codex/config.toml)Fügt Bildverarbeitungsregeln in
~/.claude/CLAUDE.mdund~/.codex/AGENTS.mdhinzu
Das Skript ist idempotent und kann wiederholt ausgeführt werden.
Manuelle Installation
Wenn du das Installationsskript nicht verwenden möchtest:
Vision-Modell konfigurieren
Kopiere
config.example.jsonzuconfig.jsonund trage deine Vision-Modell-Konfiguration ein:{ "vision_api_base": "https://dashscope.aliyuncs.com/compatible-mode/v1", "vision_model": "qwen-vl-max", "vision_api_key": "sk-你的key", "max_image_bytes": 10485760 }Bei Claude Code registrieren
claude mcp add --scope user vision -- python3 /绝对路径/server.pyFüge
--scope userhinzu, um es global verfügbar zu machen (ohne den Parameter gilt es nur im aktuellen Verzeichnis).Bei Codex registrieren
Bearbeite
~/.codex/config.tomlund füge Folgendes hinzu:[mcp_servers.vision] command = "python3" args = ["/绝对路径/server.py"]Bildverarbeitungsregeln hinzufügen
Füge in
~/.claude/CLAUDE.mdund~/.codex/AGENTS.mdden folgenden Inhalt hinzu (damit das Hauptmodell bei Bildern proaktiv das Tool aufruft):## 图片处理 当用户提到图片文件路径(.png/.jpg/.jpeg/.gif/.webp/.bmp),或要求查看/分析/识别某个图片文件时: - 先判断当前主模型自身是否具备视觉能力 - 具备视觉(如 Claude Sonnet/Opus、GPT-4o、Qwen-VL 等多模态模型)→ 直接读取图片并分析 - 不具备视觉(如 GLM 等纯文本模型)→ 调用 vision MCP 的 describe_image 工具,传入图片路径和问题 - 不确定自身是否支持视觉时,默认调用 describe_image 工具作为兜底 - 用户明确要求"用 MCP 看"或"调视觉模型"时,无论主模型是否支持视觉,都调用 describe_image 工具
Unterstützte Vision-Modelle
Jedes Vision-Modell, das mit dem OpenAI-Protokoll kompatibel ist, kann verwendet werden:
Plattform | vision_api_base | vision_model |
Qwen-VL (Alibaba DashScope) |
|
|
GLM-4V (Zhipu AI) |
|
|
GPT-4o (OpenAI) |
|
|
Doubao (Volcano Engine) |
|
|
Wenn du das native Anthropic-Protokoll verwenden möchtest (z. B. Claude), musst du vision_client.py selbst anpassen; derzeit wird nur das OpenAI-kompatible Protokoll unterstützt.
Verwendung
Starte Claude Code / Codex nach der Installation neu. In der Konversation kannst du dann zum Beispiel:
„Sieh dir das Bild unter ~/Desktop/diagram.png an"
„Analysiere den Fehler in ~/Screenshots/error.jpg"
„Erkenne den gesamten Text in ~/Documents/notes/page1.jpeg"
(Auf Windows sehen Pfade zum Beispiel so aus: D:/temp/diagram.png – schreibe sie passend zu deinem System.)
Das Hauptmodell ruft automatisch das Tool describe_image auf; das Tool gibt die Textbeschreibung des Vision-Modells zurück, und das Hauptmodell antwortet auf dieser Grundlage weiter.
Tool-Parameter
describe_image(path: str, question: str = "详细描述这张图片的内容") -> str
path: absoluter Pfad zur Bilddatei; unterstützt werden png/jpg/jpeg/gif/webp/bmpquestion: die Frage, die du dem Vision-Modell stellen möchtest; je nach Szenario anpassbar („Text erkennen", „Layout beschreiben", „Diagramme analysieren" usw.)
Projektstruktur
vision-mcp/
├── server.py # MCP 服务(内置 stdio JSON-RPC 实现,无 SDK 依赖)
├── vision_client.py # 视觉模型调用(OpenAI 兼容协议,urllib 实现)
├── config.example.json # 配置模板(提交到 git)
├── config.json # 你的实际配置(gitignored)
├── install.py # 一键安装脚本
└── README.mdFAQ
F: Beim Aufruf erscheint 视觉模型连接失败
Überprüfe, ob der Pfad von vision_api_base korrekt ist. Das Tool hängt /chat/completions an die Base-URL an; die Base-URL sollte daher keinen /chat/completions-Suffix enthalten.
F: Beim Aufruf erscheint HTTP 401
Der API-Key ist ungültig oder du hast keine Berechtigung für dieses Modell. Überprüfe, ob vision_api_key und vision_model zur jeweiligen Plattform passen.
F: Das Hauptmodell ruft das Tool nicht proaktiv auf
Stelle sicher, dass die Bildverarbeitungsregeln in CLAUDE.md / AGENTS.md hinzugefügt wurden. Die Schlüsselwörter in den Regeln (Bild, Ansehen, Analysieren) leiten das Hauptmodell dazu, describe_image aufzurufen.
F: Ich möchte das Vision-Modell wechseln
Bearbeite einfach config.json und ändere die drei Felder; der Code muss nicht angefasst werden. Oder führe python3 install.py erneut aus, um neu zu konfigurieren.
Abhängigkeiten
Python 3.8+ (reine Standardbibliothek; es müssen keine Pakete per pip installiert werden)
Lizenz
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceEnables text-only LLMs to analyze images by routing them to an OpenAI-compatible vision backend, supporting local files, URLs, and data URLs.34MIT
- FlicenseNot gradedqualityCmaintenanceEnables text-only language models to 'see' and describe images by calling multimodal APIs (OpenAI, Anthropic) for image analysis.
- FlicenseNot gradedqualityCmaintenanceEnables text-only models to perceive images via a vision-language model, supporting image analysis with simple descriptions or structured JSON for technical diagrams.
- AlicenseNot gradedqualityCmaintenanceEnables text-only LLMs to understand images by converting them into text descriptions, supporting multiple vision backends like cloud APIs, local models, and OCR engines.1MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
LLM chat, text summarization and AI image generation
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Ruiba0/Vision-MCP'
If you have feedback or need assistance with the MCP directory API, please join our Discord server