ollama-vision-mcp
ollama-vision-mcp
English · 中文
テキストのみのモデル(例: DeepSeek)を使用するVS Code Copilotにローカルビジョン機能を提供する最小限のブリッジサービスです。
Copilotがテキストのみのモデルを使用する場合、画像を直接「見る」ことはできません。このMCPサーバーがそのギャップを埋めます: スクリーンショットをフォルダにドロップすると、Copilotはこのブリッジを介して画像を読み取り、ローカルのOllamaビジョンモデルに送信し、テキストによる説明を受け取ります。これにより、テキストのみのモデルでも理解できるようになります。
VS Code Copilot Chat (Agent mode, text-only model)
│ MCP stdio
▼
ollama-vision-mcp (this package)
│ Read local image → base64 → POST /v1/chat/completions
▼
Ollama (local vision model, e.g., qwen2.5vl:7b)ツール
ツール | パラメーター | 説明 |
|
| 画像を読み取り、テキストによる説明を生成します。 |
|
| 読み取り可能な画像ファイルを一覧表示します。 |
|
| OCRを使用して画像からテキストを抽出します。 |
| — | 現在の設定、Ollamaの接続状態、利用可能なモデルの一覧を表示します。 |
Related MCP server: Hybrid Vision MCP Server
このツールの対象範囲
このパッケージはブリッジ層のみです。Ollamaとは純粋にHTTP(OpenAI互換の/v1/chat/completionsおよび/v1/models)で通信します。
以下は処理しません:
Ollamaのインストール、
ollama serveの起動、モデルのプル、モデル設定の管理;クリップボードへのアクセス、IDEの内部メカニズム、ローカルのOllama以外のネットワークサービスへのアクセス。
Ollamaのインストールとモデルのプルはすべてお客様の責任で行ってください(前提条件を参照)。
前提条件
以下はご自身でセットアップする必要があります:
Python 3.10+
Ollamaがインストールされ、実行されていること:
ollama serve少なくとも1つのビジョンモデルがプルされていること。推奨:
bash
ollama pull qwen2.5vl:7b他のオプション:
qwen3-vl:8b,gemma3:12b,llama3.2-vision:11b,llava:7b。 GPUに適したモデルを選択し、後でVISION_MCP_MODEL環境変数で指定してください。
🚀 クイックインストール(推奨)
リポジトリのルートで1つのコマンドを実行するだけで、インストールと設定が完了します:
bash
cd ollama-vision-mcp
python setup_mcp.pyスクリプトは自動的に以下を行います:
専用の仮想環境(
.venv)を作成し、このパッケージをインストールします(グローバル環境を汚しません)。ローカルのOllamaサービスを検出し、利用可能なビジョンモデルを一覧表示します。
対話形式で
base_url、model、inbox、max_tokens、画像圧縮、オプションのAPIキーを設定するように案内します。設定をプロジェクトの
.vscode/mcp.jsonおよび/またはユーザーレベルのグローバルMCPファイル(%APPDATA%\Code\User\mcp.json)に書き込みます。既存の設定とマージし、他のMCPサーバーを上書きしません。
非対話型の使用法(CI/スクリプト向け):
bash
python setup_mcp.py --yes --project --model qwen2.5vl:7b
python setup_mcp.py --print # Only prints the config JSON, does not write to fileインストール後、VS Codeでウィンドウの再読み込み(Ctrl+Shift+P → 「開発者: ウィンドウの再読み込み」)を行って設定を有効にしてください。
以前に実行したことがある場合は、
ollama-vision-setupコマンドを使用するだけで再設定できます。
インストールの確認
VS Code Copilot Chat(エージェントモード)で、次のように入力します:
text
Run vision_status返されたJSONに"ollama": { "ok": true, ... }とモデルリストが含まれていれば、接続は成功です。
okがfalseの場合は、まずOllama(ollama serve)を起動してから再試行してください。
使用方法
スクリーンショットをプロジェクトのインボックスディレクトリ(デフォルトは
.ai/inbox)に置きます。必要に応じてサーバーがこのディレクトリを自動的に作成します。Copilot Chatで質問してください。例:
「インボックスのスクリーンショットを見て、このエラーが何に関するものか教えてください。」
エージェントは自動的に
list_images→describe_imageを呼び出し、テキストによる説明に基づいて回答します。
エージェントを賢くする(オプション): 既製の指示ファイル.github/instructions/ollama-vision/vision-tools.instructions.mdをプロジェクト内の同じパスにコピーします。これにより、エージェントに完全なビジョンワークフロー(呼び出し順序(list_images → describe_image → extract_text)、モード選択、トラブルシューティング、スクリーンショットをインボックスにドロップするように案内する方法)を教えることができます。VS Codeのファイル指示として、画像を扱うタスクのたびにオンデマンドで検出されるため、セットアップ不要ですぐに機能します。
環境変数リファレンス
変数 | デフォルト | 説明 |
|
| OllamaのOpenAI互換ベースURL |
|
| 使用するビジョンモデル |
| empty (actually uses | APIキー(Ollamaでは無視されます) |
|
|
|
|
| ビジョンモデルの最大出力トークン数 |
|
| 画像が50KBを超える場合、自動的に768pxのJPEGにリサイズします |
|
| 推論モデルでは思考を有効に保ち( |
互換性エイリアス: VISION_MODEL、VISION_BASE_URL、VISION_INBOX、VISION_API_KEY。
手動インストール(代替)
各手順を完全に手動で制御する必要がある場合は、以下のプロセスを参照してください。
1. 環境を作成してインストール
bash
cd ollama-vision-mcp
python -m venv .venv
.venv\Scripts\activate # Windows
# source .venv/bin/activate # macOS / Linux
pip install -e .インストール後、次の2つのコマンドが利用できます:
ollama-vision-mcp— MCPサーバーを起動ollama-vision-setup— 対話型設定のショートカット
2. VS Codeに登録
以下をプロジェクトの.vscode/mcp.json(プロジェクトのみ)またはユーザーレベルのファイル%APPDATA%\Code\User\mcp.json(すべてのプロジェクト)にコピーします。commandを仮想環境のPythonインタープリターの絶対パスに変更してください:
json
{
"servers": {
"ollama-vision": {
"type": "stdio",
"command": "D:/MyRepos/ollama-vision-mcp/.venv/Scripts/python.exe",
"args": ["-m", "ollama_vision_mcp"],
"env": {
"VISION_MCP_BASE_URL": "http://localhost:11434/v1",
"VISION_MCP_MODEL": "qwen2.5vl:7b",
"VISION_MCP_INBOX": ".ai/inbox"
}
}
}
}⚠️
commandは仮想環境内のPythonインタープリターへの絶対パスである必要があります。ollama-vision-setup --projectを実行して、このファイルを自動生成することもできます。 サーバーは起動時にos.getcwd()を使用するため、相対パス(pathやインボックスディレクトリなど)はサーバーが起動されたプロジェクトルートを基準に解決されます。
スモークテスト
次のスクリプトを実行して、Ollamaの接続を確認し、インボックスの内容を一覧表示し、最初の画像に対して実際のビジョン呼び出しを行います:
bash
python examples/smoke_test.pyライセンス
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseAqualityCmaintenanceMCP server enabling LLM clients without vision capability to process images by delegating to local Ollama vision models. Supports describing images, OCR, asking questions, and processing clipboard images.4
- FlicenseNot gradedqualityBmaintenanceBridges local vision engines (Tesseract.js OCR and Sharp preprocessing) with Ollama vision models for image analysis, comparison, text localization, and browser screenshot annotation over MCP-compliant HTTP/SSE transports.
- AlicenseNot gradedqualityBmaintenanceMCP server for local Ollama vision analysis, enabling text-only agents like Claude Code to inspect images via a single tool. Processes images locally with Ollama, keeping image bytes on the machine and returning text reports.2MIT
- AlicenseAqualityBmaintenanceProvides vision understanding capabilities such as image analysis, OCR, object localization, and video frame analysis, plus optional image generation and editing, to coding agents via OpenAI-compatible multimodal models. Runs as a local MCP server with HTTP and stdio transports, configurable for clients like Codex, Claude Code, Kimi, and Cursor.3187MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
A comprehensive Model Context Protocol (MCP) server that enables AI assistants to interact with yo…
MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/masterLazy/ollama-vision-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server