ollama-vision-mcp
ollama-vision-mcp
English · 中文
Минимальный мостовой сервис, который предоставляет локальные vision-возможности для VS Code Copilot, использующего текстовые модели (например, DeepSeek).
Когда Copilot использует текстовую модель, он не может напрямую «видеть» изображения. Этот MCP-сервер устраняет этот пробел: вы кладёте скриншот в папку; Copilot читает изображение через этот мост → отправляет его в локальную Ollama vision-модель → получает обратно текстовое описание, которое текстовая модель может понять.
VS Code Copilot Chat (Agent mode, text-only model)
│ MCP stdio
▼
ollama-vision-mcp (this package)
│ Read local image → base64 → POST /v1/chat/completions
▼
Ollama (local vision model, e.g., qwen2.5vl:7b)Инструменты
Инструмент | Параметры | Описание |
|
| Читает изображение и генерирует текстовое описание. |
|
| Перечисляет файлы изображений, доступные для чтения. |
|
| Извлекает текст из изображения с помощью OCR. |
| — | Отображает текущую конфигурацию, статус подключения к Ollama и список доступных моделей. |
Related MCP server: Hybrid Vision MCP Server
Область применения этого инструмента
Этот пакет — только мостовой слой. Он взаимодействует с Ollama исключительно по HTTP (совместимый с OpenAI /v1/chat/completions и /v1/models).
Он не обрабатывает:
Установку Ollama, запуск
ollama serve, загрузку моделей или управление конфигурацией моделей;Доступ к буферу обмена, внутренним механизмам IDE или любым сетевым сервисам, кроме вашего локального Ollama.
Вы полностью отвечаете за установку Ollama и загрузку моделей (см. раздел «Предварительные требования»).
Предварительные требования
Вы должны самостоятельно настроить следующее:
Python 3.10+
Ollama установлен и запущен:
ollama serveХотя бы одна vision-модель загружена; рекомендуется:
bash
ollama pull qwen2.5vl:7bДругие варианты:
qwen3-vl:8b,gemma3:12b,llama3.2-vision:11b,llava:7b. Выберите модель, подходящую для вашего GPU; укажите её позже через переменную окруженияVISION_MCP_MODEL.
🚀 Быстрая установка (рекомендуется)
Выполните одну команду в корне репозитория, чтобы завершить установку и настройку:
bash GXP3
Скрипт автоматически:
Создаст выделенное виртуальное окружение (
.venv) и установит этот пакет (не затрагивая глобальное окружение).Обнаружит локальный сервис Ollama и выведет список доступных vision-моделей.
Интерактивно проведёт вас по настройке
base_url,model,inbox,max_tokens, сжатия изображений и необязательного API Key.Запишет конфигурацию в
.vscode/mcp.jsonпроекта и/или в глобальный MCP-файл уровня пользователя (%APPDATA%\Code\User\mcp.json), объединяя с существующими настройками и не перезаписывая ваши другие MCP-серверы.
Неинтерактивное использование (подходит для CI/скриптов):
bash GXP4
После установки перезагрузите окно в VS Code (Ctrl+Shift+P → «Developer: Reload Window»), чтобы конфигурация вступила в силу.
Если вы уже запускали его ранее, вы также можете перенастроить всё, просто выполнив команду
ollama-vision-setup.
Проверка установки
В VS Code Copilot Chat (в режиме агента) введите:
text GXP5
Если возвращённый JSON содержит "ollama": { "ok": true, ... } и список моделей, соединение успешно.
Если ok имеет значение false, сначала запустите Ollama (ollama serve) и попробуйте снова.
Использование
Поместите скриншоты в каталог inbox проекта (по умолчанию
.ai/inbox). Сервер создаст этот каталог автоматически при необходимости.Задайте вопрос в Copilot Chat, например:
«Посмотри на скриншоты в inbox и скажи, о чём эта ошибка».
Агент автоматически вызовет
list_images→describe_imageи ответит на основе текстового описания.
Сделайте агента умнее (необязательно): скопируйте готовый файл инструкций .github/instructions/ollama-vision/vision-tools.instructions.md в тот же путь в вашем проекте. Он обучает агента полному рабочему процессу vision — порядку вызовов (list_images → describe_image → extract_text), выбору режима, устранению неполадок и подсказывает, куда класть скриншоты (в inbox). Будучи файловой инструкцией VS Code, он обнаруживается по запросу всякий раз, когда задача связана с изображениями, поэтому работает сразу без настройки.
Справочник переменных окружения
Переменная | По умолчанию | Описание |
|
| Базовый URL Ollama, совместимый с OpenAI |
|
| Vision-модель для использования |
| пусто (фактически используется | API Key (игнорируется Ollama) |
|
| Каталог по умолчанию для |
|
| Максимальное количество выходных токенов для vision-модели |
|
| Если изображение > 50 КБ, автоматически изменить размер до JPEG 768 px |
|
| Оставить режим размышлений включённым для думающих моделей ( |
Псевдонимы совместимости: VISION_MODEL, VISION_BASE_URL, VISION_INBOX, VISION_API_KEY.
Установка вручную (альтернативный вариант)
Если вам нужен полный ручной контроль над каждым шагом, следуйте приведённому ниже процессу.
1. Создайте окружение и установите
bash GXP6
После установки у вас появятся две команды:
ollama-vision-mcp— запуск MCP-сервераollama-vision-setup— интерактивный ярлык настройки
2. Зарегистрируйте в VS Code
Скопируйте следующее в .vscode/mcp.json вашего проекта (только для проекта) или в пользовательский файл %APPDATA%\Code\User\mcp.json (для всех проектов). Обязательно измените command на абсолютный путь к интерпретатору Python в вашем виртуальном окружении:
json GXP7
⚠️
commandдолжен быть абсолютным путём к интерпретатору Python внутри виртуального окружения. Вы также можете выполнитьollama-vision-setup --project, чтобы сгенерировать этот файл автоматически. При вызове сервер используетos.getcwd(), поэтому относительные пути (например,pathи каталог inbox) будут разрешаться относительно корня проекта, в котором запущен сервер.
Дымовой тест
Выполните следующий скрипт, чтобы проверить подключение к Ollama, вывести содержимое inbox и выполнить реальный vision-вызов на первом изображении:
bash GXP8
Лицензия
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseAqualityCmaintenanceMCP server enabling LLM clients without vision capability to process images by delegating to local Ollama vision models. Supports describing images, OCR, asking questions, and processing clipboard images.4
- FlicenseNot gradedqualityBmaintenanceBridges local vision engines (Tesseract.js OCR and Sharp preprocessing) with Ollama vision models for image analysis, comparison, text localization, and browser screenshot annotation over MCP-compliant HTTP/SSE transports.
- AlicenseNot gradedqualityBmaintenanceMCP server for local Ollama vision analysis, enabling text-only agents like Claude Code to inspect images via a single tool. Processes images locally with Ollama, keeping image bytes on the machine and returning text reports.2MIT
- AlicenseAqualityBmaintenanceProvides vision understanding capabilities such as image analysis, OCR, object localization, and video frame analysis, plus optional image generation and editing, to coding agents via OpenAI-compatible multimodal models. Runs as a local MCP server with HTTP and stdio transports, configurable for clients like Codex, Claude Code, Kimi, and Cursor.3187MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
A comprehensive Model Context Protocol (MCP) server that enables AI assistants to interact with yo…
MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/masterLazy/ollama-vision-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server