Skip to main content
Glama

visionMCP 👁️

Глаза более крупной рассуждающей LLM.

visionMCP — это сервер Model Context Protocol, который предоставляет любому агенту, совместимому с MCP, настоящее зрение. Текстовый рассуждающий LLM может делегировать этому серверу всё, что не может увидеть сам: описать скриншот, ответить на вопрос по фотографии, распознать текст на документе или сравнить два изображения — сервер выполняет функции зрения и возвращает текст.

Он работает со всеми тремя основными бэкендами для зрения, выбираемыми во время выполнения из одного файла config.json:

Провайдер

API

Примеры моделей

Ollama

Совместимый с OpenAI (http://localhost:11434/v1)

llama3.2-vision, qwen2.5vl, llava

OpenAI

Chat Completions vision API

gpt-4o, gpt-4o-mini

Anthropic

Claude Messages vision API

claude-3-5-sonnet-latest, claude-3-7-sonnet-latest


Возможности

  • 🔍 Четыре инструмента для зрения, которые может вызывать рассуждающий LLM:

    • describe_image — полное описание на естественном языке

    • ask_about_image — целевой вопрос-ответ по любому изображению

    • extract_text — OCR / распознавание текста

    • compare_images — сравнение двух изображений

  • 🖼️ Принимается любой источник: локальные пути к файлам, http(s) URL и base64 data: URI.

  • 📦 Нулевая подготовка изображений: изображения большого размера автоматически уменьшаются и перекодируются в JPEG, чтобы соответствовать ограничениям размера полезной нагрузки провайдера.

  • 🔌 Три транспорта: stdio (по умолчанию, для локальных MCP-клиентов), http (Streamable HTTP для удаленного хостинга) или sse (устаревшие Server-Sent Events).

  • ⚙️ Один config.json управляет провайдером, ключом API, URL API и моделью. Переменные окружения и флаги командной строки могут переопределить любой параметр.

  • 🚀 Управляется с помощью uv, устанавливаемый, запускаемый и размещаемый.


Related MCP server: depu-img-mcp

Быстрый старт

1. Установка

Требуется uv и Python ≥ 3.10.

cd visionMCP
uv sync

2. Настройка

Поставляемый config.json уже работает с локальным Ollama. Смените провайдера, отредактировав файл:

// config.json
{
  "provider": "openai",                  // "ollama" | "openai" | "anthropic"
  "api_key": "sk-...",                   // or leave "" and export OPENAI_API_KEY
  "api_url": "",                         // "" = provider default
  "model": ""                            // "" = provider default
}

Смотрите docs/configuration.md для всех опций и docs/providers.md для настройки каждого провайдера.

Безопасность: не храните настоящие ключи API в git — скопируйте config.json в config.local.json (автоматически игнорируется) или используйте переменные окружения. Сервер никогда не логирует ваш ключ.

3. Запуск

uv run vision-mcp                        # stdio transport (default)
uv run vision-mcp --transport http --host 0.0.0.0 --port 8100   # host remotely
uv run vision-mcp --show-config          # print resolved config (key masked)

Подключение к MCP-клиенту

opencode (opencode.json)

{
  "mcpServers": {
    "visionMCP": {
      "type": "stdio",
      "command": "uv",
      "args": ["run", "--directory", "/absolute/path/to/visionMCP", "vision-mcp"]
    }
  }
}

Claude Desktop (claude_desktop_config.json)

{
  "mcpServers": {
    "visionMCP": {
      "command": "uv",
      "args": ["run", "--directory", "/absolute/path/to/visionMCP", "vision-mcp"]
    }
  }
}

Универсальный MCP-клиент (stdio)

{
  "mcpServers": {
    "visionMCP": {
      "command": "/path/to/visionMCP/.venv/bin/vision-mcp",
      "args": ["--config", "/path/to/visionMCP/config.json"]
    }
  }
}

Сервер никогда не отправляет содержимое изображения в API для зрения за пределами того, что предоставляет вызов инструмента. Байты изображения хранятся в памяти и никогда не записываются на диск.


Справочник по инструментам

Инструмент

Аргументы

Возвращает

describe_image

image (путь/URL/data-URI)

Полное описание в виде обычного текста

ask_about_image

image, question

Целенаправленный ответ

extract_text

image

Распознанный / OCR текст

compare_images

image_a, image_b, опционально question

Сравнение в виде обычного текста

server_status

Провайдер, модель, транспорт

Аргумент image принимает любой из:

/path/to/photo.png          # local file
https://example.com/x.jpg   # URL (downloaded at call time)
data:image/png;base64,iVBORw0KGgo...   # base64 data URI

Принцип работы

Всё проходит через одну функцию в src/vision_mcp/pipeline.py:

image (path / URL / data URI)  →  base64 + mime  →  vision model  →  text
        _read()                     _encode()         API[provider]    look()

Инструменты сервера — это тонкие обертки: pipeline.look(cfg, [image], prompt).


Документация

Разработка

uv sync --group dev
uv run ruff check .
uv run pytest

Лицензия

MIT

Install Server
A
license - permissive license
A
quality
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Generate on-brand images from your AI agent: design, edit, and render templates over MCP.

  • Social media analytics, video analysis, and competitor intel for any MCP-compatible AI agent.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/ThisUserIsRandom/visionMCP'

If you have feedback or need assistance with the MCP directory API, please join our Discord server