mimo-vision-mcp
mimo-vision-mcp
Дайте текстовым LLM возможность видеть через MCP, используя визуальные модели, такие как Xiaomi MiMo-V2.5.
Через MCP (Model Context Protocol) возможности понимания изображений визуальных моделей (например, Xiaomi MiMo-V2.5) предоставляются текстовым LLM без мультимодальных возможностей. Когда текстовая модель сталкивается с изображением/скриншотом/путём к изображению, она может активно вызывать инструменты analyze_image, describe_image, extract_text_from_image и получать визуальные возможности.
🚀 Быстрый запуск в один клик (новичок освоится за 1 минуту, без ввода команд)
В проект встроен WebUI запуск в один клик — всё управление мышью, все настройки окружения выполняются автоматически, без командной строки:
Скачайте / клонируйте проект локально
Дважды щёлкните
start-webui.bat(Windows) — скрипт автоматически создаст.env(из.env.example), установит окружение/зависимости, запустит сервис и автоматически откроет браузерПосле открытия браузера введите свой API Key → нажмите «Применить к CLI», или просто перетащите изображение в окно → выберите визуальную модель → нажмите «Предварительный просмотр», и вы увидите, как визуальная модель «описывает изображение»
При первом запуске автоматически установятся зависимости (требуется интернет, около 1–2 минут), после этого двойной щелчок открывает мгновенно. Совершенно не нужно знать Python, не нужно вручную вводить
pip, не нужно вручную создавать.env— скрипт всё делает автоматически.
Полное подключение визуальных возможностей для текстовых LLM в командной строке см. ниже подключение к opencode.
Related MCP server: mimo-vision-mcp
Принцип работы
Текстовая модель отвечает за «планирование», визуальная модель — за «просмотр», MCP — это интерфейс, соединяющий их — данные изображения не проходят через текстовую модель.
用户给图片路径/URL
→ ① 文本 LLM 根据工具列表 + 调用指引,决定调用 analyze_image
→ ② opencode / 任意 MCP 客户端(stdio)
→ ③ mimo-vision MCP server(图片归一化 + 转发请求)
→ ④ 视觉模型(MiMo-V2.5 等,经 OpenCode Go / 自定义供应商)真正"看"图
→ ⑤ 文本结果原路返回,文本模型转述给用户Возможности
Запуск в один клик: дважды щёлкните
start-webui.bat— автоматическая установка зависимостей, запуск сервиса, открытие браузера, новичкам без порога входаГотово к использованию: по умолчанию подключён OpenCode Go, достаточно ввести API Key, можно также переключиться на официальный Xiaomi / любого пользовательского провайдера
На основе OpenAI-совместимого протокола, локальная передача через stdio, можно подключить opencode / Claude Desktop / Cursor и любой MCP-клиент
Гибкий ввод изображений: локальный путь / http(s) URL / base64 data URI / чистый base64
Поддержка нескольких изображений, автоматическое определение формата (JPEG/PNG/GIF/WebP/BMP), проверка лимита 50MB
Автоматический выбор API-протокола в зависимости от модели:
gpt-*/grok-*используют Responses API, остальные — chat/completions (можно принудительно указать)Встроенная WebUI панель конфигурации: визуальный выбор модели, предварительный просмотр, выбор синхронизируется с CLI, без перезапуска
Без API key возвращается дружелюбное сообщение об ошибке, без сбоев
Структура каталога
mimo-vision-mcp/
├── mimo_vision_mcp/
│ ├── config.py # 配置读取(.env 实时重读)+ 应用到 MCP
│ ├── image_loader.py # 图片输入归一化 + MIME 探测
│ ├── providers.py # 供应商注册表 + call_vision(chat/responses 适配)
│ └── server.py # FastMCP server + 3 个工具
├── webui/ # WebUI 配置面板(FastAPI + 单页 HTML)
├── tests/ # 单元测试
├── .github/workflows/ci.yml
├── opencode.example.json # opencode 接入配置示例
├── AGENTS.md # 文本模型的调用指引
├── start-webui.bat # 🚀 一键启动(Windows,双击即用)
├── LICENSE
└── pyproject.tomlУстановка
python -m venv .venv
# Windows: .\.venv\Scripts\python.exe -m pip install -e ".[dev]"
.venv/bin/python -m pip install -e ".[dev]"Настройка API Key
Проект по умолчанию использует OpenCode Go для вызова MiMo-V2.5 (модель mimo-v2.5, OpenAI-совместимая конечная точка https://opencode.ai/zen/go/v1).
Подпишитесь на Go на opencode.ai/auth, скопируйте API Key
Скопируйте
.env.exampleв.envи заполните:MIMO_API_KEY=你的-opencode-go-key
Также можно переопределить через переменные окружения (config.py перечитывает .env при каждом вызове):
Переменная | Описание | Значение по умолчанию |
| API Key (можно также | пусто |
| ID провайдера |
|
| ID визуальной модели |
|
| OpenAI-совместимая конечная точка |
|
|
| автоматически |
| Максимальный вывод за один запрос |
|
| Таймаут запроса (секунды) |
|
Смена визуальной модели: в OpenCode Go более быстрые мультимодальные модели можно указать
MIMO_MODELкакgpt-5.6-luna(через/responses) илиminimax-m3. Обратите внимание:mimo-v2.5-pro— чисто текстовая модель, не может видеть изображения.
Запуск MCP server
# 方式一:控制台脚本
mimo-vision-mcp
# 方式二:模块运行
python -m mimo_vision_mcp.serverПодключение к opencode
См. opencode.example.json, зарегистрируйте mimo-vision как локальный stdio MCP server:
{
"$schema": "https://opencode.ai/config.json",
"mcp": {
"mimo-vision": {
"type": "local",
"command": ["<你的python路径>", "-m", "mimo_vision_mcp.server"],
"enabled": true,
"environment": { "MIMO_API_KEY": "{env:MIMO_API_KEY}" }
}
},
"experimental": { "mcp_timeout": 120000 }
}Примечание:
experimental.mcp_timeout(по умолчанию 30s) контролирует таймаут вызова инструментов MCP. Визуальные запросы могут занимать десятки секунд, нужно установить более 120s; не устанавливайтеtimeoutотдельно вmcp.mimo-vision, это переопределитmcp_timeoutи приведёт к таймауту. После изменения конфигурации необходимо перезапустить opencode.
Проект также включает AGENTS.md (инструкции для текстовой модели), можно добавить через глобальную конфигурацию "instructions": ["<путь>/AGENTS.md"] в каждую сессию, чтобы текстовая модель при встрече с изображением активно вызывала инструменты.
Описание инструментов
Инструмент | Описание |
| Универсальный вопрос-ответ по изображению, можно несколько изображений |
| Подробное описание содержимого изображения |
| Извлечение текста с изображения (OCR) |
Каждый элемент images поддерживает:
Локальный абсолютный путь:
C:/Users/xx/Pictures/a.pngПубличный URL:
https://example.com/a.jpgbase64 data URI:
data:image/png;base64,....Чистую base64 строку
Возвращает JSON: { "result": "...", "error": "", "model": "...", "usage": {...} }
WebUI (интерактивный интерфейс · запуск в один клик)
Рекомендуемый вход для новичков: графический интерфейс, загрузка изображений, выбор модели, просмотр результата — всё мышью.
Запуск в один клик (самый простой, без команд)
Дважды щёлкните start-webui.bat (Windows):
Скрипт автоматически проверит/создаст окружение, установит зависимости
Автоматически запустит сервис и автоматически откроет браузер
Если сервис уже запущен, просто откроет браузер, без повторного запуска
Для не-Windows пользователей ручной запуск:
python -m pip install -e ".[web]" && python -m webui.app, затем откройте http://127.0.0.1:8000 (порт можно изменить черезMIMO_WEBUI_PORT).
Функции интерфейса
Вверху «CLI / MCP текущая активная модель» показывает провайдера/модель/стиль, которые реально использует командная строка LLM
После выбора модели нажмите «Применить к CLI (синхронизировать с MCP)», конфигурация записывается в
.env, без перезапуска, CLI при следующем вызове использует новую модельВнизу «Предварительный просмотр (не влияет на CLI)» для тестирования эффекта
API Key хранится в localStorage браузера; при «Применить к CLI» можно также записать в
.env
Тестирование
python -m pytest -qЧастые вопросы
Я не умею программировать / не хочу вводить команды?: Дважды щёлкните
start-webui.bat, скрипт автоматически создаст.env, установит зависимости, запустит сервис, откроет браузер — всё мышьюГде ввести API Key?: После клонирования нет
.env(в репозитории только пустой шаблон.env.example). Двойной запуск скрипта автоматически создаст.env, затем введите Key в веб-интерфейсе и нажмите «Применить к CLI», или отредактируйтеMIMO_API_KEYв.envВозвращается «API Key не настроен»: настройте
MIMO_API_KEYв.env(или введите в WebUI и нажмите «Применить к CLI»)Формат изображения не поддерживается: поддерживаются только JPEG/PNG/GIF/WebP/BMP
Ошибка «не удаётся разобрать» при вводе base64: убедитесь, что ввод — корректный base64 и формат в поддерживаемом диапазоне
Таймаут вызова инструмента MCP: увеличьте
experimental.mcp_timeoutдо 120000ms и более
Лицензия
Ссылки
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityBmaintenanceBridges a vision model to enable text-only models like DeepSeek to describe images, extract text, and compare images via MCP tools.57910MIT
- FlicenseNot gradedqualityBmaintenanceEnables image understanding and OCR through Xiaomi's MiMo vision language model, providing tools for image description, Q&A, and text recognition via MCP. Supports both image URLs and local file paths.
- AlicenseAqualityBmaintenanceEnables non-multimodal models to see images by providing MCP tools for image understanding and OCR, backed by any OpenAI-compatible vision model.2MIT
- AlicenseAqualityCmaintenanceEnables text-only reasoning models to see images by wrapping vision-language models as MCP tools, supporting image description, OCR, chart analysis, and custom questioning within MCP-compatible IDEs.4MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Multimodal video analysis MCP — transcription, vision, and OCR for any video URL.
100+ MCP tools for AI agents: content metadata, trade intelligence, business-expertise analysis.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/mikulovesuki/mimo-vision-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server