openmedia-mcp
openmedia-mcp
Набор MCP-серверов, обеспечивающих экономное использование контекста для извлечения, анализа и обработки медиа — изображений, PDF, видео, аудио — предназначен для ИИ-агентов.
Работает с любой MCP-совместимой средой (opencode, Claude Code/Desktop, Cursor, Windsurf, Cline, LM Studio, ...) через stdio, потоковый HTTP или SSE.
Зачем
Мультимодальные модели могут видеть, но большинство сред не дают им простого способа посмотреть видео, отсканированный PDF или 20-мегабайтную фотографию, не спотыкаясь и не сжигая огромный контекст. openmedia-mcp решает это с помощью жёстких правил:
Каждый визуальный результат уменьшается и пережимается перед отправкой модели (настраиваемые максимальный размер / качество JPEG).
Каждый текстовый результат ограничен по длине с явным маркером усечения, который сообщает модели, как получить остальное.
Лимиты кадров/страниц на вызов (12 кадров, 8 страниц) предотвращают случайное затопление контекста.
URL-адреса — объекты первого класса: URL видеостраниц (YouTube и ещё более 1000 сайтов через yt-dlp) загружаются один раз в разрешении ≤720p и кэшируются; прямые URL файлов кэшируются с лимитом размера.
Related MCP server: Vision MCP Server
Требования
Python ≥ 3.10 плюс системные бинарные исполняемые файлы (все проверяются в момент вызова с сообщениями об ошибках, подсказывающими решение; бинарь нужен только тем инструментам, которые вы реально вызываете):
Бинарный файл | Нужен для | Пакет Arch |
| видео, аудио |
|
| видео-URL, загрузки |
|
|
| |
| image_ocr, pdf_ocr |
|
Необязательно: pip install 'openmedia-mcp[whisper]' включает локальное распознавание речи (audio_transcribe) через faster-whisper.
Установка и запуск
# From a local checkout
uv run --project /path/to/openmedia-mcp openmedia-mcp
# Or install as a tool
uv tool install git+https://github.com/Builderstar/openmedia-mcp.git
openmedia-mcp --tools pdf,imageopencode
{
"mcp": {
"openmedia": {
"type": "local",
"command": ["uv", "run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}Claude Desktop / общая конфигурация MCP
{
"mcpServers": {
"openmedia": {
"command": "uv",
"args": ["run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}HTTP-транспорт
openmedia-mcp --transport streamable-http --host 127.0.0.1 --port 8756Наборы инструментов
Подключайте только то, что нужно конкретной среды, с помощью --tools image,pdf,video,audio (по умолчанию: все). Инструмент media_probe доступен всегда.
image
Инструмент | Назначение |
| Просмотр изображения (автоматическое уменьшение); параметр |
| Формат, размеры, сводка EXIF — пиксели не тратятся |
| Извлечение текста с помощью Tesseract |
| обрезка / изменение размера / поворот / отражение / оттенки серого / конвертация формата |
| Два изображения рядом в виде единого составного изображения |
Инструмент | Назначение |
| Метаданные + определение наличия текстового слоя |
| Извлечение текстового слоя (диапазоны страниц, режим вёрстки) |
| Рендер страниц как изображений для модели (сканы, иллюстрации, вёрстка) |
| Tesseract OCR для сканированных PDF |
| Извлечение встроенных рисунков/фотографий на диск |
video
Инструмент | Назначение |
| ffprobe для файлов; метаданные yt-dlp для URL (без загрузки) |
| Просмотр видео: равномерная выбор кадров или точные моменты времени |
| Субтитры через yt-dlp (URL) или встроенные субтитры (файлы) |
| Загрузка через yt-dlp с управлением разрешением |
| Вырезание фрагментов (stream-copy или перекодирование) |
| Звуковая дорожка в mp3/m4a/wav/flac/opus |
audio
Инструмент | Назначение |
| Кодек, длительность, теги |
| Конвертация в нужный формат/битрейт/частоту дискретизации/в моно |
| Вырезка фрагмента без потерь |
| Просмотр формы волны в виде изображения |
| Локальное распознавание речи Whisper (необязательный пакет |
Конфигурация (переменные окружения)
Переменная | По умолчанию | Значение |
|
| Кэш для загрузки URL/видео |
|
| Место вывода по умолчанию |
|
| Максимум символов по умолчанию для текстовых результатов |
|
| Максимальная длинная сторона по умолчанию для возвращаемых изображений |
|
| Качество JPEG по умолчанию |
|
| Лимит загрузки по прямой ссылке |
Безопасность и конфиденциальность
Этот сервер действует с правами пользователя, который его запускает. Его инструменты могут читать локальные медиафайлы, загружать URL, запускать бинарные файлы для обработки медиа и писать в выбранные вызывающей стороной пути вывода. Ответы инструментов могут содержать абсолютные пути и метаданные медиа. Подключайте только доверенные MCP-клиенты.
HTTP-транспорты не предоставляют аутентификацию. По умолчанию они привязаны к loopback; не открывайте их на другой хост или недоверенную сеть без отдельного аутентифицированного прокси и сетевой политики. Загрузка URL может обращаться к адресам, видимым с хоста, включая сервисы в приватной сети.
Необязательный инструмент Whisper при первом использовании загружает и кэширует базовую (base) модель faster-whisper. Для работу в автономном режиме подготовьте кэш этой модели заранее.
Разработка
uv sync # install deps
uv run python tests/smoke_test.py [sample-video.mp4] # exercises every toolСмоук-тест генерирует собственное тестовое изображени е и PDF; передайте любой локальный видеофайл, чтобы также охватить наборы инструментов для видео/аудио.
Лицензия
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityBmaintenanceEnables AI agents to process files locally — OCR images, extract text from PDFs and DOCX, and describe images using local vision models, all without sending data to external services.
- AlicenseAqualityDmaintenanceEnables AI agents to analyze images, extract text, compare images, and analyze video through any OpenAI-compatible vision model.455019MIT
- AlicenseNot gradedqualityAmaintenanceEnables agents to analyze long videos by downloading them, extracting transcripts and storyboards, and zooming into specific moments with high-resolution frames and OCR.MIT
- AlicenseNot gradedqualityBmaintenanceEnables text-only coding models to read images, PDFs, presentations, spreadsheets, and other non-text files through a single analyze_media tool, combining local document extraction, OCR, and optional vision models with clear evidence labeling.1MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Builderstar/openmedia-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server