cerase-media MCP
Officialcerase-media MCP
Мультимодальное понимание первого уровня (M-MEDIA-1 = объединение прежних
cerase-ocr + cerase-transcriber): пять асинхронных инструментов над
алиасом multimodal через cerase-litellm, оплачиваются на агента.
Последние два (analyze_ui, compare_screenshots) — пара скриншотов UX/UI,
добавленная M-CERASE-MEDIA-UX — тот же конечный multimodal, специальные
промпты, без дополнительных зависимостей.
Инструмент | На какой вопрос отвечает | Возвращает |
| что НАПИСАНО на этом изображении? |
|
| что ПОКАЗЫВАЕТ это изображение? |
|
| что говорит это аудио? |
|
| что в этом скриншоте интерфейса? — структурированный аудит компоновки, типографики, цветов, интерактивных элементов, текста, визуальных ошибок, доступности, согласованности |
|
| что изменилось между двумя скриншотами? — визуальное различие до/после (компоновка / текст / стиль / новое / удалённое / регрессии) |
|
Изображение принимается тремя способами (выберите один): path (файл в
CERASE_TOOL_WORKSPACE_ROOT), image_url или image_base64.
compare_screenshots принимает варианты с двумя изображениями (path1/image1_url/
image1_base64 и path2/…).
Асинхронность по замыслу: инструменты ожидают LLM ~100% времени, поэтому конкурентные запросы выполняются по параллельным каналам ввода-вывода внутри единого контейнера-раннера (без очереди на модальность). ffmpeg (нормализация аудио) запускается как асинхронный подпроцесс.
Длинное аудио: чанкер
transcribe разрезает всё, что длиннее чанка (chunker.py), транскрибирует
фрагменты конкурентно и собирает текст обратно. Каждый фрагмент после первого
повторяет последние секунды предыдущего, чтобы слово не потерялось на срезе,
и при соединении фрагментов повторённые слова находятся и удаляются. Вызывающий,
который знает, где меняются говорящие, может передать таймлайн говорящих:
срезы переносятся на смену реплик, где ничего повторять не нужно.
Каждый фрагмент — включая запись, достаточно короткую, чтобы не нуждаться в разрезании, — получает секунду тишины в начале. Аудио, начинающееся со слова, возвращается без первого предложения.
Крутилка | По умолчанию | Что решает |
| 120 | длительность фрагмента и как скоро придёт первый текст |
| 6 | сколько аудио повторяет каждый слепой срез |
| 4 | сколько фрагментов одной записи в полёте одновременно |
| 1 | тишина в начале каждого фрагмента |
Related MCP server: mcp-multimedia-server
Тот же код как HTTP-эндпоинт
transcription_api.py обслуживает POST /v1/audio/transcriptions — интерфейс,
который уже говорят драйверы встречных команд, — через тот же чанкер. Сервис
compose cerase-transcription запускает этот образ на этой точке входа:
python -m uvicorn --app-dir /app --factory transcription_api:create_app --host 0.0.0.0 --port 8080Он принимает поля OpenAI (file, model, language, response_format,
stream) плюс два своих: agent_id (или заголовок X-Cerase-Agent-Id),
на который начисляется каждый вызов модели и который обязателен, и
speaker_timeline — JSON-массив {start, end, speaker}. Вызывающие
представляют CERASE_INTERNAL_SECRET как bearer; если секрет не задан,
каждый запрос отклоняется. С stream=true каждый фрагмент уходит как событие
transcript.text.delta, как только он готов, и запуск завершается событием
transcript.text.done.
Env: LITELLM_BASE_URL, LITELLM_MASTER_KEY (ключ сервиса с ограниченной областью),
CERASE_MULTIMODAL_ALIAS (по умолчанию multimodal),
CERASE_TOOL_WORKSPACE_ROOT (корень защиты от обхода путей),
CERASE_INTERNAL_SECRET (bearer HTTP-эндпоинта).
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityBmaintenanceEnables non-multimodal models to see images by providing MCP tools for image understanding and OCR, backed by any OpenAI-compatible vision model.2MIT
- AlicenseAqualityBmaintenanceProvides multimedia understanding tools for LLM agents, enabling image, video, audio analysis and speech transcription via cloud-based MiMo V2.5 through OpenAI-compatible endpoints.6MIT
- AlicenseNot gradedqualityCmaintenanceAdds image recognition and UI grounding capabilities to text-only LLMs through MCP tools, supporting local and cloud vision backends.56MIT
- AlicenseNot gradedqualityBmaintenanceProvides multimodal vision MCP tools for image analysis, OCR, object detection, text-to-image generation, and image similarity, integrating OpenAI, Qwen, and Gemini.1,1531MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Multimodal video analysis MCP — transcription, vision, and OCR for any video URL.
Provides cloud browser automation capabilities using Stagehand and Browserbase, enabling LLMs to i…
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/cerase-ai/cerase-media-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server