cerase-media MCP
Officialcerase-media MCP
Comprensión multimodal de primera parte (M-MEDIA-1 = la fusión de los antiguos
cerase-ocr + cerase-transcriber): cinco herramientas asíncronas sobre el
alias de modelo multimodal a través de cerase-litellm, facturadas por agente.
Las dos últimas (analyze_ui, compare_screenshots) son el par de capturas de
pantalla UX/UI añadido por M-CERASE-MEDIA-UX — el mismo endpoint multimodal,
prompts especializados, sin dependencia adicional.
Herramienta | Pregunta que responde | Devuelve |
| ¿qué está ESCRITO en esta imagen? |
|
| ¿qué MUESTRA esta imagen? |
|
| ¿qué dice este audio? |
|
| ¿qué hay en esta captura de interfaz? — auditoría estructurada de diseño, tipografía, colores, elementos interactivos, texto, errores visuales, accesibilidad, coherencia |
|
| ¿qué ha cambiado entre dos capturas? — diff visual antes/después (diseño / texto / estilo / nuevo / eliminado / regresiones) |
|
La entrada de imagen se acepta de tres formas (elige una): path (un archivo
bajo CERASE_TOOL_WORKSPACE_ROOT), image_url o image_base64.
compare_screenshots acepta las variantes de dos imágenes (path1/image1_url/
image1_base64 y path2/…).
Asíncrono por diseño: las herramientas esperan ~100% a la LLM, por lo que las peticiones concurrentes se ejecutan en carriles de E/S paralelos dentro del contenedor runner único (sin cola por modalidad). ffmpeg (normalización de audio) se ejecuta como un subproceso asíncrono.
Audio largo: el troceador
transcribe corta cualquier cosa más larga que un fragmento (chunker.py),
transcribe las piezas de forma concurrente y vuelve a ensamblar el texto. Cada
pieza después de la primera repite los últimos segundos de la anterior para que
ninguna palabra se pierda en un corte, y las palabras repetidas se localizan y
se eliminan al unir las piezas. Un llamador que sepa dónde cambian los
interlocutores puede proporcionar una línea temporal de hablantes: los cortes se
desplazan a los cambios de turno, donde no hay nada que repetir.
Cada pieza — incluida una grabación lo bastante corta como para no necesitar corte — recibe un segundo de silencio delante. El audio que empieza con una palabra vuelve con esa primera frase ausente.
Parámetro | Valor por defecto | Qué decide |
| 120 | cuánto dura una pieza y cuándo llega el primer texto |
| 6 | cuánto audio repite cada corte ciego |
| 4 | piezas de una grabación en vuelo a la vez |
| 1 | silencio delante de cada pieza |
Related MCP server: mcp-multimedia-server
El mismo código como endpoint HTTP
transcription_api.py sirve POST /v1/audio/transcriptions — la interfaz que
los drivers ya hablan — sobre el mismo troceador. El servicio de compose
cerase-transcription ejecuta esta imagen en ese entrypoint:
python -m uvicorn --app-dir /app --factory transcription_api:create_app --host 0.0.0.0 --port 8080Acepta los campos de OpenAI (file, model, language, response_format,
stream) más dos propios: agent_id (o la cabecera X-Cerase-Agent-Id), al
que se factura cada llamada de modelo y que es obligatorio, y
speaker_timeline, un array JSON de {start, end, speaker}. Los llamadores
presentan CERASE_INTERNAL_SECRET como bearer; un secreto sin definir rechaza
todas las peticiones. Con stream=true, cada pieza sale como evento
transcript.text.delta en cuanto llega, y la ejecución termina con
transcript.text.done.
Env: LITELLM_BASE_URL, LITELLM_MASTER_KEY (clave de servicio con ámbito),
CERASE_MULTIMODAL_ALIAS (por defecto multimodal),
CERASE_TOOL_WORKSPACE_ROOT (raíz de protección contra path traversal),
CERASE_INTERNAL_SECRET (el bearer del endpoint HTTP).
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityBmaintenanceEnables non-multimodal models to see images by providing MCP tools for image understanding and OCR, backed by any OpenAI-compatible vision model.2MIT
- AlicenseAqualityBmaintenanceProvides multimedia understanding tools for LLM agents, enabling image, video, audio analysis and speech transcription via cloud-based MiMo V2.5 through OpenAI-compatible endpoints.6MIT
- AlicenseNot gradedqualityCmaintenanceAdds image recognition and UI grounding capabilities to text-only LLMs through MCP tools, supporting local and cloud vision backends.56MIT
- AlicenseNot gradedqualityBmaintenanceProvides multimodal vision MCP tools for image analysis, OCR, object detection, text-to-image generation, and image similarity, integrating OpenAI, Qwen, and Gemini.1,1531MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Multimodal video analysis MCP — transcription, vision, and OCR for any video URL.
Provides cloud browser automation capabilities using Stagehand and Browserbase, enabling LLMs to i…
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/cerase-ai/cerase-media-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server