cerase-media MCP
Officialcerase-media MCP
Eigenes multimodales Verständnis (M-MEDIA-1 = die Zusammenführung der früheren cerase-ocr + cerase-transcriber): fünf async Tools über den multimodal Tool-Modell-Alias durch cerase-litellm, pro Agent abgerechnet. Die letzten beiden (analyze_ui, compare_screenshots) sind das UX/UI-Screenshot-Paar, das von M-CERASE-MEDIA-UX hinzugefügt wurde — gleicher multimodal-Endpunkt, spezialisierte Prompts, keine zusätzliche Abhängigkeit.
Tool | Frage, die es beantwortet | Rückgabe |
| Was ist in diesem Bild GESCHRIEBEN? |
|
| Was zeigt dieses Bild? |
|
| Was sagt dieses Audio? |
|
| Was ist in diesem UI-Screenshot? — strukturierte Prüfung von Layout, Typografie, Farben, interaktiven Elementen, Text, visuellen Fehlern, Barrierefreiheit, Konsistenz |
|
| Was hat sich zwischen zwei Screenshots geändert? — Vorher/Nachher-Visual-Diff (Layout / Text / Stil / neu / entfernt / Regressionen) |
|
Bild-Eingabe wird auf drei Arten akzeptiert (eine auswählen): path (eine Datei unter CERASE_TOOL_WORKSPACE_ROOT), image_url oder image_base64. compare_screenshots nimmt die Zwei-Bild-Varianten (path1/image1_url/image1_base64 und path2/…).
Async von Natur aus: Die Tools warten zu ~100% auf das LLM, sodass gleichzeitige Anfragen auf parallelen I/O-Pfaden innerhalb des einzelnen Runner-Containers laufen (keine Warteschlange pro Modalität). ffmpeg (Audio-Normalisierung) läuft als asynchroner Subprozess.
Lange Audiodateien: der Chunker
transcribe schneidet alles, was länger als ein Chunk ist (chunker.py), transkribiert die Teile gleichzeitig und setzt den Text wieder zusammen. Jedes Stück nach dem ersten wiederholt die letzten Sekunden des vorherigen, damit kein Wort an einem Schnitt verloren geht, und die wiederholten Wörter werden beim Zusammenfügen gefunden und entfernt. Ein Aufrufer, der weiß, wo sich die Sprecher wechseln, kann eine Sprecher-Zeitleiste übergeben: Die Schnitte verschieben sich auf die Sprecherwechsel, wo nichts wiederholt werden muss.
Jedes Stück — auch eine Aufnahme, die kurz genug ist, um keinen Schnitt zu benötigen — erhält eine Sekunde Stille davor. Audio, das mit einem Wort beginnt, kommt mit dem ersten Satz fehlend zurück.
Knob | Standard | Was es entscheidet |
| 120 | wie lang ein Stück ist und wie schnell der erste Text eintrifft |
| 6 | wie viel Audio jeder blinde Schnitt wiederholt |
| 4 | wie viele Teile einer Aufnahme gleichzeitig in Bearbeitung sind |
| 1 | Stille vor jedem Stück |
Related MCP server: mcp-multimedia-server
Derselbe Code als HTTP-Endpunkt
transcription_api.py bedient POST /v1/audio/transcriptions — die Schnittstelle, die Treiber bereits sprechen — über denselben Chunker. Der Compose-Dienst cerase-transcription führt dieses Image auf diesem Einstiegspunkt aus:
python -m uvicorn --app-dir /app --factory transcription_api:create_app --host 0.0.0.0 --port 8080Es nimmt die OpenAI-Felder (file, model, language, response_format, stream) plus zwei eigene: agent_id (oder den X-Cerase-Agent-Id-Header), dem jeder Modellaufruf zugeordnet wird und der erforderlich ist, sowie speaker_timeline, ein JSON-Array von {start, end, speaker}. Aufrufer präsentieren CERASE_INTERNAL_SECRET als Bearer; ein nicht gesetztes Secret lehnt jede Anfrage ab. Mit stream=true verlässt jedes Stück als transcript.text.delta-Ereignis, sobald es eintrifft, und der Lauf endet mit transcript.text.done.
Env: LITELLM_BASE_URL, LITELLM_MASTER_KEY (eingeschränkter Dienstschlüssel), CERASE_MULTIMODAL_ALIAS (Standard multimodal), CERASE_TOOL_WORKSPACE_ROOT (Wurzel für den Pfad-Traversal-Schutz), CERASE_INTERNAL_SECRET (das Bearer-Token des HTTP-Endpunkts).
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityBmaintenanceEnables non-multimodal models to see images by providing MCP tools for image understanding and OCR, backed by any OpenAI-compatible vision model.2MIT
- AlicenseAqualityBmaintenanceProvides multimedia understanding tools for LLM agents, enabling image, video, audio analysis and speech transcription via cloud-based MiMo V2.5 through OpenAI-compatible endpoints.6MIT
- AlicenseNot gradedqualityCmaintenanceAdds image recognition and UI grounding capabilities to text-only LLMs through MCP tools, supporting local and cloud vision backends.56MIT
- AlicenseNot gradedqualityBmaintenanceProvides multimodal vision MCP tools for image analysis, OCR, object detection, text-to-image generation, and image similarity, integrating OpenAI, Qwen, and Gemini.1,1531MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Multimodal video analysis MCP — transcription, vision, and OCR for any video URL.
Provides cloud browser automation capabilities using Stagehand and Browserbase, enabling LLMs to i…
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/cerase-ai/cerase-media-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server