Skip to main content
Glama
cerase-ai

cerase-media MCP

Official
by cerase-ai

cerase-media MCP

Eigenes multimodales Verständnis (M-MEDIA-1 = die Zusammenführung der früheren cerase-ocr + cerase-transcriber): fünf async Tools über den multimodal Tool-Modell-Alias durch cerase-litellm, pro Agent abgerechnet. Die letzten beiden (analyze_ui, compare_screenshots) sind das UX/UI-Screenshot-Paar, das von M-CERASE-MEDIA-UX hinzugefügt wurde — gleicher multimodal-Endpunkt, spezialisierte Prompts, keine zusätzliche Abhängigkeit.

Tool

Frage, die es beantwortet

Rückgabe

ocr

Was ist in diesem Bild GESCHRIEBEN?

{text, model}

describe_image

Was zeigt dieses Bild?

{description, model}

transcribe

Was sagt dieses Audio?

{text, model}

analyze_ui

Was ist in diesem UI-Screenshot? — strukturierte Prüfung von Layout, Typografie, Farben, interaktiven Elementen, Text, visuellen Fehlern, Barrierefreiheit, Konsistenz

{analysis, model}

compare_screenshots

Was hat sich zwischen zwei Screenshots geändert? — Vorher/Nachher-Visual-Diff (Layout / Text / Stil / neu / entfernt / Regressionen)

{diff, model}

Bild-Eingabe wird auf drei Arten akzeptiert (eine auswählen): path (eine Datei unter CERASE_TOOL_WORKSPACE_ROOT), image_url oder image_base64. compare_screenshots nimmt die Zwei-Bild-Varianten (path1/image1_url/image1_base64 und path2/…).

Async von Natur aus: Die Tools warten zu ~100% auf das LLM, sodass gleichzeitige Anfragen auf parallelen I/O-Pfaden innerhalb des einzelnen Runner-Containers laufen (keine Warteschlange pro Modalität). ffmpeg (Audio-Normalisierung) läuft als asynchroner Subprozess.

Lange Audiodateien: der Chunker

transcribe schneidet alles, was länger als ein Chunk ist (chunker.py), transkribiert die Teile gleichzeitig und setzt den Text wieder zusammen. Jedes Stück nach dem ersten wiederholt die letzten Sekunden des vorherigen, damit kein Wort an einem Schnitt verloren geht, und die wiederholten Wörter werden beim Zusammenfügen gefunden und entfernt. Ein Aufrufer, der weiß, wo sich die Sprecher wechseln, kann eine Sprecher-Zeitleiste übergeben: Die Schnitte verschieben sich auf die Sprecherwechsel, wo nichts wiederholt werden muss.

Jedes Stück — auch eine Aufnahme, die kurz genug ist, um keinen Schnitt zu benötigen — erhält eine Sekunde Stille davor. Audio, das mit einem Wort beginnt, kommt mit dem ersten Satz fehlend zurück.

Knob

Standard

Was es entscheidet

CERASE_TRANSCRIBE_CHUNK_SECONDS

120

wie lang ein Stück ist und wie schnell der erste Text eintrifft

CERASE_TRANSCRIBE_CHUNK_OVERLAP_SECONDS

6

wie viel Audio jeder blinde Schnitt wiederholt

CERASE_TRANSCRIBE_CONCURRENCY

4

wie viele Teile einer Aufnahme gleichzeitig in Bearbeitung sind

CERASE_TRANSCRIBE_LEAD_SILENCE_SECONDS

1

Stille vor jedem Stück

Related MCP server: mcp-multimedia-server

Derselbe Code als HTTP-Endpunkt

transcription_api.py bedient POST /v1/audio/transcriptions — die Schnittstelle, die Treiber bereits sprechen — über denselben Chunker. Der Compose-Dienst cerase-transcription führt dieses Image auf diesem Einstiegspunkt aus:

python -m uvicorn --app-dir /app --factory transcription_api:create_app --host 0.0.0.0 --port 8080

Es nimmt die OpenAI-Felder (file, model, language, response_format, stream) plus zwei eigene: agent_id (oder den X-Cerase-Agent-Id-Header), dem jeder Modellaufruf zugeordnet wird und der erforderlich ist, sowie speaker_timeline, ein JSON-Array von {start, end, speaker}. Aufrufer präsentieren CERASE_INTERNAL_SECRET als Bearer; ein nicht gesetztes Secret lehnt jede Anfrage ab. Mit stream=true verlässt jedes Stück als transcript.text.delta-Ereignis, sobald es eintrifft, und der Lauf endet mit transcript.text.done.

Env: LITELLM_BASE_URL, LITELLM_MASTER_KEY (eingeschränkter Dienstschlüssel), CERASE_MULTIMODAL_ALIAS (Standard multimodal), CERASE_TOOL_WORKSPACE_ROOT (Wurzel für den Pfad-Traversal-Schutz), CERASE_INTERNAL_SECRET (das Bearer-Token des HTTP-Endpunkts).

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Multimodal video analysis MCP — transcription, vision, and OCR for any video URL.

  • Provides cloud browser automation capabilities using Stagehand and Browserbase, enabling LLMs to i…

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/cerase-ai/cerase-media-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server