openmedia-mcp
openmedia-mcp
Kontexteffiziente MCP-Server-Suite zum Extrahieren, Analysieren und Bearbeiten von Medien – Bilder, PDFs, Video, Audio – entwickelt für KI-Agenten.
Funktioniert mit jeder MCP-kompatiblen Host-Umgebung (opencode, Claude Code/Desktop, Cursor, Windsurf, Cline, LM Studio, ...) über stdio, streamable HTTP oder SSE.
Warum
Multimodale Modelle können sehen, aber die meisten Host-Umgebungen geben ihnen keine saubere Möglichkeit, sich ein Video, ein gescanntes PDF oder ein 20-MB-Foto anzusehen, ohne dabei entweder zu scheitern oder Unmengen an Kontext zu verbrauchen. openmedia-mcp behebt das mit festen Regeln:
Jede visuelle Ausgabe wird verkleinert und neu komprimiert, bevor sie das Modell erreicht (konfigurierbare maximale Kantenlänge / JPEG-Qualität).
Jede Textausgabe ist begrenzt durch einen expliziten Kürzungsmarker, der dem Modell mitteilt, wie es weitere Inhalte abrufen kann.
Frame-/Seitenlimits pro Aufruf (12 Frames, 8 Seiten) verhindern versehentliche Kontextfluten.
URLs werden vollwertig unterstützt: Video-Seiten-URLs (YouTube + über 1000 Websites via yt-dlp) werden einmalig mit ≤720p abgerufen und zwischengespeichert; direkte Datei-URLs werden mit einer Größenbegrenzung zwischengespeichert.
Related MCP server: Vision MCP Server
Anforderungen
Python ≥ 3.10 plus System-Binaries (alle werden zur Aufrufzeit mit aussagekräftigen Fehlermeldungen aufgelöst – nur die Tools, die Sie tatsächlich aufrufen, benötigen ihr Binary):
Binary | Benötigt für | Arch-Paket |
| Video, Audio |
|
| Video-URLs, Downloads |
|
|
| |
| image_ocr, pdf_ocr |
|
Optional: Mit pip install 'openmedia-mcp[whisper]' wird lokale Sprach-zu-Text-Erkennung (audio_transcribe) über faster-whisper aktiviert.
Installation & Ausführung
# From a local checkout
uv run --project /path/to/openmedia-mcp openmedia-mcp
# Or install as a tool
uv tool install git+https://github.com/Builderstar/openmedia-mcp.git
openmedia-mcp --tools pdf,imageopencode
{
"mcp": {
"openmedia": {
"type": "local",
"command": ["uv", "run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}Claude Desktop / generische MCP-Konfiguration
{
"mcpServers": {
"openmedia": {
"command": "uv",
"args": ["run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}HTTP-Transport
openmedia-mcp --transport streamable-http --host 127.0.0.1 --port 8756Toolsets
Binden Sie mit --tools image,pdf,video,audio nur das ein, was die jeweilige Host-Umgebung benötigt (Standard: alle). media_probe ist immer verfügbar.
image
Tool | Zweck |
| Ein Bild ansehen (automatisch verkleinert); der Parameter |
| Format, Abmessungen, EXIF-Zusammenfassung – ohne einen Pixel zu verbrauchen |
| Textextraktion mit Tesseract |
| Zuschneiden / Skalieren / Drehen / Spiegeln / Graustufen / Formatkonvertierung |
| Zwei Bilder nebeneinander in einem zusammengesetzten Bild |
Tool | Zweck |
| Metadaten + erkennt, ob eine Textebene existiert |
| Extraktion der Textebene (Seitenbereiche, Layout-Modus) |
| Seiten für das Modell als Bilder rendern (Scans, Abbildungen, Layout) |
| Tesseract-OCR für gescannte PDFs |
| Eingebettete Abbildungen/Fotos auf die Festplatte extrahieren |
video
Tool | Zweck |
| ffprobe für Dateien; yt-dlp-Metadaten für URLs (kein Download) |
| Das Video ansehen: gleichmäßige Abtastung oder exakte Zeitstempel |
| Untertitel über yt-dlp (URLs) oder eingebettete Untertitel (Dateien) |
| yt-dlp-Download mit Auflösungssteuerung |
| Abschnitte schneiden (Stream-Kopie oder Neuencodierung) |
| Audiospur in mp3/m4a/wav/flac/opus konvertieren |
audio
Tool | Zweck |
| Codec, Dauer, Tags |
| Format-/Bitrate-/Abtastraten-/Mono-Konvertierung |
| Abschnitt verlustfrei schneiden |
| Die Wellenform als Bild ansehen |
| Lokale Whisper-Spracherkennung (optionales |
Konfiguration (Umgebungsvariablen)
Variable | Standardwert | Bedeutung |
|
| Cache für URL-/Video-Downloads |
|
| Standard-Ausgabeort |
|
| Maximale Zeichenzahl für Textausgaben |
|
| Maximale Kantenlänge für zurückgegebene Bilder |
|
| JPEG-Qualität |
|
| Download-Obergrenze für direkte URLs |
Sicherheit und Datenschutz
Dieser Server arbeitet mit den Berechtigungen des Benutzers, der ihn startet. Die Tools können lokale Medien lesen, URLs abrufen, Medienverarbeitungs-Binaries ausführen und in vom Aufrufer gewählte Ausgabepfade schreiben. Tool-Antworten können absolute Pfade und Medien-Metadaten enthalten. Verbinden Sie nur vertrauenswürdige MCP-Clients.
Die HTTP-Transporte bieten keine Authentifizierung. Sie binden standardmäßig an Loopback; machen Sie sie nicht einem anderen Host oder einem nicht vertrauenswürdigen Netzwerk zugänglich, ohne einen separaten, authentifizierten Proxy und eine Netzwerk-Policy zu verwenden. URL-Abrufe können Adressen erreichen, die vom Host aus sichtbar sind, einschließlich Diensten in privaten Netzwerken.
Das optionale Whisper-Tool lädt beim ersten Aufruf das base-Modell von faster-whisper herunter und speichert es im Cache. Bereiten Sie diesen Modell-Cache für den Offline-Betrieb vorab vor.
Entwicklung
uv sync # install deps
uv run python tests/smoke_test.py [sample-video.mp4] # exercises every toolDer Smoke-Test erzeugt ein eigenes Testbild und ein eigenes Test-PDF; übergeben Sie eine lokale Videodatei, um zusätzlich die Video-/Audio-Toolsets abzudecken.
Lizenz
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityBmaintenanceEnables AI agents to process files locally — OCR images, extract text from PDFs and DOCX, and describe images using local vision models, all without sending data to external services.
- AlicenseAqualityDmaintenanceEnables AI agents to analyze images, extract text, compare images, and analyze video through any OpenAI-compatible vision model.455019MIT
- AlicenseNot gradedqualityAmaintenanceEnables agents to analyze long videos by downloading them, extracting transcripts and storyboards, and zooming into specific moments with high-resolution frames and OCR.MIT
- AlicenseNot gradedqualityBmaintenanceEnables text-only coding models to read images, PDFs, presentations, spreadsheets, and other non-text files through a single analyze_media tool, combining local document extraction, OCR, and optional vision models with clear evidence labeling.1MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Builderstar/openmedia-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server