Skip to main content
Glama

openmedia-mcp

Kontexteffiziente MCP-Server-Suite zum Extrahieren, Analysieren und Bearbeiten von Medien – Bilder, PDFs, Video, Audio – entwickelt für KI-Agenten.

Funktioniert mit jeder MCP-kompatiblen Host-Umgebung (opencode, Claude Code/Desktop, Cursor, Windsurf, Cline, LM Studio, ...) über stdio, streamable HTTP oder SSE.

Warum

Multimodale Modelle können sehen, aber die meisten Host-Umgebungen geben ihnen keine saubere Möglichkeit, sich ein Video, ein gescanntes PDF oder ein 20-MB-Foto anzusehen, ohne dabei entweder zu scheitern oder Unmengen an Kontext zu verbrauchen. openmedia-mcp behebt das mit festen Regeln:

  • Jede visuelle Ausgabe wird verkleinert und neu komprimiert, bevor sie das Modell erreicht (konfigurierbare maximale Kantenlänge / JPEG-Qualität).

  • Jede Textausgabe ist begrenzt durch einen expliziten Kürzungsmarker, der dem Modell mitteilt, wie es weitere Inhalte abrufen kann.

  • Frame-/Seitenlimits pro Aufruf (12 Frames, 8 Seiten) verhindern versehentliche Kontextfluten.

  • URLs werden vollwertig unterstützt: Video-Seiten-URLs (YouTube + über 1000 Websites via yt-dlp) werden einmalig mit ≤720p abgerufen und zwischengespeichert; direkte Datei-URLs werden mit einer Größenbegrenzung zwischengespeichert.

Related MCP server: Vision MCP Server

Anforderungen

Python ≥ 3.10 plus System-Binaries (alle werden zur Aufrufzeit mit aussagekräftigen Fehlermeldungen aufgelöst – nur die Tools, die Sie tatsächlich aufrufen, benötigen ihr Binary):

Binary

Benötigt für

Arch-Paket

ffmpeg/ffprobe

Video, Audio

ffmpeg

yt-dlp

Video-URLs, Downloads

yt-dlp

pdftotext/pdftoppm/pdfinfo/pdfimages

PDF

poppler

tesseract

image_ocr, pdf_ocr

tesseract + Sprachdaten

Optional: Mit pip install 'openmedia-mcp[whisper]' wird lokale Sprach-zu-Text-Erkennung (audio_transcribe) über faster-whisper aktiviert.

Installation & Ausführung

# From a local checkout
uv run --project /path/to/openmedia-mcp openmedia-mcp

# Or install as a tool
uv tool install git+https://github.com/Builderstar/openmedia-mcp.git
openmedia-mcp --tools pdf,image

opencode

{
  "mcp": {
    "openmedia": {
      "type": "local",
      "command": ["uv", "run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
    }
  }
}

Claude Desktop / generische MCP-Konfiguration

{
  "mcpServers": {
    "openmedia": {
      "command": "uv",
      "args": ["run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
    }
  }
}

HTTP-Transport

openmedia-mcp --transport streamable-http --host 127.0.0.1 --port 8756

Toolsets

Binden Sie mit --tools image,pdf,video,audio nur das ein, was die jeweilige Host-Umgebung benötigt (Standard: alle). media_probe ist immer verfügbar.

image

Tool

Zweck

image_view

Ein Bild ansehen (automatisch verkleinert); der Parameter region zoomt in Details

image_info

Format, Abmessungen, EXIF-Zusammenfassung – ohne einen Pixel zu verbrauchen

image_ocr

Textextraktion mit Tesseract

image_transform

Zuschneiden / Skalieren / Drehen / Spiegeln / Graustufen / Formatkonvertierung

image_compare

Zwei Bilder nebeneinander in einem zusammengesetzten Bild

pdf

Tool

Zweck

pdf_info

Metadaten + erkennt, ob eine Textebene existiert

pdf_read

Extraktion der Textebene (Seitenbereiche, Layout-Modus)

pdf_view

Seiten für das Modell als Bilder rendern (Scans, Abbildungen, Layout)

pdf_ocr

Tesseract-OCR für gescannte PDFs

pdf_extract_images

Eingebettete Abbildungen/Fotos auf die Festplatte extrahieren

video

Tool

Zweck

video_info

ffprobe für Dateien; yt-dlp-Metadaten für URLs (kein Download)

video_frames

Das Video ansehen: gleichmäßige Abtastung oder exakte Zeitstempel

video_transcript

Untertitel über yt-dlp (URLs) oder eingebettete Untertitel (Dateien)

video_download

yt-dlp-Download mit Auflösungssteuerung

video_clip

Abschnitte schneiden (Stream-Kopie oder Neuencodierung)

video_extract_audio

Audiospur in mp3/m4a/wav/flac/opus konvertieren

audio

Tool

Zweck

audio_info

Codec, Dauer, Tags

audio_convert

Format-/Bitrate-/Abtastraten-/Mono-Konvertierung

audio_trim

Abschnitt verlustfrei schneiden

audio_waveform

Die Wellenform als Bild ansehen

audio_transcribe

Lokale Whisper-Spracherkennung (optionales [whisper]-Extra)

Konfiguration (Umgebungsvariablen)

Variable

Standardwert

Bedeutung

OPENMEDIA_CACHE_DIR

~/.cache/openmedia-mcp

Cache für URL-/Video-Downloads

OPENMEDIA_ENPFAD (OUTPUT_DIR)

~/Downloads/openmedia

Standard-Ausgabeort

OPENMEDIA_TEXT_CAP

20000

Maximale Zeichenzahl für Textausgaben

OPENMEDIA_MAX_IMAGE_DIM

1024

Maximale Kantenlänge für zurückgegebene Bilder

OPENMEDIA_JPEG_QUALITY

80

JPEG-Qualität

OPENMEDIA_MAX_DOWNLOAD_BYTES

209715200

Download-Obergrenze für direkte URLs

Sicherheit und Datenschutz

Dieser Server arbeitet mit den Berechtigungen des Benutzers, der ihn startet. Die Tools können lokale Medien lesen, URLs abrufen, Medienverarbeitungs-Binaries ausführen und in vom Aufrufer gewählte Ausgabepfade schreiben. Tool-Antworten können absolute Pfade und Medien-Metadaten enthalten. Verbinden Sie nur vertrauenswürdige MCP-Clients.

Die HTTP-Transporte bieten keine Authentifizierung. Sie binden standardmäßig an Loopback; machen Sie sie nicht einem anderen Host oder einem nicht vertrauenswürdigen Netzwerk zugänglich, ohne einen separaten, authentifizierten Proxy und eine Netzwerk-Policy zu verwenden. URL-Abrufe können Adressen erreichen, die vom Host aus sichtbar sind, einschließlich Diensten in privaten Netzwerken.

Das optionale Whisper-Tool lädt beim ersten Aufruf das base-Modell von faster-whisper herunter und speichert es im Cache. Bereiten Sie diesen Modell-Cache für den Offline-Betrieb vorab vor.

Entwicklung

uv sync                          # install deps
uv run python tests/smoke_test.py [sample-video.mp4]   # exercises every tool

Der Smoke-Test erzeugt ein eigenes Testbild und ein eigenes Test-PDF; übergeben Sie eine lokale Videodatei, um zusätzlich die Video-/Audio-Toolsets abzudecken.

Lizenz

MIT

Install Server
A
license - permissive license
A
quality
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • 15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Builderstar/openmedia-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server