openmedia-mcp
openmedia-mcp
メディア(画像、PDF、動画、音声)を抽出・解析・操作するための、コンテキスト効率に優れたMCPサーバースイートです。AIエージェント向けに設計されています。
stdio、streamable HTTP、またはSSEを介して、あらゆるMCP互換ハーネス(opencode、Claude Code/Desktop、Cursor、Windsurf、Cline、LM Studioなど)で動作します。
なぜ
マルチモーダルモデルは見ることはできますが、ほとんどのハーネスには、動画、スキャン済みPDF、20MBの写真を、エラーを起こすことも、膨大なコンテキストを消費することもなく参照する手段がありません。openmedia-mcpは、厳格なルールでその問題を解決します:
すべての視覚出力は、モデルに到達する前に縮小+再圧縮されます(最大寸法・JPEG品質は設定可能)。
すべてのテキスト出力には上限が設定され、モデルがさらに取得する方法を示す明示的な切り詰めマーカーが付けられます。
呼び出しごとのフレーム/ページ上限(12フレーム、8ページ)により、意図しないコンテキストの氾濫を防ぎます。
URLは第一級の対象です: 動画ページのURL(YouTube +
yt-dlp対応の1000以上のサイト)は720p以下で一度だけ取得されキャッシュされます。直接指定するファイルURLのキャッシュにはサイズ上限が設定されます。
Related MCP server: Vision MCP Server
要件
Python ≥ 3.10に加えて、システムバイナリが必要です(すべて呼び出し時に解決され、対処方法がわかるエラーメッセージが返ります。実際に呼び出すツールにだけバイナリが必要です)。
バイナリ | 用途 | Archパッケージ |
| 動画、音声 |
|
| 動画URL、ダウンロード |
|
|
| |
| image_ocr、pdf_ocr |
|
オプション: pip install 'openmedia-mcp[whisper]' を実行すると、faster-whisper によるローカル音声認識(audio_transcribe)が有効になります。
インストールと実行
# From a local checkout
uv run --project /path/to/openmedia-mcp openmedia-mcp
# Or install as a tool
uv tool install git+https://github.com/Builderstar/openmedia-mcp.git
openmedia-mcp --tools pdf,imageopencode
{
"mcp": {
"openmedia": {
"type": "local",
"command": ["uv", "run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}Claude Desktop / 一般的なMCP設定
{
"mcpServers": {
"openmedia": {
"command": "uv",
"args": ["run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}HTTPトランスポート
openmedia-mcp --transport streamable-http --host 127.0.0.1 --port 8756ツールセット
指定したハーネスが必要とするものだけを --tools image,pdf,video,audio でマウントします(デフォルト: すべて)。media_probe は常に利用できます。
image
ツール | 用途 |
| 画像を表示(自動縮小)。 |
| 形式、寸法、EXIF概要を確認 — ピクセルは消費しない |
| Tesseractによるテキスト抽出 |
| 切り抜き / リサイズ / 回転 / 反転 / グレースケール / 形式変換 |
| 2枚の画像を1枚の合成画像として並べ、比較 |
ツール | 用途 |
| メタデータ + テキストレイヤーの有無を検出 |
| テキストレイヤーの抽出(ページ範囲・レイアウトモード) |
| ページを画像としてレンダリング(スキャン、図版、レイアウトを確認) |
| スキャンPDF向けTesseract OCR |
| 埋め込まれた図・写真をディスクへ抽出 |
video
ツール | 用途 |
| ファイルはffprobe、URLはyt-dlpでメタデータ取得(ダウンロードなし) |
| 動画を確認: 均等サンプリングまたは正確なタイムスタンプで取得 |
| 字幕を取得(URLはyt-dlp、ファイルは埋め込み字幕) |
| 解像度を制御できるyt-dlpダウンロード |
| 区間の切り出し(ストリームコピーまたは再エンコード) |
| 音声トラックをmp3/m4a/wav/flac/opusで抽出 |
audio
ツール | 用途 |
| コーデック、長さ、タグを確認 |
| 形式 / ビットレート / サンプルレート / モノラル変換 |
| ロスレスで区間を切り出し |
| 波形を画像として表示 |
| ローカルWhisperによる音声文字起こし(オプション |
設定(環境変数)
変数 | デフォルト | 説明 |
|
| URL・動画ダウンロードのキャッシュ |
|
| デフォルトの出力先 |
|
| テキスト出力のデフォルト最大文字数 |
|
| 返す画像のデフォルト最大編 |
|
| デフォルトのJPEG品質 |
|
| ダイレクトURLダウンロードの上限 |
セキュリティとプライバシー
このサーバーは、起動したユーザーの権限で動作します。そのツールはローカルメディアを読み取り、URLを取得し、メディア処理バイナリを実行し、呼び出し元が指定した出力パスに書き込むことができます。ツールの応答には絶対パスやメディアのメタデータが含まれることがあります。信頼できるMCPクライアントだけを接続してください。
HTTPトランスポートは認証を提供しません。デフォルトではループバックにのみバインドされます。認証付きの別プロキシとネットワークポリシーを別途用意しない限り、他のホストや信頼できないネットワークに公開しないでください。URLの取得は、ホストから見えるアドレス(プライベートネットワークのサービスを含む)へ到達できます。
オプションのWhisperツールは、初回使用時に base faster-whisper モデルをダウンロードしキャッシュします。オフライン運用のために、事前にそのモデルキャッシュを準備しておいてください。
開発
uv sync # install deps
uv run python tests/smoke_test.py [sample-video.mp4] # exercises every toolスモークテストは、テスト用の画像とPDFを自動作成します。ローカルの動画ファイルを渡すと、動画・音声のツールセットもカバーされます。
ライセンス
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityBmaintenanceEnables AI agents to process files locally — OCR images, extract text from PDFs and DOCX, and describe images using local vision models, all without sending data to external services.
- AlicenseAqualityDmaintenanceEnables AI agents to analyze images, extract text, compare images, and analyze video through any OpenAI-compatible vision model.455019MIT
- AlicenseNot gradedqualityAmaintenanceEnables agents to analyze long videos by downloading them, extracting transcripts and storyboards, and zooming into specific moments with high-resolution frames and OCR.MIT
- AlicenseNot gradedqualityBmaintenanceEnables text-only coding models to read images, PDFs, presentations, spreadsheets, and other non-text files through a single analyze_media tool, combining local document extraction, OCR, and optional vision models with clear evidence labeling.1MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Builderstar/openmedia-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server