Skip to main content
Glama

openmedia-mcp

メディア(画像、PDF、動画、音声)を抽出・解析・操作するための、コンテキスト効率に優れたMCPサーバースイートです。AIエージェント向けに設計されています。

stdio、streamable HTTP、またはSSEを介して、あらゆるMCP互換ハーネス(opencode、Claude Code/Desktop、Cursor、Windsurf、Cline、LM Studioなど)で動作します。

なぜ

マルチモーダルモデルは見ることはできますが、ほとんどのハーネスには、動画、スキャン済みPDF、20MBの写真を、エラーを起こすことも、膨大なコンテキストを消費することもなく参照する手段がありません。openmedia-mcpは、厳格なルールでその問題を解決します:

  • すべての視覚出力は、モデルに到達する前に縮小+再圧縮されます(最大寸法・JPEG品質は設定可能)。

  • すべてのテキスト出力には上限が設定され、モデルがさらに取得する方法を示す明示的な切り詰めマーカーが付けられます。

  • 呼び出しごとのフレーム/ページ上限(12フレーム、8ページ)により、意図しないコンテキストの氾濫を防ぎます。

  • URLは第一級の対象です: 動画ページのURL(YouTube + yt-dlp対応の1000以上のサイト)は720p以下で一度だけ取得されキャッシュされます。直接指定するファイルURLのキャッシュにはサイズ上限が設定されます。

Related MCP server: Vision MCP Server

要件

Python ≥ 3.10に加えて、システムバイナリが必要です(すべて呼び出し時に解決され、対処方法がわかるエラーメッセージが返ります。実際に呼び出すツールにだけバイナリが必要です)。

バイナリ

用途

Archパッケージ

ffmpeg/ffprobe

動画、音声

ffmpeg

yt-dlp

動画URL、ダウンロード

yt-dlp

pdftotext/pdftoppm/pdfinfo/pdfimages

PDF

poppler

tesseract

image_ocr、pdf_ocr

tesseract + 言語データ

オプション: pip install 'openmedia-mcp[whisper]' を実行すると、faster-whisper によるローカル音声認識(audio_transcribe)が有効になります。

インストールと実行

# From a local checkout
uv run --project /path/to/openmedia-mcp openmedia-mcp

# Or install as a tool
uv tool install git+https://github.com/Builderstar/openmedia-mcp.git
openmedia-mcp --tools pdf,image

opencode

{
  "mcp": {
    "openmedia": {
      "type": "local",
      "command": ["uv", "run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
    }
  }
}

Claude Desktop / 一般的なMCP設定

{
  "mcpServers": {
    "openmedia": {
      "command": "uv",
      "args": ["run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
    }
  }
}

HTTPトランスポート

openmedia-mcp --transport streamable-http --host 127.0.0.1 --port 8756

ツールセット

指定したハーネスが必要とするものだけを --tools image,pdf,video,audio でマウントします(デフォルト: すべて)。media_probe は常に利用できます。

image

ツール

用途

image_view

画像を表示(自動縮小)。region パラメータで詳細を拡大表示

image_info

形式、寸法、EXIF概要を確認 — ピクセルは消費しない

image_ocr

Tesseractによるテキスト抽出

image_transform

切り抜き / リサイズ / 回転 / 反転 / グレースケール / 形式変換

image_compare

2枚の画像を1枚の合成画像として並べ、比較

pdf

ツール

用途

pdf_info

メタデータ + テキストレイヤーの有無を検出

pdf_read

テキストレイヤーの抽出(ページ範囲・レイアウトモード)

pdf_view

ページを画像としてレンダリング(スキャン、図版、レイアウトを確認)

pdf_ocr

スキャンPDF向けTesseract OCR

pdf_extract_images

埋め込まれた図・写真をディスクへ抽出

video

ツール

用途

video_info

ファイルはffprobe、URLはyt-dlpでメタデータ取得(ダウンロードなし)

video_frames

動画を確認: 均等サンプリングまたは正確なタイムスタンプで取得

video_transcript

字幕を取得(URLはyt-dlp、ファイルは埋め込み字幕)

video_download

解像度を制御できるyt-dlpダウンロード

video_clip

区間の切り出し(ストリームコピーまたは再エンコード)

video_extract_audio

音声トラックをmp3/m4a/wav/flac/opusで抽出

audio

ツール

用途

audio_info

コーデック、長さ、タグを確認

audio_convert

形式 / ビットレート / サンプルレート / モノラル変換

audio_trim

ロスレスで区間を切り出し

audio_waveform

波形を画像として表示

audio_transcribe

ローカルWhisperによる音声文字起こし(オプション [whisper] エクストラ)

設定(環境変数)

変数

デフォルト

説明

OPENMEDIA_CACHE_DIR

~/.cache/openmedia-mcp

URL・動画ダウンロードのキャッシュ

OPENMEDIA_OUTPUT_DIR

~/Downloads/openmedia

デフォルトの出力先

OPENMEDIA_TEXT_CAP

20000

テキスト出力のデフォルト最大文字数

OPENMEDIA_MAX_IMAGE_DIM

1024

返す画像のデフォルト最大編

OPENMEDIA_JPEG_QUALITY

80

デフォルトのJPEG品質

OPENMEDIA_MAX_DOWNLOAD_BYTES

209715200

ダイレクトURLダウンロードの上限

セキュリティとプライバシー

このサーバーは、起動したユーザーの権限で動作します。そのツールはローカルメディアを読み取り、URLを取得し、メディア処理バイナリを実行し、呼び出し元が指定した出力パスに書き込むことができます。ツールの応答には絶対パスやメディアのメタデータが含まれることがあります。信頼できるMCPクライアントだけを接続してください。

HTTPトランスポートは認証を提供しません。デフォルトではループバックにのみバインドされます。認証付きの別プロキシとネットワークポリシーを別途用意しない限り、他のホストや信頼できないネットワークに公開しないでください。URLの取得は、ホストから見えるアドレス(プライベートネットワークのサービスを含む)へ到達できます。

オプションのWhisperツールは、初回使用時に base faster-whisper モデルをダウンロードしキャッシュします。オフライン運用のために、事前にそのモデルキャッシュを準備しておいてください。

開発

uv sync                          # install deps
uv run python tests/smoke_test.py [sample-video.mp4]   # exercises every tool

スモークテストは、テスト用の画像とPDFを自動作成します。ローカルの動画ファイルを渡すと、動画・音声のツールセットもカバーされます。

ライセンス

MIT

Install Server
A
license - permissive license
A
quality
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • 15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Builderstar/openmedia-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server