openmedia-mcp
openmedia-mcp
Suite de servidor MCP eficiente en el uso de contexto para extraer, analizar y manipular medios — imágenes, PDFs, vídeo, audio — diseñada para agentes de IA.
Funciona con cualquier cliente compatible con MCP (opencode, Claude Code/Desktop, Cursor, Windsurf, Cline, LM Studio, ...) a través de stdio, HTTP transmisible o SSE.
Por qué
Los modelos multimodales pueden ver, pero la mayoría de los clientes no les dan una forma limpia de ver un vídeo, un PDF escaneado o una foto de 20 MB sin fallar ni gastar una enorme cantidad de contexto. openmedia-mcp lo soluciona con reglas estrictas:
Toda salida visual se reduce de escala y se vuelve a comprimir antes de llegar al modelo (dimensión máxima y calidad JPEG configurables).
Cada salida de texto se limita con un marcador explícito de truncamiento que le indica al modelo cómo obtener más.
Límites de fotogramas/páginas por llamada (12 fotogramas, 8 páginas) evitan las inundaciones accidentales de contexto.
Las URLs son de primera clase: las URLs de páginas de vídeo (YouTube + más de 1000 sitios mediante yt-dlp) se obtienen una sola vez a ≤720p y se guardan en caché; las URLs directas de archivo se guardan en caché con un límite de tamaño.
Related MCP server: Vision MCP Server
Requisitos
Python ≥ 3.10 más binarios del sistema (todos se resuelven en el momento de la llamada con mensajes de error accionables; solo las herramientas que realmente use cada uno necesitan su binario):
Binario | Necesario para | Paquete de Arch |
| vídeo, audio |
|
| URLs de vídeo, descargas |
|
|
| |
| image_ocr, pdf_ocr |
|
Opcional: pip install 'openmedia-mcp[whisper]' habilita la transcripción local de voz a texto (audio_transcribe) mediante faster-whisper.
Instalación y ejecución
# From a local checkout
uv run --project /path/to/openmedia-mcp openmedia-mcp
# Or install as a tool
uv tool install git+https://github.com/Builderstar/openmedia-mcp.git
openmedia-mcp --tools pdf,imageopencode
{
"mcp": {
"openmedia": {
"type": "local",
"command": ["uv", "run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}Claude Desktop / configuración MCP genérica
{
"mcpServers": {
"openmedia": {
"command": "uv",
"args": ["run", "--project", "/home/you/projects/openmedia-mcp", "openmedia-mcp"]
}
}
}Transporte HTTP
openmedia-mcp --transport streamable-http --host 127.0.0.1 --port 8756Conjuntos de herramientas
Carga únicamente lo que un cliente concreto necesite con --tools image,pdf,video,audio (por defecto: todos). media_probe está siempre disponible.
image
Tool | Propósito |
| Ver una imagen (con reducción automática de escala); el parámetro |
| Formato, dimensiones, resumen EXIF — sin gastar píxeles |
| Extracción de texto con Tesseract |
| recortar / redimensionar / rotar / voltear / escala de grises / convertir formato |
| Dos imágenes lado a lado en un composite |
Tool | Propósito |
| Metadatos + detecta si existe una capa de texto |
| Extracción de la capa de texto (rangos de página, modo de diseño) |
| Renderizar páginas como imágenes para el modelo (escaneos, figuras, diseño) |
| OCR con Tesseract para PDF de escaneado |
| Extrae figuras/fotos incrustadas al disco |
video
Herramienta | Propósito |
|
|
| Ver el vídeo: muestreo uniforme o marcas de tiempo exactas |
| Subtítulos mediante yt-dlp (URLs) o subtítulos incrustados (archivos) |
| Descarga con yt-dlp y control de resolución |
| Cortar secciones (copia de flujo o re-codificación) |
| Extraer pista de audio a mp3/m4a/wav/flac/opus |
audio
Herramienta | Propósito |
| Códec, duración, etiquetas |
| Conversión de formato/bitrate/frecuencia de muestreo/mono |
| Corte de sección sin pérdidas |
| Ver la forma de onda como imagen |
| Transcripción local con Whisper (extra opcional |
Configuración (variables de entorno)
Variable | Predeterminado | Descripción |
|
| Caché de descargas de URLs y vídeos |
|
| Ubicación de salida predeterminada |
|
| Máximo de caracteres por defecto para salidas de texto |
|
| Lado más largo predeterminado para imágenes devueltas |
|
| Calidad JPEG predeterminada |
|
| Tope de descarga para URLs directas |
Seguridad y privacidad
Este servidor actúa con los permisos del usuario que lo inicia. Sus herramientas pueden leer medios locales, obtener URLs, ejecutar binarios de procesamiento de medios y escribir en rutas de salida seleccionadas por quien llama. Las respuestas de las herramientas pueden incluir rutas absolutas y metadatos de medios. Conecte únicamente clientes MCP de confianza.
Los transportes HTTP no proporcionan autenticación. Se vinculan a loopback por defecto; no los exponga a otros hosts ni a una red no confiable sin un proxy autenticado y una política de red por separado. La obtención de URLs puede alcanzar direcciones visibles desde el host, incluidos servicios de redes privadas.
La herramienta opcional de Whisper descarga y guarda en caché el modelo base de faster-whisper en la primera ejecución. Prepare la caché de ese modelo con antelación para operar en modo sin conexión.
Desarrollo
uv sync # install deps
uv run python tests/smoke_test.py [sample-video.mp4] # exercises every toolLa prueba de humo genera su propia imagen de prueba y su propio PDF; pásale cualquier archivo de vídeo local para cubrir también los conjuntos de herramientas de vídeo/audio.
Licencia
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityBmaintenanceEnables AI agents to process files locally — OCR images, extract text from PDFs and DOCX, and describe images using local vision models, all without sending data to external services.
- AlicenseAqualityDmaintenanceEnables AI agents to analyze images, extract text, compare images, and analyze video through any OpenAI-compatible vision model.455019MIT
- AlicenseNot gradedqualityAmaintenanceEnables agents to analyze long videos by downloading them, extracting transcripts and storyboards, and zooming into specific moments with high-resolution frames and OCR.MIT
- AlicenseNot gradedqualityBmaintenanceEnables text-only coding models to read images, PDFs, presentations, spreadsheets, and other non-text files through a single analyze_media tool, combining local document extraction, OCR, and optional vision models with clear evidence labeling.1MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
15 media & data tools for AI agents: search, transcribe, subtitles, voiceover, translate & more.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Builderstar/openmedia-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server