ai-media-mcp
ai-media-mcp
Un servidor MCP de un solo archivo y sin dependencias para la generación de imágenes y vídeo con GPT-Image / Gemini / Grok / Jimeng, con cero base64: todo se guarda en disco y solo se devuelven rutas de archivo.
Se requiere Node.js 18+. Sin
npm install, sin paso de compilación. Solo ejecuta el.mjs.
✨ Características
🖼 Generación de imágenes —
generate_image: una única ruta compatible con OpenAI, paso del nombre del modelo (gpt-image-2/gemini-3-pro-image/grok-imagine-image-quality/doubao-seedream/ modelos de imagen de Jimeng…)🎬 Generación de vídeo —
generate_video(solo envío) /get_video_status(sondeo) /generate_video_and_wait(envío → sondeo → descarga). Enruta automáticamente el vídeo de Grok y el de Jimeng.🔑 Enrutamiento con múltiples claves — los distintos modelos usan automáticamente su propia clave de API y URL base (algo habitual en pasarelas relay/agregadoras).
🚫 Cero base64 — las imágenes y los vídeos se guardan en el disco local; las respuestas solo contienen
Guardado en: ...(~350 bytes frente a ~3 MB con los envoltorios típicos de MCP).📚 Consulta de capacidades —
list_model_capabilities: consulta resoluciones / proporciones de aspecto / duraciones admitidas por modelo; búsqueda inversa (size: "720p",aspect_ratio: "21:9"). Coste cero.🖼 Imágenes de referencia múltiples (image-to-image) — array
images(hasta 5): imagen múltiple nativa de Gemini mediante múltiplesinlineData; arrays de GPT/Grok con salto automático deedits → generations. Se conserva el modelo solicitado; GPT, Gemini y Grok han superado las pruebas de pasarela con dos referencias.🎬 Vídeo con imagen de referencia (image-to-video) — una sola
image(Grokimage_url, Jimengfirst_frame_url) o variasimages(Jimengreference_image_urlshasta 9, arrayimage_urlde Grok como alternativa).✍️ Mejora automática del prompt —
auto_prompt: true(por defecto): si el prompt tiene menos de 15 caracteres y hay imágenes de referencia, se aplica una plantilla interna de «fusión sin costuras» (iluminación / perspectiva / ajuste de color / instrucciones anti-recorte, verificadas en generaciones reales).🧪
@chatbox-latest— pasaimage: "@chatbox-latest"para leer automáticamente la imagen más reciente arrastrada en la ventana de Chatbox (chatbox-blobs\pictureinput-*). Los alias repetidos enimagesconservan el orden de los adjuntos de la interfaz.🔎 Referencias verificables — cada imagen generada informa metadatos
reference_imagesordenados en función de los bytes exactos enviados: etiqueta de origen segura, MIME, número de bytes, dimensiones y SHA-256.📥 Entrega en sandbox — los llamadores pueden pasar su sandbox de escritura como
output_dir, mantenerreturn_mode: "path"y convertir los archivos devueltos en tarjetas de descarga sin mover archivos desde directorios externos no relacionados.
Related MCP server: imagen-mcp
📦 Instalación
# Just clone/copy the mjs and run it directly
node ai-media-mcp.mjsSin dependencias npm. Añádelo a tu cliente MCP (p. ej., Chatbox / Claude Desktop) como servidor stdio:
{
"command": "node",
"args": ["/path/to/ai-media-mcp.mjs"],
"env": { "...": "see .env.example" }
}⚙️ Configuración
Todas las variables son opcionales. Un grupo recurre a la variable unificada AI_MEDIA_API_KEY / AI_MEDIA_BASE_URL solo cuando su variable de grupo está ausente. Si una clave de grupo está explícitamente presente pero vacía (por ejemplo, AI_MEDIA_JIMENG_API_KEY=), ese grupo queda deshabilitado y no reutilizará la clave de otro proveedor.
Variable | Grupo | Descripción |
| GPT |
|
| Gemini | API Gemini nativa ( |
| Grok |
|
| Jimeng |
|
| unificado | recurso para todos los grupos |
| — | modelo de imagen por defecto ( |
| — | modelo de vídeo por defecto ( |
| — | directorios de salida |
| — |
|
| — |
|
| — | tiempos de espera |
🧭 Enrutado
Por prefijo del modelo:
Prefijo del modelo | Grupo | API |
| Gemini | API nativa |
| Grok | compatible con OpenAI |
| Jimeng |
|
resto ( | GPT | compatible con OpenAI |
🛠️ Herramientas
Herramienta | Finalidad |
| Generar imágenes (n, tamaño / proporción / calidad, referencias |
| Enviar una tarea de vídeo únicamente (conmutación automática Grok/Jimeng, admite |
| Consultar el estado de la tarea |
| Enviar → sondear → descargar a |
| Consultar capacidades del modelo (resoluciones / proporciones / duraciones), búsqueda inversa por tamaño o proporción |
| Probar los tamaños / proporciones reales admitidos con llamadas mínimas y almacenar en caché los resultados |
📄 Licencia
MIT
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityCmaintenanceEnables AI image generation through multiple providers including OpenAI GPT-Image-1, Google Imagen 4, Gemini 2.5 Flash (Nano Banana), Flux 1.1, Qwen Image, and SeedDream-4, supporting various formats, sizes, and advanced features like background control and seed-based reproduction.3810MIT
- AlicenseAqualityBmaintenanceEnables intelligent multi-provider image generation through OpenAI and Google Gemini APIs with automatic provider selection, support for reference images, real-time data grounding, and conversational refinement.8MIT
- FlicenseNot gradedqualityDmaintenanceEnables image generation, editing, and refinement using Google's Gemini 2.5 Flash Image model with support for multi-image composition and style transfer.
- FlicenseNot gradedqualityDmaintenanceEnables AI-powered image generation using Google's Gemini 2.5 Flash Image Preview model, supporting text-to-image and image-to-image generation through the MCP interface.
Related MCP Connectors
Generate images, video, and audio with Glif's media-generation agent
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/wojiaopanhaoran/ai-media-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server