Skip to main content
Glama

ai-media-mcp

Un servidor MCP de un solo archivo y sin dependencias para la generación de imágenes y vídeo con GPT-Image / Gemini / Grok / Jimeng, con cero base64: todo se guarda en disco y solo se devuelven rutas de archivo.

Se requiere Node.js 18+. Sin npm install, sin paso de compilación. Solo ejecuta el .mjs.


✨ Características

  • 🖼 Generación de imágenesgenerate_image: una única ruta compatible con OpenAI, paso del nombre del modelo (gpt-image-2 / gemini-3-pro-image / grok-imagine-image-quality / doubao-seedream / modelos de imagen de Jimeng…)

  • 🎬 Generación de vídeogenerate_video (solo envío) / get_video_status (sondeo) / generate_video_and_wait (envío → sondeo → descarga). Enruta automáticamente el vídeo de Grok y el de Jimeng.

  • 🔑 Enrutamiento con múltiples claves — los distintos modelos usan automáticamente su propia clave de API y URL base (algo habitual en pasarelas relay/agregadoras).

  • 🚫 Cero base64 — las imágenes y los vídeos se guardan en el disco local; las respuestas solo contienen Guardado en: ... (~350 bytes frente a ~3 MB con los envoltorios típicos de MCP).

  • 📚 Consulta de capacidadeslist_model_capabilities: consulta resoluciones / proporciones de aspecto / duraciones admitidas por modelo; búsqueda inversa (size: "720p", aspect_ratio: "21:9"). Coste cero.

  • 🖼 Imágenes de referencia múltiples (image-to-image) — array images (hasta 5): imagen múltiple nativa de Gemini mediante múltiples inlineData; arrays de GPT/Grok con salto automático de edits → generations. Se conserva el modelo solicitado; GPT, Gemini y Grok han superado las pruebas de pasarela con dos referencias.

  • 🎬 Vídeo con imagen de referencia (image-to-video) — una sola image (Grok image_url, Jimeng first_frame_url) o varias images (Jimeng reference_image_urls hasta 9, array image_url de Grok como alternativa).

  • ✍️ Mejora automática del promptauto_prompt: true (por defecto): si el prompt tiene menos de 15 caracteres y hay imágenes de referencia, se aplica una plantilla interna de «fusión sin costuras» (iluminación / perspectiva / ajuste de color / instrucciones anti-recorte, verificadas en generaciones reales).

  • 🧪 @chatbox-latest — pasa image: "@chatbox-latest" para leer automáticamente la imagen más reciente arrastrada en la ventana de Chatbox (chatbox-blobs\pictureinput-*). Los alias repetidos en images conservan el orden de los adjuntos de la interfaz.

  • 🔎 Referencias verificables — cada imagen generada informa metadatos reference_images ordenados en función de los bytes exactos enviados: etiqueta de origen segura, MIME, número de bytes, dimensiones y SHA-256.

  • 📥 Entrega en sandbox — los llamadores pueden pasar su sandbox de escritura como output_dir, mantener return_mode: "path" y convertir los archivos devueltos en tarjetas de descarga sin mover archivos desde directorios externos no relacionados.


Related MCP server: imagen-mcp

📦 Instalación

# Just clone/copy the mjs and run it directly
node ai-media-mcp.mjs

Sin dependencias npm. Añádelo a tu cliente MCP (p. ej., Chatbox / Claude Desktop) como servidor stdio:

{
  "command": "node",
  "args": ["/path/to/ai-media-mcp.mjs"],
  "env": { "...": "see .env.example" }
}

⚙️ Configuración

Todas las variables son opcionales. Un grupo recurre a la variable unificada AI_MEDIA_API_KEY / AI_MEDIA_BASE_URL solo cuando su variable de grupo está ausente. Si una clave de grupo está explícitamente presente pero vacía (por ejemplo, AI_MEDIA_JIMENG_API_KEY=), ese grupo queda deshabilitado y no reutilizará la clave de otro proveedor.

Variable

Grupo

Descripción

AI_MEDIA_GPT_API_KEY / AI_MEDIA_GPT_BASE_URL

GPT

gpt-image-2 / doubao-* / imágenes Jimeng

AI_MEDIA_GEMINI_API_KEY / AI_MEDIA_GEMINI_BASE_URL

Gemini

API Gemini nativa (/v1beta/models/...:generateContent)

AI_MEDIA_GROK_API_KEY / AI_MEDIA_GROK_BASE_URL

Grok

grok-imagine-image-quality / grok-imagine-video

AI_MEDIA_JIMENG_API_KEY / AI_MEDIA_JIMENG_BASE_URL

Jimeng

as-sd2.0-fast / video-ds-2.0

AI_MEDIA_API_KEY / AI_MEDIA_BASE_URL

unificado

recurso para todos los grupos

AI_MEDIA_IMAGE_MODEL

modelo de imagen por defecto (gpt-image-2)

AI_MEDIA_VIDEO_MODEL

modelo de vídeo por defecto (grok-imagine-video)

AI_MEDIA_IMAGE_OUTPUT_DIR / AI_MEDIA_VIDEO_OUTPUT_DIR

directorios de salida

AI_MEDIA_RETURN_MODE

path (por defecto, cero base64) / inline / both

AI_MEDIA_AUTO_PROMPT

auto (por defecto) / never

AI_MEDIA_TIMEOUT_MS / AI_MEDIA_POLL_INTERVAL_MS

tiempos de espera


🧭 Enrutado

Por prefijo del modelo:

Prefijo del modelo

Grupo

API

gemini-* / imagen-*

Gemini

API nativa /v1beta/models/{model}:generateContent

grok-*

Grok

compatible con OpenAI

video-ds* / as-sd*

Jimeng

/videos basado en tareas

resto (gpt-*, doubao-*, imágenes Jimeng)

GPT

compatible con OpenAI


🛠️ Herramientas

Herramienta

Finalidad

generate_image

Generar imágenes (n, tamaño / proporción / calidad, referencias image/images, auto_prompt)

generate_video

Enviar una tarea de vídeo únicamente (conmutación automática Grok/Jimeng, admite image/images).

get_video_status

Consultar el estado de la tarea

generate_video_and_wait

Enviar → sondear → descargar a output_dir (o el alias configurado por defecto) y devolver la ruta del archivo

list_model_capabilities

Consultar capacidades del modelo (resoluciones / proporciones / duraciones), búsqueda inversa por tamaño o proporción

probe_capabilities

Probar los tamaños / proporciones reales admitidos con llamadas mínimas y almacenar en caché los resultados


📄 Licencia

MIT

Install Server
A
license - permissive license
A
quality
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Generate images, video, and audio with Glif's media-generation agent

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/wojiaopanhaoran/ai-media-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server