Skip to main content
Glama

ai-media-mcp

첫일 파일, 무의존성 MCP 서버로, GPT-Image / De... / Grok / Jimeng에서 이미지 & 비디오 생성을 지원하고, base64 제로 — 모든 결과물은 디스크에 저장되고 파이 경로만 반환됩니다.

Node.js 18+ 필요. npm install도, 빌드 단계도 필요 없습니다. 그있는 .mjs를 실했하면 됩니다.


✨ 기능

  • 🖼 이미지 생성generate_image: OpenAI 호환 경로 하나로 모델 이름을 그대로 전달 (gpt-image-2 / gemini-3-pro-image / grok-imagine-image-quality / doubao-seedream / Jimeng 이미지 모등) …

  • 🎬 비디오 생성generate_video (제출 전용) / get_video_status (폴링) / generate_video_and_wait (제출 → 폴링 → 다운 로드)로 나니다. Grok 비디오와 Jimeng 비디오 도 자동으로 유팅됩니다.

  • 🔑 멀티 키 라우팅 — 다른 모델은 각자에 **API 키와** base URL`을 자동으로 사용합니다 (릴레이/애그리게이터 게이트웨에서 흔한 형기)

  • 🚫 base64 제로 — 이미지/비디오는 로컬 디스크에 저장되며, 응답에는 Saved to: ...만 들어갑니다 (일반적인 MCP 래퍼의 약 3 MB 대신 약 350바이트)

  • 🔎 기능 조회list_model_capabilities: 모델별 지원 해상도 = 종횡주 with Ratio, 지속 시간 조회, (size: "720p", aspect_rao: "21:9") 역방향 조회, 비융 없는

  • ** 다중 참조 이미지 (image-to-image)**images배열 (최대 5개): Gemini는 inlineData 여러 개를 사용하는 네이티브 다중 이미지를, GPT/Grok 배열은 자동 ed : :e : → generation fallback. 요정한 모델이 그대 유지되며, GPT·Gemini·Grok 각각 참조 이미지 2개의 게이트웨 테스터를 통과했습니다.

  • 🎬 참조 이미지 비디오 (image-to-video) — 단일 image(roid image_url, Jimeng first_frame_url) 또는 다중 images (Jimeng reference_image_urls 최대 9개, Grok image_url배열 폴백) 를 지원합니다.

  • ✍️ 자동 프롬프트 개→선auto_prompt: true (기본값): 프롬프트가 15자 미만이고 참조 이미지가 있으면 내부적인 "seamless fusion" 템를 플렛이 표현됩니다 (조명/원근감/커러 그레이팅 / 컸아웆 방지 지침은 실생에서).

  • 🎪 @chatbot-lates옇["image: "@chatbox-latest"를 전달하면 Chatbox 창에 끄어다 드롭든 가장 최근 이미지를 자동으로 읽습니다 (chatbox-blobs\usemu-*). images에 같은 별칭을 여러 번 사용하면 UI 첨부 순서가 유지됩니다.

  • 檢證 가능한 참조 정보 — 생성된 이지마다 상류에 전송된 바이트와 일치하는 reference_images 메타 데이터(안전한 소스 라벨, MIME, 크기, SHA-256)가 list 형태로 반환됩니다.

  • **** — 호출자가 쓰기 가능한 샌드박스를 output_dir로 넘기고 return_mode: "path"를 유지하면, 무관한 외부 디렉토리에서 파이 옮기지 않와도 반환된 파이을 다은로드 카드로 만들 수 있습니다.


Related MCP server: imagen-mcp

📦 설채

# Just clone/copy the mjs and run it directly
node ai-media-mcp.mjs

npm 의존성이 없습니다. MCP 클라이언트(예: Chatbox / Claude Desktop)에 stdio 서버로 추가하세요:

{
  "command": "node",
  "args": ["/path/to/ai-media-mcp.mjs"],
  "env": { "...": "see .env.example" }
}

설정

모든 변수는 선택 사항입니다. 그룹 변수이 없을 때만 그룹은 통합 AI_MEDIA_API_KEY / AI_MEDIA_BASE_URL로 폴백됩니다. 그룹 의 키가 명시적으로 잆재하지만 비어 있른(예: AI_MEDIA_JIMENG_API_KEY=) 경우 그 그룹은 비활성화되고 다른 제등업체의 키를 사등하지 않습니다.

변수

프로필

설명

AI_MEDIA_GPT_API_KEE / AI_MEDIA_GPT_BASE_URL

GPT

gpt-image-2 / doubao-* / Jimeng 이미지

AI_MEDIA_GEMINI_API_KEY / AI_MEDIA_GEMINI_BASE_URL

Gemini

Gemini 네티브 API (/v1beta/models/...:generateContent)

AI_MEDIA_GROK_API_KEY / AI_MEDIA_GROK_BASE_URL

Grok

grok-imagine-imge-qualty / grok-imagine-video

AI_MEDIA_JIMENG_API_KEY / AI_MEDIA_JIMENG_BASE_URL

Jimeng

as-sd2.0-fast / video-ds-2.0

AI_MEDIA_API_KEY / AI_MEDIA_BASE_URL

통합

모든 그룹 폴백

AI_MEDIA_IMAGE_MODEL

기본 이미지 모델 (gpt-image-2)

AI_MEDIA_VIDE_ODEL

기본 비디오 모델 (grok-imagine-video)

AI_MEDIA_IMAGE_OUTPUT_DIR / AI_MEDIA_VIDE_O_OUTPUT_DIR

출력 디렉터리

AI_MEDIA_RETURN_MODE

path (기본, base64 제로) / inline / both

AI_MEDIA_AUTO_PROMPT

auto (기본) / never

AI_MEDIA_TIMEOUT_MS / AI_MEDIA_POLL_INTERVAL_MS

타임아웃 · 폴링 주기


라 우팅

모델 이름 프리스 기준 라우팅:

모델 (모델)

그룹

API

gemini-* / imagen-*

Gemini

네티브 /v1beta/models/{model}:generateContent

grok-*

Grok

OpenAI 호환

video-ds* / as-sd*

Jimeng

태스트 기반 /videos

그 외 (gpt-*, doubao-*, Jimeng 이미지)

GPT

OpenAI 호 환


다운로드 & 도구

도구

도구

search_image

이미지 생성 (n, size / aspect_ratio / quality, image / images 참조, auto_prompt)

search_video

비디오 작업 제출만 (Grok/Jimeng 자유팅, image / images 참조 지원)

get_video_status

(비) Video 작업 상태 조회

search_video_and_wait

제출 → 폴링 → 다운로드 (output_dir 기본), 파이 경로 반환

list_mmodel_capabilities

모델 기능 조회 (해상도 / 모브 ratios / 지속시간), size·ratio 역조회

probe_capabilities

실제 호출을 통해 지원되는 크기 / 비율을 조사하여 결과 (cache)


📄 라이선스

MIT

Install Server
A
license - permissive license
A
quality
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Generate images, video, and audio with Glif's media-generation agent

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/wojiaopanhaoran/ai-media-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server