midasheng-gen-mcp
midasheng-gen-mcp
텍스트로부터 일관된 16kHz 혼합 오디오 장면 생성 — 음성, 음악, 효과음, 분위기를 한 번에 처리 — MiDashengLM-Gen (샤오미 연구소) 기반, LLM 기반 자기회귀 흐름 매칭 모델 (Qwen3-1.7B 백본, 총 2.9B 파라미터). Apache-2.0, 전적으로 GPU에서 실행.
이것이 감싸는 것
MiDashengLM-Gen — 논문에 따르면 최초의 종단간 학습 일반 텍스트-오디오 모델: LLM이 토큰별 흐름 매칭을 구동하여 전용 TTS에 근접한 음성 명료도(Seed-TTS WER 12.15% → 2.79% vs 전용 TTS 1.24%)로 가변 길이 오디오 장면을 생성합니다. 9개 언어와 감정 제어 지원. 체크포인트는 Hugging Face에서 자동 다운로드 (~6 GB). 모델 가중치는 절대 번들로 제공되지 않음 — docs/WRAPPEE.md 참조.
Related MCP server: MMAudio MCP
할 수 있는 일
작동 방식: 로컬 FastMCP 3.4 서버 (Claude Desktop용 stdio, Cursor/webapp용 HTTP /mcp)와 React 대시보드. 모델은 첫 생성 시 지연 로딩되며 GPU에 유지되다가 언로드됩니다.
방향 | 산출물 | 비고 |
입력 | 구조화된 캡션 (caption/asr/speech/sfx/music/env 뷰), guidance + seed 파라미터 | MCP 도구, REST, 또는 웹앱을 통해 |
출력 | 16kHz 모노 WAV 장면, SQLite에 인덱싱, 탐색/내보내기 가능 |
|
한 번의 호출로 전체 사운드스케이프 생성 — 군중 웃음 + 재즈 스팅 + 코미디 대사, 또는 비 + 천둥 + 숲 분위기
전용 TTS 수준에 근접한 음성 명료도, 9개 언어,
speech뷰를 통한 감정 제어웹앱에서 페이지네이션, 오디오 재생, 내보내기가 가능한 장면 라이브러리
긴 생성을 위한 비동기 작업 API, 채팅 내 프리팹 UI 카드
학습된 정지 헤드로 가변 길이 출력 — 고정 길이 절단 없음
빠른 설치
가장 빠른 방법은 Claude Desktop용 .mcpb 번들입니다 (모든 옵션은 INSTALL.md 참조):
Releases에서
midasheng-gen-mcp-v0.1.0.mcpb다운로드Claude Desktop으로 드래그 앤 드롭
처음 사용 시 ~6 GB 체크포인트를 자동으로 다운로드
또는 클론 후 start.bat을 더블 클릭하여 전체 스택 (백엔드 + 웹앱) 실행.
예시 프롬프트
"코미디 클럽 장면 생성: 펀치라인, 군중 웃음, 재즈 밴드 스팅" ->
audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")"밤에 숲에서 천둥번개 만들기" ->
audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)"모델 상태는?" ->
audio_scene(operation="status")
문서
문서 | 내용 |
모든 설치 방법, 사전 요구사항 | |
첫 실행 모델 다운로드, GPU 점검, 함정 | |
MiDashengLM-Gen 논문, 가중치, 라이선스, 데모 | |
시스템 아키텍처, 포트, 데이터 흐름 | |
환경 변수, 설정 옵션 | |
사용 가능한 모든 도구 | |
기여, 로컬 설정 | |
일반적인 문제 |
요구 사항
Windows/Linux/macOS (CUDA GPU 필요, RTX 4090급: ~12 GB VRAM (fp32); CPU 추론 가능하지만 느림)
Python 3.12+ (uv 사용), Node.js 20+, bun (빈 PC에서는
start.ps1이 자동 설치)~10 GB 여유 디스크 (체크포인트 ~6 GB + torch 스택)
라이선스
Apache-2.0 (모델 및 이 래퍼). 상위 저장소의 사용 제한 사항 참조: 불법/군사 용도 금지, 미성년자 또는 집단에 해를 끼치는 용도 금지.
This server cannot be deployed
Maintenance
Related MCP Connectors
Turn any LLM multimodal; generate images, voices, videos, 3D models, music, and more.
Audio for your agent: transcribe, speak, translate, summarise, plus sound effects and music.
Audio AI tools: text-to-speech, voice cloning, music generation, stem separation, transcription.
Generate images, video, music, voice and 3D through one API. 30 tools, 200+ models.
Related MCP Servers
- FlicenseAqualityDmaintenanceEnables AI assistants to generate and control real-time audio synthesis through natural language descriptions using SuperCollider. Features 10 built-in synth types, pattern sequencing, audio recording, and server lifecycle management for creating sounds from simple English descriptions.111-

MMAudio MCPofficial
AlicenseBqualityCmaintenanceEnables AI-powered video-to-audio and text-to-audio generation using MMAudio's API. Create synchronized audio from video content or generate audio from text descriptions with configurable parameters.39 npm4MIT- AlicenseNot gradedqualityCmaintenanceGenerate and refine AI images/audio/video through natural conversation.409Apache 2.0
- AlicenseNot gradedqualityCmaintenanceGenerates original instrumental music and vocal songs from natural-language descriptions and lyrics, retrieves generation status, and waits for audio URLs to be ready.MIT