midasheng-gen-mcp
midasheng-gen-mcp
Genera escenas de audio mixtas coherentes de 16 kHz a partir de texto - voz, música, efectos de sonido y ambiente en una sola pasada - impulsado por MiDashengLM-Gen (Xiaomi Research), un modelo de flow matching autorregresivo impulsado por LLM (backbone Qwen3-1.7B, 2.9B parámetros total). Apache-2.0, se ejecuta completamente en tu GPU.
Lo que envuelve
MiDashengLM-Gen - el primer modelo general de texto a audio entrenado de extremo a extremo (según el artículo): un LLM impulsa el flow matching por token para generar escenas de audio de longitud variable con inteligibilidad de voz cercana a la de un TTS dedicado (Seed-TTS WER 12.15% -> 2.79% vs 1.24% para TTS dedicado). Soporta 9 idiomas y control de emociones. El checkpoint se descarga automáticamente desde Hugging Face (~6 GB). Los pesos del modelo nunca se incluyen - ver docs/WRAPPEE.md.
Related MCP server: MMAudio MCP
Lo que puedes hacer
Cómo funciona: un servidor FastMCP 3.4 local (stdio para Claude Desktop, HTTP /mcp para Cursor/aplicación web) con un panel de React. El modelo se carga de forma diferida en la primera generación y permanece en la GPU hasta que se descarga.
Dirección | Artefactos | Notas |
Entrada | caption estructurado (vistas caption/asr/speech/sfx/music/env), parámetros de guidance + seed | Mediante herramienta MCP, REST o aplicación web |
Salida | Escenas WAV mono de 16 kHz, indexadas en SQLite, navegables/exportables |
|
Genera paisajes sonoros completos en una sola llamada - risas de multitud + toque de jazz + discurso de comedia, o lluvia + trueno + ambiente de bosque
Inteligibilidad de voz cercana a la calidad de TTS dedicado, 9 idiomas, control de emociones a través de la vista
speechBiblioteca de escenas con paginación, reproducción de audio y exportación en la aplicación web
API de trabajos asíncronos para generaciones largas; tarjetas de UI prefabricadas en el chat
Salida de longitud variable mediante la cabeza de detención aprendida - sin cortes de duración fija
Instalación rápida
La ruta más rápida es el paquete .mcpb para Claude Desktop (consulta INSTALL.md para todas las opciones):
Descarga
midasheng-gen-mcp-v0.1.0.mcpbdesde ReleasesArrástralo sobre Claude Desktop
El primer uso descargará el checkpoint de ~6 GB automáticamente
O clona y haz doble clic en start.bat para la pila completa (backend + aplicación web).
Ejemplos de indicaciones
"Genera una escena de club de comedia: un remate, risas de multitud y un toque de banda de jazz" ->
audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")"Haz una tormenta eléctrica nocturna en un bosque" ->
audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)"¿Cuál es el estado del modelo?" ->
audio_scene(operation="status")
Documentación
Documento | Contenido |
Todos los métodos de instalación, requisitos previos | |
Descarga del modelo en primera ejecución, comprobaciones de GPU, problemas comunes | |
Artículo de MiDashengLM-Gen, pesos, licencia, demo | |
Arquitectura del sistema, puertos, flujo de datos | |
Variables de entorno, opciones de configuración | |
Todas las herramientas disponibles | |
Contribución, configuración local | |
Problemas comunes |
Requisitos
Windows/Linux/macOS con una GPU CUDA (clase RTX 4090: ~12 GB VRAM (fp32); la inferencia en CPU funciona pero es lenta)
Python 3.12+ mediante uv, Node.js 20+, bun (instalado automáticamente por
start.ps1en PCs sin configurar)~10 GB de disco libre (checkpoint ~6 GB + stack de torch)
Licencia
Apache-2.0 (modelo y este envoltorio). Consulta la sección de restricciones de uso en el repositorio upstream: sin uso ilegal/militar, sin daño a menores o grupos.
This server cannot be deployed
Maintenance
Related MCP Connectors
Turn any LLM multimodal; generate images, voices, videos, 3D models, music, and more.
Audio for your agent: transcribe, speak, translate, summarise, plus sound effects and music.
Audio AI tools: text-to-speech, voice cloning, music generation, stem separation, transcription.
Generate images, video, music, voice and 3D through one API. 30 tools, 200+ models.
Related MCP Servers
- FlicenseAqualityDmaintenanceEnables AI assistants to generate and control real-time audio synthesis through natural language descriptions using SuperCollider. Features 10 built-in synth types, pattern sequencing, audio recording, and server lifecycle management for creating sounds from simple English descriptions.111-

MMAudio MCPofficial
AlicenseBqualityCmaintenanceEnables AI-powered video-to-audio and text-to-audio generation using MMAudio's API. Create synchronized audio from video content or generate audio from text descriptions with configurable parameters.39 npm4MIT- AlicenseNot gradedqualityCmaintenanceGenerate and refine AI images/audio/video through natural conversation.409Apache 2.0
- AlicenseNot gradedqualityCmaintenanceGenerates original instrumental music and vocal songs from natural-language descriptions and lyrics, retrieves generation status, and waits for audio URLs to be ready.MIT