midasheng-gen-mcp
midasheng-gen-mcp
Genera escenas de audio mixtas coherentes de 16 kHz a partir de texto - voz, música, efectos de sonido y ambiente en una sola pasada - impulsado por MiDashengLM-Gen (Xiaomi Research), un modelo de flow matching autorregresivo impulsado por LLM (backbone Qwen3-1.7B, 2.9B parámetros total). Apache-2.0, se ejecuta completamente en tu GPU.
Lo que envuelve
MiDashengLM-Gen - el primer modelo general de texto a audio entrenado de extremo a extremo (según el artículo): un LLM impulsa el flow matching por token para generar escenas de audio de longitud variable con inteligibilidad de voz cercana a la de un TTS dedicado (Seed-TTS WER 12.15% -> 2.79% vs 1.24% para TTS dedicado). Soporta 9 idiomas y control de emociones. El checkpoint se descarga automáticamente desde Hugging Face (~6 GB). Los pesos del modelo nunca se incluyen - ver docs/WRAPPEE.md.
Related MCP server: MMAudio MCP
Lo que puedes hacer
Cómo funciona: un servidor FastMCP 3.4 local (stdio para Claude Desktop, HTTP /mcp para Cursor/aplicación web) con un panel de React. El modelo se carga de forma diferida en la primera generación y permanece en la GPU hasta que se descarga.
Dirección | Artefactos | Notas |
Entrada | caption estructurado (vistas caption/asr/speech/sfx/music/env), parámetros de guidance + seed | Mediante herramienta MCP, REST o aplicación web |
Salida | Escenas WAV mono de 16 kHz, indexadas en SQLite, navegables/exportables |
|
Genera paisajes sonoros completos en una sola llamada - risas de multitud + toque de jazz + discurso de comedia, o lluvia + trueno + ambiente de bosque
Inteligibilidad de voz cercana a la calidad de TTS dedicado, 9 idiomas, control de emociones a través de la vista
speechBiblioteca de escenas con paginación, reproducción de audio y exportación en la aplicación web
API de trabajos asíncronos para generaciones largas; tarjetas de UI prefabricadas en el chat
Salida de longitud variable mediante la cabeza de detención aprendida - sin cortes de duración fija
Instalación rápida
La ruta más rápida es el paquete .mcpb para Claude Desktop (consulta INSTALL.md para todas las opciones):
Descarga
midasheng-gen-mcp-v0.1.0.mcpbdesde ReleasesArrástralo sobre Claude Desktop
El primer uso descargará el checkpoint de ~6 GB automáticamente
O clona y haz doble clic en start.bat para la pila completa (backend + aplicación web).
Ejemplos de indicaciones
"Genera una escena de club de comedia: un remate, risas de multitud y un toque de banda de jazz" ->
audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")"Haz una tormenta eléctrica nocturna en un bosque" ->
audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)"¿Cuál es el estado del modelo?" ->
audio_scene(operation="status")
Documentación
Documento | Contenido |
Todos los métodos de instalación, requisitos previos | |
Descarga del modelo en primera ejecución, comprobaciones de GPU, problemas comunes | |
Artículo de MiDashengLM-Gen, pesos, licencia, demo | |
Arquitectura del sistema, puertos, flujo de datos | |
Variables de entorno, opciones de configuración | |
Todas las herramientas disponibles | |
Contribución, configuración local | |
Problemas comunes |
Requisitos
Windows/Linux/macOS con una GPU CUDA (clase RTX 4090: ~12 GB VRAM (fp32); la inferencia en CPU funciona pero es lenta)
Python 3.12+ mediante uv, Node.js 20+, bun (instalado automáticamente por
start.ps1en PCs sin configurar)~10 GB de disco libre (checkpoint ~6 GB + stack de torch)
Licencia
Apache-2.0 (modelo y este envoltorio). Consulta la sección de restricciones de uso en el repositorio upstream: sin uso ilegal/militar, sin daño a menores o grupos.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseAqualityDmaintenanceEnables AI assistants to generate and control real-time audio synthesis through natural language descriptions using SuperCollider. Features 10 built-in synth types, pattern sequencing, audio recording, and server lifecycle management for creating sounds from simple English descriptions.111

MMAudio MCPofficial
AlicenseBqualityCmaintenanceEnables AI-powered video-to-audio and text-to-audio generation using MMAudio's API. Create synchronized audio from video content or generate audio from text descriptions with configurable parameters.3103MIT- Alicense-qualityCmaintenanceEnables users to generate sound effects from text descriptions using Meta's AudioGen model. Specifically designed for Apple Silicon Macs, it supports single and batch audio generation directly from natural language prompts.1MIT
- Alicense-qualityBmaintenanceGenerate and refine AI images/audio/video through natural conversation.397Apache 2.0
Related MCP Connectors
Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.
AI-manageable audio CDN: upload, transcode, normalize, stream & deliver audio, plus grounded docs.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/sandraschi/midasheng-gen-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server