Skip to main content
Glama

midasheng-gen-mcp

Genera escenas de audio mixtas coherentes de 16 kHz a partir de texto - voz, música, efectos de sonido y ambiente en una sola pasada - impulsado por MiDashengLM-Gen (Xiaomi Research), un modelo de flow matching autorregresivo impulsado por LLM (backbone Qwen3-1.7B, 2.9B parámetros total). Apache-2.0, se ejecuta completamente en tu GPU.

Lo que envuelve

MiDashengLM-Gen - el primer modelo general de texto a audio entrenado de extremo a extremo (según el artículo): un LLM impulsa el flow matching por token para generar escenas de audio de longitud variable con inteligibilidad de voz cercana a la de un TTS dedicado (Seed-TTS WER 12.15% -> 2.79% vs 1.24% para TTS dedicado). Soporta 9 idiomas y control de emociones. El checkpoint se descarga automáticamente desde Hugging Face (~6 GB). Los pesos del modelo nunca se incluyen - ver docs/WRAPPEE.md.

Related MCP server: MMAudio MCP

Lo que puedes hacer

Cómo funciona: un servidor FastMCP 3.4 local (stdio para Claude Desktop, HTTP /mcp para Cursor/aplicación web) con un panel de React. El modelo se carga de forma diferida en la primera generación y permanece en la GPU hasta que se descarga.

Dirección

Artefactos

Notas

Entrada

caption estructurado (vistas caption/asr/speech/sfx/music/env), parámetros de guidance + seed

Mediante herramienta MCP, REST o aplicación web

Salida

Escenas WAV mono de 16 kHz, indexadas en SQLite, navegables/exportables

audio_scene(operation="export") o aplicación web

  • Genera paisajes sonoros completos en una sola llamada - risas de multitud + toque de jazz + discurso de comedia, o lluvia + trueno + ambiente de bosque

  • Inteligibilidad de voz cercana a la calidad de TTS dedicado, 9 idiomas, control de emociones a través de la vista speech

  • Biblioteca de escenas con paginación, reproducción de audio y exportación en la aplicación web

  • API de trabajos asíncronos para generaciones largas; tarjetas de UI prefabricadas en el chat

  • Salida de longitud variable mediante la cabeza de detención aprendida - sin cortes de duración fija

Instalación rápida

La ruta más rápida es el paquete .mcpb para Claude Desktop (consulta INSTALL.md para todas las opciones):

  1. Descarga midasheng-gen-mcp-v0.1.0.mcpb desde Releases

  2. Arrástralo sobre Claude Desktop

  3. El primer uso descargará el checkpoint de ~6 GB automáticamente

O clona y haz doble clic en start.bat para la pila completa (backend + aplicación web).

Ejemplos de indicaciones

  • "Genera una escena de club de comedia: un remate, risas de multitud y un toque de banda de jazz" -> audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")

  • "Haz una tormenta eléctrica nocturna en un bosque" -> audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)

  • "¿Cuál es el estado del modelo?" -> audio_scene(operation="status")

Documentación

Documento

Contenido

Instalación

Todos los métodos de instalación, requisitos previos

Inicio

Descarga del modelo en primera ejecución, comprobaciones de GPU, problemas comunes

Aplicación envuelta

Artículo de MiDashengLM-Gen, pesos, licencia, demo

Arquitectura

Arquitectura del sistema, puertos, flujo de datos

Configuración

Variables de entorno, opciones de configuración

Referencia de herramientas

Todas las herramientas disponibles

Desarrollo

Contribución, configuración local

Solución de problemas

Problemas comunes

Requisitos

  • Windows/Linux/macOS con una GPU CUDA (clase RTX 4090: ~12 GB VRAM (fp32); la inferencia en CPU funciona pero es lenta)

  • Python 3.12+ mediante uv, Node.js 20+, bun (instalado automáticamente por start.ps1 en PCs sin configurar)

  • ~10 GB de disco libre (checkpoint ~6 GB + stack de torch)

Licencia

Apache-2.0 (modelo y este envoltorio). Consulta la sección de restricciones de uso en el repositorio upstream: sin uso ilegal/militar, sin daño a menores o grupos.

A
license - permissive license
-
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.

  • AI-manageable audio CDN: upload, transcode, normalize, stream & deliver audio, plus grounded docs.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/sandraschi/midasheng-gen-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server