midasheng-gen-mcp
midasheng-gen-mcp
Erzeugen Sie kohärente 16-kHz-gemischte Audioszenen aus Text – Sprache, Musik, Soundeffekte und Umgebungsgeräusche in einem Durchgang – basierend auf MiDashengLM-Gen (Xiaomi Research), einem LLM-gesteuerten autoregressiven Flow-Matching-Modell (Qwen3-1.7B-Backbone, 2,9B Parameter insgesamt). Apache-2.0, läuft vollständig auf Ihrer GPU.
Was dies umschließt
MiDashengLM-Gen – das erste end-to-end trainierte allgemeine Text-zu-Audio-Modell (laut Paper): Ein LLM steuert das pro-Token Flow Matching, um Audio-Szenen variabler Länge mit Sprachverständlichkeit nahe der dedizierten TTS zu erzeugen (Seed-TTS WER 12,15% -> 2,79% gegenüber 1,24% bei dediziertem TTS). Unterstützt 9 Sprachen und Emotionssteuerung. Checkpoint wird automatisch von Hugging Face (~6 GB) heruntergeladen. Modellgewichte werden nie mitgeliefert – siehe docs/WRAPPEE.md.
Related MCP server: MMAudio MCP
Was Sie tun können
Wie es läuft: Ein lokaler FastMCP 3.4-Server (stdio für Claude Desktop, HTTP /mcp für Cursor/Webapp) mit einem React-Dashboard. Das Modell wird beim ersten Erzeugen lazy geladen und bleibt auf der GPU, bis es entladen wird.
Richtung | Artefakte | Hinweise |
Eingabe | strukturierte Caption (caption/asr/speech/sfx/music/env-Ansichten), Guidance + Seed-Parameter | Über MCP-Tool, REST oder Webapp |
Ausgabe | 16-kHz-Mono-WAV-Szenen, in SQLite indiziert, durchsuchbar/exportierbar |
|
Ganze Klanglandschaften in einem Aufruf erzeugen – Publikumslachen + Jazz-Sting + Comedy-Sprache, oder Regen + Donner + Waldatmosphäre
Sprachverständlichkeit nahe der dedizierten TTS-Qualität, 9 Sprachen, Emotionssteuerung über die
speech-AnsichtSzenenbibliothek mit Paginierung, Audiowiedergabe und Export in der Webapp
Asynchrone Job-API für lange Generierungen; vorgefertigte UI-Karten im Chat
Ausgabe variabler Länge über den gelernten Stop-Head – keine festen Schnittdauern
Schnellinstallation
Der schnellste Weg ist das .mcpb-Bundle für Claude Desktop (siehe INSTALL.md für alle Optionen):
Download
midasheng-gen-mcp-v0.1.0.mcpbvon ReleasesZiehen Sie es auf Claude Desktop
Bei der ersten Nutzung wird der ~6-GB-Checkpoint automatisch heruntergeladen.
Oder klonen und doppelklicken Sie auf start.bat für den vollen Stack (Backend + Webapp).
Beispielaufforderungen
"Erzeuge eine Comedy-Club-Szene: eine Pointe, Publikumslachen und einen Jazz-Band-Sting" ->
audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")"Erzeuge ein Gewitter in der Nacht in einem Wald" ->
audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)"Was ist der Modellstatus?" ->
audio_scene(operation="status")
Dokumentation
Dokument | Inhalt |
Alle Installationsmethoden, Voraussetzungen | |
Erstmaliger Modell-Download, GPU-Prüfungen, Fallstricke | |
MiDashengLM-Gen-Papier, Gewichte, Lizenz, Demo | |
Systemarchitektur, Ports, Datenfluss | |
Umgebungsvariablen, Konfigurationsoptionen | |
Alle verfügbaren Tools | |
Beitragen, lokales Setup | |
Häufige Probleme |
Voraussetzungen
Windows/Linux/macOS mit einer CUDA-GPU (RTX-4090-Klasse: ~12 GB VRAM (fp32); CPU-Inferenz funktioniert, ist aber langsam)
Python 3.12+ per uv, Node.js 20+, bun (wird auf nackten PCs von
start.ps1automatisch installiert)~10 GB freier Festplattenspeicher (Checkpoint ~6 GB + Torch-Stack)
Lizenz
Apache-2.0 (Modell und dieser Wrapper). Siehe den Abschnitt zu Nutzungseinschränkungen im Upstream-Repository: keine rechtswidrige/militärische Nutzung, keine Schädigung von Minderjährigen oder Gruppen.
This server cannot be deployed
Maintenance
Related MCP Connectors
Turn any LLM multimodal; generate images, voices, videos, 3D models, music, and more.
Audio for your agent: transcribe, speak, translate, summarise, plus sound effects and music.
Audio AI tools: text-to-speech, voice cloning, music generation, stem separation, transcription.
Generate images, video, music, voice and 3D through one API. 30 tools, 200+ models.
Related MCP Servers
- FlicenseAqualityDmaintenanceEnables AI assistants to generate and control real-time audio synthesis through natural language descriptions using SuperCollider. Features 10 built-in synth types, pattern sequencing, audio recording, and server lifecycle management for creating sounds from simple English descriptions.111-

MMAudio MCPofficial
AlicenseBqualityCmaintenanceEnables AI-powered video-to-audio and text-to-audio generation using MMAudio's API. Create synchronized audio from video content or generate audio from text descriptions with configurable parameters.39 npm4MIT- AlicenseNot gradedqualityCmaintenanceGenerate and refine AI images/audio/video through natural conversation.409Apache 2.0
- AlicenseNot gradedqualityCmaintenanceGenerates original instrumental music and vocal songs from natural-language descriptions and lyrics, retrieves generation status, and waits for audio URLs to be ready.MIT