midasheng-gen-mcp
midasheng-gen-mcp
Erzeugen Sie kohärente 16-kHz-gemischte Audioszenen aus Text – Sprache, Musik, Soundeffekte und Umgebungsgeräusche in einem Durchgang – basierend auf MiDashengLM-Gen (Xiaomi Research), einem LLM-gesteuerten autoregressiven Flow-Matching-Modell (Qwen3-1.7B-Backbone, 2,9B Parameter insgesamt). Apache-2.0, läuft vollständig auf Ihrer GPU.
Was dies umschließt
MiDashengLM-Gen – das erste end-to-end trainierte allgemeine Text-zu-Audio-Modell (laut Paper): Ein LLM steuert das pro-Token Flow Matching, um Audio-Szenen variabler Länge mit Sprachverständlichkeit nahe der dedizierten TTS zu erzeugen (Seed-TTS WER 12,15% -> 2,79% gegenüber 1,24% bei dediziertem TTS). Unterstützt 9 Sprachen und Emotionssteuerung. Checkpoint wird automatisch von Hugging Face (~6 GB) heruntergeladen. Modellgewichte werden nie mitgeliefert – siehe docs/WRAPPEE.md.
Related MCP server: MMAudio MCP
Was Sie tun können
Wie es läuft: Ein lokaler FastMCP 3.4-Server (stdio für Claude Desktop, HTTP /mcp für Cursor/Webapp) mit einem React-Dashboard. Das Modell wird beim ersten Erzeugen lazy geladen und bleibt auf der GPU, bis es entladen wird.
Richtung | Artefakte | Hinweise |
Eingabe | strukturierte Caption (caption/asr/speech/sfx/music/env-Ansichten), Guidance + Seed-Parameter | Über MCP-Tool, REST oder Webapp |
Ausgabe | 16-kHz-Mono-WAV-Szenen, in SQLite indiziert, durchsuchbar/exportierbar |
|
Ganze Klanglandschaften in einem Aufruf erzeugen – Publikumslachen + Jazz-Sting + Comedy-Sprache, oder Regen + Donner + Waldatmosphäre
Sprachverständlichkeit nahe der dedizierten TTS-Qualität, 9 Sprachen, Emotionssteuerung über die
speech-AnsichtSzenenbibliothek mit Paginierung, Audiowiedergabe und Export in der Webapp
Asynchrone Job-API für lange Generierungen; vorgefertigte UI-Karten im Chat
Ausgabe variabler Länge über den gelernten Stop-Head – keine festen Schnittdauern
Schnellinstallation
Der schnellste Weg ist das .mcpb-Bundle für Claude Desktop (siehe INSTALL.md für alle Optionen):
Download
midasheng-gen-mcp-v0.1.0.mcpbvon ReleasesZiehen Sie es auf Claude Desktop
Bei der ersten Nutzung wird der ~6-GB-Checkpoint automatisch heruntergeladen.
Oder klonen und doppelklicken Sie auf start.bat für den vollen Stack (Backend + Webapp).
Beispielaufforderungen
"Erzeuge eine Comedy-Club-Szene: eine Pointe, Publikumslachen und einen Jazz-Band-Sting" ->
audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")"Erzeuge ein Gewitter in der Nacht in einem Wald" ->
audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)"Was ist der Modellstatus?" ->
audio_scene(operation="status")
Dokumentation
Dokument | Inhalt |
Alle Installationsmethoden, Voraussetzungen | |
Erstmaliger Modell-Download, GPU-Prüfungen, Fallstricke | |
MiDashengLM-Gen-Papier, Gewichte, Lizenz, Demo | |
Systemarchitektur, Ports, Datenfluss | |
Umgebungsvariablen, Konfigurationsoptionen | |
Alle verfügbaren Tools | |
Beitragen, lokales Setup | |
Häufige Probleme |
Voraussetzungen
Windows/Linux/macOS mit einer CUDA-GPU (RTX-4090-Klasse: ~12 GB VRAM (fp32); CPU-Inferenz funktioniert, ist aber langsam)
Python 3.12+ per uv, Node.js 20+, bun (wird auf nackten PCs von
start.ps1automatisch installiert)~10 GB freier Festplattenspeicher (Checkpoint ~6 GB + Torch-Stack)
Lizenz
Apache-2.0 (Modell und dieser Wrapper). Siehe den Abschnitt zu Nutzungseinschränkungen im Upstream-Repository: keine rechtswidrige/militärische Nutzung, keine Schädigung von Minderjährigen oder Gruppen.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseAqualityDmaintenanceEnables AI assistants to generate and control real-time audio synthesis through natural language descriptions using SuperCollider. Features 10 built-in synth types, pattern sequencing, audio recording, and server lifecycle management for creating sounds from simple English descriptions.111

MMAudio MCPofficial
AlicenseBqualityCmaintenanceEnables AI-powered video-to-audio and text-to-audio generation using MMAudio's API. Create synchronized audio from video content or generate audio from text descriptions with configurable parameters.3103MIT- Alicense-qualityCmaintenanceEnables users to generate sound effects from text descriptions using Meta's AudioGen model. Specifically designed for Apple Silicon Macs, it supports single and batch audio generation directly from natural language prompts.1MIT
- Alicense-qualityBmaintenanceGenerate and refine AI images/audio/video through natural conversation.397Apache 2.0
Related MCP Connectors
Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.
AI-manageable audio CDN: upload, transcode, normalize, stream & deliver audio, plus grounded docs.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/sandraschi/midasheng-gen-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server