Skip to main content
Glama

midasheng-gen-mcp

Erzeugen Sie kohärente 16-kHz-gemischte Audioszenen aus Text – Sprache, Musik, Soundeffekte und Umgebungsgeräusche in einem Durchgang – basierend auf MiDashengLM-Gen (Xiaomi Research), einem LLM-gesteuerten autoregressiven Flow-Matching-Modell (Qwen3-1.7B-Backbone, 2,9B Parameter insgesamt). Apache-2.0, läuft vollständig auf Ihrer GPU.

Was dies umschließt

MiDashengLM-Gen – das erste end-to-end trainierte allgemeine Text-zu-Audio-Modell (laut Paper): Ein LLM steuert das pro-Token Flow Matching, um Audio-Szenen variabler Länge mit Sprachverständlichkeit nahe der dedizierten TTS zu erzeugen (Seed-TTS WER 12,15% -> 2,79% gegenüber 1,24% bei dediziertem TTS). Unterstützt 9 Sprachen und Emotionssteuerung. Checkpoint wird automatisch von Hugging Face (~6 GB) heruntergeladen. Modellgewichte werden nie mitgeliefert – siehe docs/WRAPPEE.md.

Related MCP server: MMAudio MCP

Was Sie tun können

Wie es läuft: Ein lokaler FastMCP 3.4-Server (stdio für Claude Desktop, HTTP /mcp für Cursor/Webapp) mit einem React-Dashboard. Das Modell wird beim ersten Erzeugen lazy geladen und bleibt auf der GPU, bis es entladen wird.

Richtung

Artefakte

Hinweise

Eingabe

strukturierte Caption (caption/asr/speech/sfx/music/env-Ansichten), Guidance + Seed-Parameter

Über MCP-Tool, REST oder Webapp

Ausgabe

16-kHz-Mono-WAV-Szenen, in SQLite indiziert, durchsuchbar/exportierbar

audio_scene(operation="export") oder Webapp

  • Ganze Klanglandschaften in einem Aufruf erzeugen – Publikumslachen + Jazz-Sting + Comedy-Sprache, oder Regen + Donner + Waldatmosphäre

  • Sprachverständlichkeit nahe der dedizierten TTS-Qualität, 9 Sprachen, Emotionssteuerung über die speech-Ansicht

  • Szenenbibliothek mit Paginierung, Audiowiedergabe und Export in der Webapp

  • Asynchrone Job-API für lange Generierungen; vorgefertigte UI-Karten im Chat

  • Ausgabe variabler Länge über den gelernten Stop-Head – keine festen Schnittdauern

Schnellinstallation

Der schnellste Weg ist das .mcpb-Bundle für Claude Desktop (siehe INSTALL.md für alle Optionen):

  1. Download midasheng-gen-mcp-v0.1.0.mcpb von Releases

  2. Ziehen Sie es auf Claude Desktop

  3. Bei der ersten Nutzung wird der ~6-GB-Checkpoint automatisch heruntergeladen.

Oder klonen und doppelklicken Sie auf start.bat für den vollen Stack (Backend + Webapp).

Beispielaufforderungen

  • "Erzeuge eine Comedy-Club-Szene: eine Pointe, Publikumslachen und einen Jazz-Band-Sting" -> audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")

  • "Erzeuge ein Gewitter in der Nacht in einem Wald" -> audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)

  • "Was ist der Modellstatus?" -> audio_scene(operation="status")

Dokumentation

Dokument

Inhalt

Installation

Alle Installationsmethoden, Voraussetzungen

Einarbeitung

Erstmaliger Modell-Download, GPU-Prüfungen, Fallstricke

Eingebundene App

MiDashengLM-Gen-Papier, Gewichte, Lizenz, Demo

Architektur

Systemarchitektur, Ports, Datenfluss

Konfiguration

Umgebungsvariablen, Konfigurationsoptionen

Tool-Referenz

Alle verfügbaren Tools

Entwicklung

Beitragen, lokales Setup

Fehlerbehebung

Häufige Probleme

Voraussetzungen

  • Windows/Linux/macOS mit einer CUDA-GPU (RTX-4090-Klasse: ~12 GB VRAM (fp32); CPU-Inferenz funktioniert, ist aber langsam)

  • Python 3.12+ per uv, Node.js 20+, bun (wird auf nackten PCs von start.ps1 automatisch installiert)

  • ~10 GB freier Festplattenspeicher (Checkpoint ~6 GB + Torch-Stack)

Lizenz

Apache-2.0 (Modell und dieser Wrapper). Siehe den Abschnitt zu Nutzungseinschränkungen im Upstream-Repository: keine rechtswidrige/militärische Nutzung, keine Schädigung von Minderjährigen oder Gruppen.

Related MCP Connectors

Related MCP Servers