Skip to main content
Glama

midasheng-gen-mcp

Erzeugen Sie kohärente 16-kHz-gemischte Audioszenen aus Text – Sprache, Musik, Soundeffekte und Umgebungsgeräusche in einem Durchgang – basierend auf MiDashengLM-Gen (Xiaomi Research), einem LLM-gesteuerten autoregressiven Flow-Matching-Modell (Qwen3-1.7B-Backbone, 2,9B Parameter insgesamt). Apache-2.0, läuft vollständig auf Ihrer GPU.

Was dies umschließt

MiDashengLM-Gen – das erste end-to-end trainierte allgemeine Text-zu-Audio-Modell (laut Paper): Ein LLM steuert das pro-Token Flow Matching, um Audio-Szenen variabler Länge mit Sprachverständlichkeit nahe der dedizierten TTS zu erzeugen (Seed-TTS WER 12,15% -> 2,79% gegenüber 1,24% bei dediziertem TTS). Unterstützt 9 Sprachen und Emotionssteuerung. Checkpoint wird automatisch von Hugging Face (~6 GB) heruntergeladen. Modellgewichte werden nie mitgeliefert – siehe docs/WRAPPEE.md.

Related MCP server: MMAudio MCP

Was Sie tun können

Wie es läuft: Ein lokaler FastMCP 3.4-Server (stdio für Claude Desktop, HTTP /mcp für Cursor/Webapp) mit einem React-Dashboard. Das Modell wird beim ersten Erzeugen lazy geladen und bleibt auf der GPU, bis es entladen wird.

Richtung

Artefakte

Hinweise

Eingabe

strukturierte Caption (caption/asr/speech/sfx/music/env-Ansichten), Guidance + Seed-Parameter

Über MCP-Tool, REST oder Webapp

Ausgabe

16-kHz-Mono-WAV-Szenen, in SQLite indiziert, durchsuchbar/exportierbar

audio_scene(operation="export") oder Webapp

  • Ganze Klanglandschaften in einem Aufruf erzeugen – Publikumslachen + Jazz-Sting + Comedy-Sprache, oder Regen + Donner + Waldatmosphäre

  • Sprachverständlichkeit nahe der dedizierten TTS-Qualität, 9 Sprachen, Emotionssteuerung über die speech-Ansicht

  • Szenenbibliothek mit Paginierung, Audiowiedergabe und Export in der Webapp

  • Asynchrone Job-API für lange Generierungen; vorgefertigte UI-Karten im Chat

  • Ausgabe variabler Länge über den gelernten Stop-Head – keine festen Schnittdauern

Schnellinstallation

Der schnellste Weg ist das .mcpb-Bundle für Claude Desktop (siehe INSTALL.md für alle Optionen):

  1. Download midasheng-gen-mcp-v0.1.0.mcpb von Releases

  2. Ziehen Sie es auf Claude Desktop

  3. Bei der ersten Nutzung wird der ~6-GB-Checkpoint automatisch heruntergeladen.

Oder klonen und doppelklicken Sie auf start.bat für den vollen Stack (Backend + Webapp).

Beispielaufforderungen

  • "Erzeuge eine Comedy-Club-Szene: eine Pointe, Publikumslachen und einen Jazz-Band-Sting" -> audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")

  • "Erzeuge ein Gewitter in der Nacht in einem Wald" -> audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)

  • "Was ist der Modellstatus?" -> audio_scene(operation="status")

Dokumentation

Dokument

Inhalt

Installation

Alle Installationsmethoden, Voraussetzungen

Einarbeitung

Erstmaliger Modell-Download, GPU-Prüfungen, Fallstricke

Eingebundene App

MiDashengLM-Gen-Papier, Gewichte, Lizenz, Demo

Architektur

Systemarchitektur, Ports, Datenfluss

Konfiguration

Umgebungsvariablen, Konfigurationsoptionen

Tool-Referenz

Alle verfügbaren Tools

Entwicklung

Beitragen, lokales Setup

Fehlerbehebung

Häufige Probleme

Voraussetzungen

  • Windows/Linux/macOS mit einer CUDA-GPU (RTX-4090-Klasse: ~12 GB VRAM (fp32); CPU-Inferenz funktioniert, ist aber langsam)

  • Python 3.12+ per uv, Node.js 20+, bun (wird auf nackten PCs von start.ps1 automatisch installiert)

  • ~10 GB freier Festplattenspeicher (Checkpoint ~6 GB + Torch-Stack)

Lizenz

Apache-2.0 (Modell und dieser Wrapper). Siehe den Abschnitt zu Nutzungseinschränkungen im Upstream-Repository: keine rechtswidrige/militärische Nutzung, keine Schädigung von Minderjährigen oder Gruppen.

A
license - permissive license
-
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.

  • AI-manageable audio CDN: upload, transcode, normalize, stream & deliver audio, plus grounded docs.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/sandraschi/midasheng-gen-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server