midasheng-gen-mcp
midasheng-gen-mcp
Генерируйте связные смешанные аудиосцены частотой 16 кГц из текста — речь, музыку, звуковые эффекты и атмосферу за один проход — на основе MiDashengLM-Gen (Xiaomi Research), LLM-управляемой авторегрессионной модели потокового согласования (основа Qwen3-1.7B, всего 2.9B параметров). Лицензия Apache-2.0, работает полностью на вашем GPU.
Что это оборачивает
MiDashengLM-Gen — первая сквозная обученная общая модель преобразования текста в аудио (согласно статье): LLM управляет поканальным потоковым согласованием для генерации аудиосцен переменной длины с разборчивостью речи, приближающейся к специализированным TTS (WER Seed-TTS 12.15% -> 2.79% против 1.24% для специализированного TTS). Поддерживает 9 языков и управление эмоциями. Контрольная точка автоматически загружается с Hugging Face (~6 ГБ). Веса модели никогда не входят в комплект — см. docs/WRAPPEE.md.
Related MCP server: MMAudio MCP
Что вы можете делать
Как это работает: локальный сервер FastMCP 3.4 (stdio для Claude Desktop, HTTP /mcp для Cursor/веб-приложения) с панелью управления React. Модель загружается лениво при первой генерации и остается на GPU до выгрузки.
Направление | Артефакты | Примечания |
Ввод | структурированная подпись (представления caption/asr/speech/sfx/music/env), параметры guidance + seed | Через инструмент MCP, REST или веб-приложение |
Вывод | монофонические WAV-сцены 16 кГц, индексированные в SQLite, доступные для просмотра/экспорта |
|
Генерируйте целые звуковые ландшафты за один вызов — смех толпы + джазовый акцент + комедийная речь, или дождь + гром + лесная атмосфера
Разборчивость речи, близкая к качеству специализированного TTS, 9 языков, управление эмоциями через представление
speechБиблиотека сцен с пагинацией, воспроизведением аудио и экспортом в веб-приложении
Асинхронный API заданий для длительных генераций; готовые карточки UI в чате
Вывод переменной длины через обученную голову остановки — без фиксированных отрезков по длительности
Быстрая установка
Самый быстрый путь — пакет .mcpb для Claude Desktop (см. INSTALL.md для всех вариантов):
Скачайте
midasheng-gen-mcp-v0.1.0.mcpbиз РелизовПеретащите его на Claude Desktop
При первом использовании контрольная точка (~6 ГБ) загрузится автоматически
Или клонируйте репозиторий и дважды щелкните start.bat для полного стека (бэкенд + веб-приложение).
Примеры запросов
"Создай сцену в комедийном клубе: шутка, смех толпы и джазовый акцент" ->
audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")"Сделай грозу ночью в лесу" ->
audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)"Каково состояние модели?" ->
audio_scene(operation="status")
Документация
Документ | Содержание |
Все методы установки, предварительные требования | |
Загрузка модели при первом запуске, проверки GPU, подводные камни | |
Статья MiDashengLM-Gen, веса, лицензия, демо | |
Системная архитектура, порты, поток данных | |
Переменные окружения, параметры конфигурации | |
Все доступные инструменты | |
Участие в проекте, локальная настройка | |
Часто встречающиеся проблемы |
Требования
Windows/Linux/macOS с GPU CUDA (класс RTX 4090: ~12 ГБ VRAM (fp32); вывод на CPU возможен, но медленный)
Python 3.12+ через uv, Node.js 20+, bun (автоматически устанавливается
start.ps1на голых ПК)~10 ГБ свободного места на диске (контрольная точка ~6 ГБ + стек torch)
Лицензия
Apache-2.0 (модель и данная обертка). См. раздел об ограничениях использования в вышестоящем репозитории: запрещено незаконное/военное использование, причинение вреда несовершеннолетним или группам.
This server cannot be deployed
Maintenance
Related MCP Connectors
Turn any LLM multimodal; generate images, voices, videos, 3D models, music, and more.
Audio for your agent: transcribe, speak, translate, summarise, plus sound effects and music.
Audio AI tools: text-to-speech, voice cloning, music generation, stem separation, transcription.
Generate images, video, music, voice and 3D through one API. 30 tools, 200+ models.
Related MCP Servers
- FlicenseAqualityDmaintenanceEnables AI assistants to generate and control real-time audio synthesis through natural language descriptions using SuperCollider. Features 10 built-in synth types, pattern sequencing, audio recording, and server lifecycle management for creating sounds from simple English descriptions.111-

MMAudio MCPofficial
AlicenseBqualityCmaintenanceEnables AI-powered video-to-audio and text-to-audio generation using MMAudio's API. Create synchronized audio from video content or generate audio from text descriptions with configurable parameters.39 npm4MIT- AlicenseNot gradedqualityCmaintenanceGenerate and refine AI images/audio/video through natural conversation.409Apache 2.0
- AlicenseNot gradedqualityCmaintenanceGenerates original instrumental music and vocal songs from natural-language descriptions and lyrics, retrieves generation status, and waits for audio URLs to be ready.MIT