midasheng-gen-mcp
midasheng-gen-mcp
Генерируйте связные смешанные аудиосцены частотой 16 кГц из текста — речь, музыку, звуковые эффекты и атмосферу за один проход — на основе MiDashengLM-Gen (Xiaomi Research), LLM-управляемой авторегрессионной модели потокового согласования (основа Qwen3-1.7B, всего 2.9B параметров). Лицензия Apache-2.0, работает полностью на вашем GPU.
Что это оборачивает
MiDashengLM-Gen — первая сквозная обученная общая модель преобразования текста в аудио (согласно статье): LLM управляет поканальным потоковым согласованием для генерации аудиосцен переменной длины с разборчивостью речи, приближающейся к специализированным TTS (WER Seed-TTS 12.15% -> 2.79% против 1.24% для специализированного TTS). Поддерживает 9 языков и управление эмоциями. Контрольная точка автоматически загружается с Hugging Face (~6 ГБ). Веса модели никогда не входят в комплект — см. docs/WRAPPEE.md.
Related MCP server: MMAudio MCP
Что вы можете делать
Как это работает: локальный сервер FastMCP 3.4 (stdio для Claude Desktop, HTTP /mcp для Cursor/веб-приложения) с панелью управления React. Модель загружается лениво при первой генерации и остается на GPU до выгрузки.
Направление | Артефакты | Примечания |
Ввод | структурированная подпись (представления caption/asr/speech/sfx/music/env), параметры guidance + seed | Через инструмент MCP, REST или веб-приложение |
Вывод | монофонические WAV-сцены 16 кГц, индексированные в SQLite, доступные для просмотра/экспорта |
|
Генерируйте целые звуковые ландшафты за один вызов — смех толпы + джазовый акцент + комедийная речь, или дождь + гром + лесная атмосфера
Разборчивость речи, близкая к качеству специализированного TTS, 9 языков, управление эмоциями через представление
speechБиблиотека сцен с пагинацией, воспроизведением аудио и экспортом в веб-приложении
Асинхронный API заданий для длительных генераций; готовые карточки UI в чате
Вывод переменной длины через обученную голову остановки — без фиксированных отрезков по длительности
Быстрая установка
Самый быстрый путь — пакет .mcpb для Claude Desktop (см. INSTALL.md для всех вариантов):
Скачайте
midasheng-gen-mcp-v0.1.0.mcpbиз РелизовПеретащите его на Claude Desktop
При первом использовании контрольная точка (~6 ГБ) загрузится автоматически
Или клонируйте репозиторий и дважды щелкните start.bat для полного стека (бэкенд + веб-приложение).
Примеры запросов
"Создай сцену в комедийном клубе: шутка, смех толпы и джазовый акцент" ->
audio_scene(operation="generate", caption="A comedian delivering a punchline followed by uproarious crowd laughter", asr="And that is why I never buy cheap luggage anymore!", speech="expressive comedic male voice", music="sudden upbeat jazz band sting", sfx="crowd laughter", env="intimate comedy club")"Сделай грозу ночью в лесу" ->
audio_scene(operation="generate", caption="A rolling thunderstorm in a forest at night", sfx="distant thunder and heavy rain", env="dense forest", seed=42)"Каково состояние модели?" ->
audio_scene(operation="status")
Документация
Документ | Содержание |
Все методы установки, предварительные требования | |
Загрузка модели при первом запуске, проверки GPU, подводные камни | |
Статья MiDashengLM-Gen, веса, лицензия, демо | |
Системная архитектура, порты, поток данных | |
Переменные окружения, параметры конфигурации | |
Все доступные инструменты | |
Участие в проекте, локальная настройка | |
Часто встречающиеся проблемы |
Требования
Windows/Linux/macOS с GPU CUDA (класс RTX 4090: ~12 ГБ VRAM (fp32); вывод на CPU возможен, но медленный)
Python 3.12+ через uv, Node.js 20+, bun (автоматически устанавливается
start.ps1на голых ПК)~10 ГБ свободного места на диске (контрольная точка ~6 ГБ + стек torch)
Лицензия
Apache-2.0 (модель и данная обертка). См. раздел об ограничениях использования в вышестоящем репозитории: запрещено незаконное/военное использование, причинение вреда несовершеннолетним или группам.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseAqualityDmaintenanceEnables AI assistants to generate and control real-time audio synthesis through natural language descriptions using SuperCollider. Features 10 built-in synth types, pattern sequencing, audio recording, and server lifecycle management for creating sounds from simple English descriptions.111

MMAudio MCPofficial
AlicenseBqualityCmaintenanceEnables AI-powered video-to-audio and text-to-audio generation using MMAudio's API. Create synchronized audio from video content or generate audio from text descriptions with configurable parameters.3103MIT- Alicense-qualityCmaintenanceEnables users to generate sound effects from text descriptions using Meta's AudioGen model. Specifically designed for Apple Silicon Macs, it supports single and batch audio generation directly from natural language prompts.1MIT
- Alicense-qualityBmaintenanceGenerate and refine AI images/audio/video through natural conversation.397Apache 2.0
Related MCP Connectors
Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.
AI-manageable audio CDN: upload, transcode, normalize, stream & deliver audio, plus grounded docs.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/sandraschi/midasheng-gen-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server