voice-dialog
voice-dialog
MCP-сервер, добавляющий голосовой диалог AI-агенту, который также можно использовать как инструмент командной строки. Когда агент закончил работу, он может сообщить вам голосом, а также спросить вас и выслушать ответ. Распознавание выполняется локально на whisper, синтез — системным TTS, всё работает без интернета и без передачи аудио.
Что он умеет
你(没看屏幕):"搞定了吗?"
Agent(出声):"代码写完了,测试全过。要提交吗?" ← ask_by_voice
你:"先不提交,我看看再说" ← listen 收到,本地转写
Agent(出声):"好,先留着。" ← speakИнструмент | Назначение |
| Одностороннее озвучивание (задача выполнена, веха) |
| Запись + распознавание (вы диктуете команду) |
| Атомарный диалог: сказать → прослушать один раз, без автопродолжения (защита от зацикливания) |
| Одношаговая инициализация (см. ниже) |
| Проверка окружения (только проверка, без установки) |
Related MCP server: Pipecat MCP Server
Быстрый старт
git clone https://github.com/VictorHuang0843/voice-dialog.git
cd voice-dialog
# 没装 uv?先来这个(Windows 用 install.ps1):
# curl -LsSf https://astral.sh/uv/install.sh | sh
uv run voice-dialog initinit — это полностью автоматический мастер из 7 шагов: установка uv → установка зависимостей (uv сам установит даже Python) → загрузка модели whisper (464MB, в Китае автоматически через hf-mirror) → проверка разрешения на микрофон → проверка звука TTS → вывод команды регистрации MCP. Если какой-то шаг не удался, выводится команда исправления для этого шага; исправьте и запустите заново.
Попробуйте одну фразу:
uv run voice-dialog speak "语音系统就绪" --lang zh
uv run voice-dialog ask "请说话" --wait-start 60
# 你会听到:高亮上扬"叮↑"= 开始说话 → 停 3 秒 → 低沉"咚…咚↓"= 录音结束Подключение вашего агента
Любой MCP-клиент (Claude Code, Codex, Cursor, LoopX……):
{
"mcpServers": {
"voice-dialog": {
"command": "uv",
"args": ["--project", "/你的路径/voice-dialog", "run", "voice-dialog", "serve"]
}
}
}Регистрация одной строкой в Claude Code:
claude mcp add voice-dialog -s user -- uv --project /你的路径/voice-dialog run voice-dialog serveИнструменты без поддержки MCP: вызывайте CLI напрямую: uv run voice-dialog speak/listen/ask "...".
Claude Code Skill (опционально, обучает агента, когда говорить/слушать): скопируйте skills/voice-dialog/ в ~/.claude/skills/.
Поддерживаемые платформы
macOS | Windows | Linux | |
Распознавание речи | Проверено | Работает | Работает |
Синтез речи | Системный TTS | SAPI | Требуется espeak-ng |
Звуковой сигнал | Работает | Работает | Требуется ffmpeg |
Автоопределение языка (whisper поддерживает ~100 языков), VD_LANG=zh фиксирует язык; размер модели настраивается через VD_MODEL=small.
Частые вопросы
Симптом | Решение |
init сообщает, что uv не установлен | Выполните команду установки curl выше, после установки перезапустите терминал |
Проверка микрофона не удалась | macOS: Системные настройки → Конфиденциальность и безопасность → Микрофон → отметьте ваш терминал; Windows: Параметры → Конфиденциальность → Микрофон |
Скачивание модели не удалось/слишком медленно |
|
TTS без звука | Проверьте, не перехвачено ли системное устройство вывода виртуальной звуковой картой (BlackHole и т.п.) |
Изменения в коде не применяются | MCP-сервер — постоянный процесс: |
Конфиденциальность
Речь распознаётся локально (faster-whisper), текст воспроизводится системным TTS, не вызываются никакие облачные API, не загружаются никакие аудиофайлы.
License
MIT
О модели
Что скачивается по умолчанию? whisper small (int8-квантование, около 464MB), баланс точности и скорости для китайского и английского. Автоматически скачивается при первом listen/init, затем кэшируется локально (macOS/Linux: ~/.cache/huggingface/hub/, Windows: %USERPROFILE%\.cache\huggingface\hub\), больше никогда не скачивается.
Как выбирается источник загрузки? В коде нет жёстко прописанной логики загрузки — при создании WhisperModel("small", ...) библиотека faster-whisper автоматически скачивает с HuggingFace. По умолчанию используется официальный источник huggingface.co; если официальный источник недоступен, код автоматически переключается на китайское зеркало hf-mirror.com и повторяет попытку (реализуется через установку переменной окружения HF_ENDPOINT). Пользователи в Китае также могут заранее зафиксировать вручную:
export HF_ENDPOINT=https://hf-mirror.com # 加进 ~/.zshrc 一劳永逸Нужна модель побольше? Управляется переменной окружения VD_MODEL, применяется при повторном запуске:
VD_MODEL | Размер | Особенности |
| ~75MB | Самый быстрый, точность средняя |
| ~142MB | Быстрый, для повседневных задач достаточно |
| ~464MB | Сбалансированный, рекомендуется |
| ~1.5GB | Точнее, на M-чипах транскрибация с секунд становится десятками секунд |
| ~3GB | Самый точный и самый медленный, для коротких диалогов не рекомендуется |
VD_MODEL=base uv run voice-dialog listen # 单次用 baseУстановка из zip (без git clone)
Скачайте zip (или получите от друга) → распакуйте в нужное место, например ~/tools/ → откройте терминал и перейдите в каталог, дальше доверьтесь ИИ:
В Claude Code (или любом ИИ-инструменте программирования, умеющем выполнять команды) отправьте ему следующий текст как есть:
帮我安装这个目录里的 voice-dialog 项目:
1. cd 到这个目录跑 uv run voice-dialog init(没装 uv 就先装:curl -LsSf https://astral.sh/uv/install.sh | sh)
2. init 全绿后,把打印出来的 claude mcp add 命令执行掉
3. 最后跑 uv run voice-dialog doctor 给我看结果Он установит всё и зарегистрирует в Claude Code, после перезапуска сессии всё готово.
Можно и вручную, всего две команды:
cd 解压后的目录
uv run voice-dialog init # 结束时打印注册命令,复制执行Если вы не знакомы с терминалом на Mac: после распаковки щёлкните правой кнопкой по папке → Службы → Новый терминал в папке, и вы окажетесь в нужном каталоге.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.

Pipecat MCP Serverofficial
AlicenseNot gradedqualityCmaintenanceEnables voice conversations and screen capture for AI agents via MCP-compatible clients, using Pipecat for speech-to-text and text-to-speech, with support for browser, WebRTC, and phone transport.134BSD 2-Clause "Simplified"- AlicenseNot gradedqualityCmaintenanceEnables AI agents to generate high-quality speech with 54+ voices in multiple languages via MCP tools.17Apache 2.0
- AlicenseNot gradedqualityAmaintenanceGive your AI agents the ability to listen. Microphone capture and speech-to-text tools for MCP-compatible agents.1357Apache 2.0
Related MCP Connectors
Give AI agents real phone numbers, messages, and voice calls via MCP.
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Voice and chat for AI agents — Discord, Teams, Meet, Slack, Zoom, Telegram, WhatsApp, NC Talk, SIP
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/VictorHuang0843/voice-dialog'
If you have feedback or need assistance with the MCP directory API, please join our Discord server