voice-dialog
voice-dialog
AI Agentに音声対話機能を追加するMCP server。コマンドラインツールとしても使えます。Agentが作業を終えたら音声で知らせたり、質問を投げかけたり、あなたの回答を聞き取ったりできます。認識はローカルのwhisperで実行し、合成はシステム標準のTTSを使用します。完全にオフラインで動作し、音声を送信しません。
できること
你(没看屏幕):"搞定了吗?"
Agent(出声):"代码写完了,测试全过。要提交吗?" ← ask_by_voice
你:"先不提交,我看看再说" ← listen 收到,本地转写
Agent(出声):"好,先留着。" ← speakツール | 用途 |
| 一方向の読み上げ(タスク完了、マイルストーン) |
| 録音+認識(あなたの口述指示) |
| 原子的な問答:一言→一回聞く、自動で聞き続けることは絶対にない(無限ループ防止) |
| ワンクリック初期化(下記参照) |
| 環境診断(確認のみ、インストールしない) |
Related MCP server: Pipecat MCP Server
クイックスタート
git clone https://github.com/VictorHuang0843/voice-dialog.git
cd voice-dialog
# 没装 uv?先来这个(Windows 用 install.ps1):
# curl -LsSf https://astral.sh/uv/install.sh | sh
uv run voice-dialog initinit は7ステップの全自動ガイドです:uvのインストール → 依存関係のインストール(uvがPythonもインストールしてくれます)→ whisperモデルのダウンロード(464MB、中国のネットワークでは自動的にhf-mirrorを使用)→ マイク権限の実地テスト → TTS音声出力の実地テスト → MCP登録コマンドの表示。失敗したステップがあれば、そのステップの修復コマンドが表示され、修正して再実行するだけです。
試しに:
uv run voice-dialog speak "语音系统就绪" --lang zh
uv run voice-dialog ask "请说话" --wait-start 60
# 你会听到:高亮上扬"叮↑"= 开始说话 → 停 3 秒 → 低沉"咚…咚↓"= 录音结束あなたのAgentに接続する
任意のMCPクライアント(Claude Code、Codex、Cursor、LoopX……):
{
"mcpServers": {
"voice-dialog": {
"command": "uv",
"args": ["--project", "/你的路径/voice-dialog", "run", "voice-dialog", "serve"]
}
}
}Claude Codeの一行登録:
claude mcp add voice-dialog -s user -- uv --project /你的路径/voice-dialog run voice-dialog serveMCP非対応のツール:CLIを直接呼び出し、uv run voice-dialog speak/listen/ask "..."。
Claude Code Skill(オプション、Agentにいつ話すか/いつ聞くかを教える):skills/voice-dialog/ を ~/.claude/skills/ にコピーします。
対応プラットフォーム
macOS | Windows | Linux | |
音声認識 | 実測済み | 利用可能 | 利用可能 |
音声合成 | システムTTS | SAPI | espeak-ngのインストールが必要 |
プロンプト音 | 利用可能 | 利用可能 | ffmpegが必要 |
言語は自動検出(whisperは約100言語に対応)、VD_LANG=zh で固定可能;モデルサイズは VD_MODEL=small で調整可能。
よくある質問
症状 | 解決策 |
initがuv未インストールと報告 | 上記のcurlインストールコマンドを実行し、インストール後にターミナルを再起動 |
マイクプローブに失敗 | macOS:システム設定→プライバシーとセキュリティ→マイク→使用するターミナルをチェック;Windows:設定→プライバシー→マイク |
モデルのダウンロード失敗/極端に遅い |
|
TTSが無音 | システムの出力デバイスが仮想サウンドカード(BlackHoleなど)に乗っ取られていないか確認 |
コードを変更しても反映されない | MCP serverは常駐プロセス: |
プライバシー
音声はローカルで認識(faster-whisper)、テキストはシステムTTSで再生、クラウドAPIは一切呼び出さず、音声をアップロードしません。
ライセンス
MIT
モデルについて
デフォルトでダウンロードされるものは? whisper small(int8量子化、約464MB)。中英語の認識精度と速度のバランスが取れたモデルです。初回の listen/init 時に自動ダウンロードされ、以降はローカルにキャッシュされます(macOS/Linux:~/.cache/huggingface/hub/、Windows:%USERPROFILE%\.cache\huggingface\hub\)。再ダウンロードは発生しません。
ダウンロード元の選択方法は? コードにはダウンロードロジックはハードコードされていません——WhisperModel("small", ...) の構築時にfaster-whisperライブラリがHuggingFaceから自動的にダウンロードします。デフォルトは公式ソースhuggingface.co;公式ソースに接続できない場合は、コードが自動的に国内ミラーhf-mirror.comに切り替えて再試行します(HF_ENDPOINT 環境変数の設定で実装)。国内ユーザーは事前に手動で固定することもできます:
export HF_ENDPOINT=https://hf-mirror.com # 加进 ~/.zshrc 一劳永逸より大きなモデルに変更? 環境変数 VD_MODEL で制御し、再起動で有効です:
VD_MODEL | サイズ | 特徴 |
| ~75MB | 最速、精度は普通 |
| ~142MB | 速い、日常用途には十分 |
| ~464MB | バランスが良く、推奨 |
| ~1.5GB | より正確、Mチップでは秒級の書き起こしが十秒級に |
| ~3GB | 最も正確で最も遅い、短い会話には推奨しない |
VD_MODEL=base uv run voice-dialog listen # 单次用 basezipからのインストール(git clone不要)
zipをダウンロード(または友人から直接受け取る)→ 好きな場所に解凍、例えば ~/tools/ → ターミナルを開いてディレクトリに入り、あとはAIに任せます:
Claude Code(またはコマンドを実行できるAIプログラミングツール)で、以下の内容をそのまま送信します:
帮我安装这个目录里的 voice-dialog 项目:
1. cd 到这个目录跑 uv run voice-dialog init(没装 uv 就先装:curl -LsSf https://astral.sh/uv/install.sh | sh)
2. init 全绿后,把打印出来的 claude mcp add 命令执行掉
3. 最后跑 uv run voice-dialog doctor 给我看结果すべてをインストールしてClaude Codeに登録し、セッションを再起動すれば使えます。
手動でも可能です。たった2つのコマンドです:
cd 解压后的目录
uv run voice-dialog init # 结束时打印注册命令,复制执行Macでターミナルに不慣れな場合:解凍後、フォルダを右クリック → サービス → フォルダ位置で新しいターミナルウィンドウを開く、でディレクトリに移動できます。
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.

Pipecat MCP Serverofficial
AlicenseNot gradedqualityCmaintenanceEnables voice conversations and screen capture for AI agents via MCP-compatible clients, using Pipecat for speech-to-text and text-to-speech, with support for browser, WebRTC, and phone transport.134BSD 2-Clause "Simplified"- AlicenseNot gradedqualityCmaintenanceEnables AI agents to generate high-quality speech with 54+ voices in multiple languages via MCP tools.17Apache 2.0
- AlicenseNot gradedqualityAmaintenanceGive your AI agents the ability to listen. Microphone capture and speech-to-text tools for MCP-compatible agents.1357Apache 2.0
Related MCP Connectors
Give AI agents real phone numbers, messages, and voice calls via MCP.
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Voice and chat for AI agents — Discord, Teams, Meet, Slack, Zoom, Telegram, WhatsApp, NC Talk, SIP
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/VictorHuang0843/voice-dialog'
If you have feedback or need assistance with the MCP directory API, please join our Discord server