Voice Mode
VoiceMode
Claude Code(およびその他のMCP対応エージェント)との自然な音声会話
VoiceModeは、Claude Codeとの自然な音声会話を実現します。音声はタイピングに代わるものではなく、タイピングができない状況で利用するためのものです。
次のような場面に最適です:
次の会議へ向かって歩いているとき
デバッグ中に料理をしているとき
長時間のスクリーンタイムの後に目を休めたいとき
コーヒー(または犬)を持っているとき
手や目がふさがっているあらゆる瞬間
デモ動画

Related MCP server: Voice Call MCP Server
クイックスタート
要件: マイクとスピーカーを備えたコンピュータ
オプション 1: Claude Code プラグイン (推奨)
Claude Codeユーザーが最も素早く開始する方法:
# Add the VoiceMode marketplace
claude plugin marketplace add mbailey/voicemode
# Install VoiceMode plugin
claude plugin install voicemode@voicemode
## Install dependencies (CLI, Local Voice Services)
/voicemode:install
# Start talking!
/voicemode:converseオプション 2: Python インストーラーパッケージ
依存関係とVoiceMode Pythonパッケージをインストールします。
# Install UV package manager (if needed)
curl -LsSf https://astral.sh/uv/install.sh | sh
# Run the installer (sets up dependencies and local voice services)
uvx voice-mode-install
# Add to Claude Code
claude mcp add --scope user voicemode -- uvx --refresh voice-mode
# Optional: Add OpenAI API key as fallback for local services
export OPENAI_API_KEY=your-openai-key
# Start a conversation
claude converse手動セットアップについては、Getting Started Guide を参照してください。
特徴
自然な会話 - 自然に話し、即座に応答を聞くことができます
オフライン動作 - オプションのローカル音声サービス(Whisper STT、Kokoro TTS)
低遅延 - 実際の会話のように感じられる十分な速さ
スマートな無音検知 - 話すのをやめると録音を停止します
プライバシーオプション - 完全ローカルで実行するか、クラウドサービスを使用するかを選択可能
互換性
プラットフォーム: Linux, macOS, Windows (WSL), NixOS Python: 3.10-3.14
設定
VoiceModeはインストール後すぐに使用できます。カスタマイズを行う場合は以下を参照してください:
# Set OpenAI API key (if using cloud services)
export OPENAI_API_KEY="your-key"
# Or configure via file
voicemode config editすべてのオプションについては、Configuration Guide を参照してください。
権限設定 (オプション)
権限のプロンプトを表示せずにVoiceModeを使用するには、~/.claude/settings.json に以下を追加してください:
{
"permissions": {
"allow": [
"mcp__voicemode__converse",
"mcp__voicemode__service"
]
}
}その他のオプションについては、Permissions Guide を参照してください。
ローカル音声サービス
プライバシー保護やオフライン利用のために、ローカル音声サービスをインストールできます:
Whisper.cpp - ローカル音声認識 (Speech-to-Text)
Kokoro - 複数の声に対応したローカル音声合成 (Text-to-Speech)
これらはOpenAIと同じAPIを提供するため、VoiceModeはそれらの間をシームレスに切り替えることができます。
インストール詳細
Ubuntu/Debian
sudo apt update
sudo apt install -y ffmpeg gcc libasound2-dev libasound2-plugins libportaudio2 portaudio19-dev pulseaudio pulseaudio-utils python3-devWSL2ユーザー: 上記のpulseaudioパッケージはマイクアクセスに必要です。
Fedora/RHEL
sudo dnf install alsa-lib-devel ffmpeg gcc portaudio portaudio-devel python3-develmacOS
brew install ffmpeg node portaudioNixOS
# Use development shell
nix develop github:mbailey/voicemode
# Or install system-wide
nix profile install github:mbailey/voicemodeソースからインストール
git clone https://github.com/mbailey/voicemode.git
cd voicemode
uv tool install -e .NixOS システム全体へのインストール
# In /etc/nixos/configuration.nix
environment.systemPackages = [
(builtins.getFlake "github:mbailey/voicemode").packages.${pkgs.system}.default
];トラブルシューティング
問題 | 解決策 |
マイクにアクセスできない | ターミナル/アプリの権限を確認してください。WSL2にはpulseaudioパッケージが必要です。 |
UVが見つからない |
|
OpenAI APIエラー |
|
音声が出力されない | システムのオーディオ設定と利用可能なデバイスを確認してください |
デバッグ用の音声保存
export VOICEMODE_SAVE_AUDIO=true
# Files saved to ~/.voicemode/audio/YYYY/MM/ドキュメント
Getting Started - 完全なセットアップガイド
Configuration - すべての環境変数
Whisper Setup - ローカル音声認識のセットアップ
Kokoro Setup - ローカル音声合成のセットアップ
Development Setup - 貢献ガイド
完全なドキュメント: voice-mode.readthedocs.io
リンク
ウェブサイト: getvoicemode.com
GitHub: github.com/mbailey/voicemode
YouTube: @getvoicemode
Twitter/X: @getvoicemode
ニュースレター:
ライセンス
MIT - A Failmode Project
mcp-name: com.failmode/voicemode
This server cannot be deployed
Maintenance
Related MCP Connectors
A comprehensive Model Context Protocol (MCP) server that enables AI assistants to interact with yo…
- QuallaaOAuthcom.quallaa
Talk to your public-facing AI from any MCP client — Claude, ChatGPT, Cursor, Cline, Windsurf.
AI voice generation: text-to-speech and voice cloning from any MCP client.
Build and manage AI-native customer support agents from Claude or any MCP client.
Related MCP Servers
- AlicenseNot gradedqualityCmaintenanceA Model Context Protocol server that integrates high-quality text-to-speech capabilities with Claude Desktop and other MCP-compatible clients, supporting multiple voice options and audio formats.17 npm1MIT
- AlicenseNot gradedqualityDmaintenanceA Model Context Protocol server that enables AI assistants like Claude to initiate and manage real-time voice calls using Twilio and OpenAI's voice models.62MIT
- AlicenseBqualityDmaintenanceAn MCP (Model Context Protocol) server that provides seamless integration between Fish Audio's Text-to-Speech API and LLMs like Claude, enabling natural language-driven speech synthesis.2171 npm14MIT
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.-