Skip to main content
Glama

VoiceMode

Claude Code(およびその他のMCP対応エージェント)との自然な音声会話

PyPI Downloads PyPI Downloads PyPI Downloads

VoiceModeは、Claude Codeとの自然な音声会話を実現します。音声はタイピングに代わるものではなく、タイピングができない状況で利用するためのものです。

次のような場面に最適です:

  • 次の会議へ向かって歩いているとき

  • デバッグ中に料理をしているとき

  • 長時間のスクリーンタイムの後に目を休めたいとき

  • コーヒー(または犬)を持っているとき

  • 手や目がふさがっているあらゆる瞬間

デモ動画

VoiceMode Demo

Related MCP server: Voice Call MCP Server

クイックスタート

要件: マイクとスピーカーを備えたコンピュータ

オプション 1: Claude Code プラグイン (推奨)

Claude Codeユーザーが最も素早く開始する方法:

# Add the VoiceMode marketplace
claude plugin marketplace add mbailey/voicemode

# Install VoiceMode plugin
claude plugin install voicemode@voicemode

## Install dependencies (CLI, Local Voice Services)

/voicemode:install

# Start talking!
/voicemode:converse

オプション 2: Python インストーラーパッケージ

依存関係とVoiceMode Pythonパッケージをインストールします。

# Install UV package manager (if needed)
curl -LsSf https://astral.sh/uv/install.sh | sh

# Run the installer (sets up dependencies and local voice services)
uvx voice-mode-install

# Add to Claude Code
claude mcp add --scope user voicemode -- uvx --refresh voice-mode

# Optional: Add OpenAI API key as fallback for local services
export OPENAI_API_KEY=your-openai-key

# Start a conversation
claude converse

手動セットアップについては、Getting Started Guide を参照してください。

特徴

  • 自然な会話 - 自然に話し、即座に応答を聞くことができます

  • オフライン動作 - オプションのローカル音声サービス(Whisper STT、Kokoro TTS)

  • 低遅延 - 実際の会話のように感じられる十分な速さ

  • スマートな無音検知 - 話すのをやめると録音を停止します

  • プライバシーオプション - 完全ローカルで実行するか、クラウドサービスを使用するかを選択可能

互換性

プラットフォーム: Linux, macOS, Windows (WSL), NixOS Python: 3.10-3.14

設定

VoiceModeはインストール後すぐに使用できます。カスタマイズを行う場合は以下を参照してください:

# Set OpenAI API key (if using cloud services)
export OPENAI_API_KEY="your-key"

# Or configure via file
voicemode config edit

すべてのオプションについては、Configuration Guide を参照してください。

権限設定 (オプション)

権限のプロンプトを表示せずにVoiceModeを使用するには、~/.claude/settings.json に以下を追加してください:

{
  "permissions": {
    "allow": [
      "mcp__voicemode__converse",
      "mcp__voicemode__service"
    ]
  }
}

その他のオプションについては、Permissions Guide を参照してください。

ローカル音声サービス

プライバシー保護やオフライン利用のために、ローカル音声サービスをインストールできます:

  • Whisper.cpp - ローカル音声認識 (Speech-to-Text)

  • Kokoro - 複数の声に対応したローカル音声合成 (Text-to-Speech)

これらはOpenAIと同じAPIを提供するため、VoiceModeはそれらの間をシームレスに切り替えることができます。

インストール詳細

Ubuntu/Debian

sudo apt update
sudo apt install -y ffmpeg gcc libasound2-dev libasound2-plugins libportaudio2 portaudio19-dev pulseaudio pulseaudio-utils python3-dev

WSL2ユーザー: 上記のpulseaudioパッケージはマイクアクセスに必要です。

Fedora/RHEL

sudo dnf install alsa-lib-devel ffmpeg gcc portaudio portaudio-devel python3-devel

macOS

brew install ffmpeg node portaudio

NixOS

# Use development shell
nix develop github:mbailey/voicemode

# Or install system-wide
nix profile install github:mbailey/voicemode

ソースからインストール

git clone https://github.com/mbailey/voicemode.git
cd voicemode
uv tool install -e .

NixOS システム全体へのインストール

# In /etc/nixos/configuration.nix
environment.systemPackages = [
  (builtins.getFlake "github:mbailey/voicemode").packages.${pkgs.system}.default
];

トラブルシューティング

問題

解決策

マイクにアクセスできない

ターミナル/アプリの権限を確認してください。WSL2にはpulseaudioパッケージが必要です。

UVが見つからない

curl -LsSf https://astral.sh/uv/install.sh | sh を実行してください

OpenAI APIエラー

OPENAI_API_KEY が正しく設定されているか確認してください

音声が出力されない

システムのオーディオ設定と利用可能なデバイスを確認してください

デバッグ用の音声保存

export VOICEMODE_SAVE_AUDIO=true
# Files saved to ~/.voicemode/audio/YYYY/MM/

ドキュメント

完全なドキュメント: voice-mode.readthedocs.io

リンク

ライセンス

MIT - A Failmode Project


mcp-name: com.failmode/voicemode

Related MCP Connectors

Related MCP Servers

  • A
    license
    Not graded
    quality
    C
    maintenance
    A Model Context Protocol server that integrates high-quality text-to-speech capabilities with Claude Desktop and other MCP-compatible clients, supporting multiple voice options and audio formats.
    17 npm
    1
    MIT
  • A
    license
    B
    quality
    D
    maintenance
    An MCP (Model Context Protocol) server that provides seamless integration between Fish Audio's Text-to-Speech API and LLMs like Claude, enabling natural language-driven speech synthesis.
    2
    171 npm
    14
    MIT
  • F
    license
    Not graded
    quality
    Not graded
    maintenance
    A local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.
    -