Voice Mode
VoiceMode
与 Claude Code(及其他支持 MCP 的智能体)进行自然语音对话
VoiceMode 支持与 Claude Code 进行自然语音对话。语音的目的不是取代打字,而是在无法打字时提供另一种选择。
非常适合:
走在去开会的路上
边做饭边调试代码
在长时间盯着屏幕后让眼睛休息一下
手里拿着咖啡(或牵着狗)
任何手或眼睛忙不过来的时刻
演示视频

Related MCP server: Voice Call MCP Server
快速入门
要求: 带有麦克风和扬声器的计算机
选项 1:Claude Code 插件(推荐)
Claude Code 用户最快的上手方式:
# Add the VoiceMode marketplace
claude plugin marketplace add mbailey/voicemode
# Install VoiceMode plugin
claude plugin install voicemode@voicemode
## Install dependencies (CLI, Local Voice Services)
/voicemode:install
# Start talking!
/voicemode:converse选项 2:Python 安装包
安装依赖项和 VoiceMode Python 包。
# Install UV package manager (if needed)
curl -LsSf https://astral.sh/uv/install.sh | sh
# Run the installer (sets up dependencies and local voice services)
uvx voice-mode-install
# Add to Claude Code
claude mcp add --scope user voicemode -- uvx --refresh voice-mode
# Optional: Add OpenAI API key as fallback for local services
export OPENAI_API_KEY=your-openai-key
# Start a conversation
claude converse如需手动设置,请参阅 入门指南。
功能特性
自然对话 - 自然地交谈,立即听到回复
离线工作 - 可选的本地语音服务(Whisper STT,Kokoro TTS)
低延迟 - 速度快到感觉就像真实的对话
智能静音检测 - 当你停止说话时自动停止录音
隐私选项 - 完全在本地运行或使用云服务
兼容性
平台: Linux, macOS, Windows (WSL), NixOS Python: 3.10-3.14
配置
VoiceMode 开箱即用。如需自定义:
# Set OpenAI API key (if using cloud services)
export OPENAI_API_KEY="your-key"
# Or configure via file
voicemode config edit请参阅 配置指南 查看所有选项。
权限设置(可选)
若要使用 VoiceMode 而无需权限提示,请添加到 ~/.claude/settings.json:
{
"permissions": {
"allow": [
"mcp__voicemode__converse",
"mcp__voicemode__service"
]
}
}请参阅 权限指南 查看更多选项。
本地语音服务
为了隐私或离线使用,请安装本地语音服务:
Whisper.cpp - 本地语音转文字
Kokoro - 支持多种音色的本地文字转语音
这些服务提供与 OpenAI 相同的 API,因此 VoiceMode 可以无缝切换。
安装详情
Ubuntu/Debian
sudo apt update
sudo apt install -y ffmpeg gcc libasound2-dev libasound2-plugins libportaudio2 portaudio19-dev pulseaudio pulseaudio-utils python3-devWSL2 用户:上述 pulseaudio 包是麦克风访问所必需的。
Fedora/RHEL
sudo dnf install alsa-lib-devel ffmpeg gcc portaudio portaudio-devel python3-develmacOS
brew install ffmpeg node portaudioNixOS
# Use development shell
nix develop github:mbailey/voicemode
# Or install system-wide
nix profile install github:mbailey/voicemode从源码安装
git clone https://github.com/mbailey/voicemode.git
cd voicemode
uv tool install -e .NixOS 系统级安装
# In /etc/nixos/configuration.nix
environment.systemPackages = [
(builtins.getFlake "github:mbailey/voicemode").packages.${pkgs.system}.default
];故障排除
问题 | 解决方案 |
无法访问麦克风 | 检查终端/应用权限。WSL2 需要 pulseaudio 包。 |
未找到 UV | 运行 |
OpenAI API 错误 | 验证 |
无音频输出 | 检查系统音频设置和可用设备 |
保存音频以进行调试
export VOICEMODE_SAVE_AUDIO=true
# Files saved to ~/.voicemode/audio/YYYY/MM/文档
入门指南 - 完整设置指南
配置 - 所有环境变量
Whisper 设置 - 本地语音转文字
Kokoro 设置 - 本地文字转语音
开发设置 - 贡献指南
完整文档:voice-mode.readthedocs.io
链接
网站: getvoicemode.com
GitHub: github.com/mbailey/voicemode
YouTube: @getvoicemode
Twitter/X: @getvoicemode
通讯:
许可证
MIT - 一个 Failmode 项目
mcp-name: com.failmode/voicemode
This server cannot be deployed
Maintenance
Related MCP Connectors
A comprehensive Model Context Protocol (MCP) server that enables AI assistants to interact with yo…
- QuallaaOAuthcom.quallaa
Talk to your public-facing AI from any MCP client — Claude, ChatGPT, Cursor, Cline, Windsurf.
AI voice generation: text-to-speech and voice cloning from any MCP client.
Build and manage AI-native customer support agents from Claude or any MCP client.
Related MCP Servers
- AlicenseNot gradedqualityCmaintenanceA Model Context Protocol server that integrates high-quality text-to-speech capabilities with Claude Desktop and other MCP-compatible clients, supporting multiple voice options and audio formats.17 npm1MIT
- AlicenseNot gradedqualityDmaintenanceA Model Context Protocol server that enables AI assistants like Claude to initiate and manage real-time voice calls using Twilio and OpenAI's voice models.62MIT
- AlicenseBqualityDmaintenanceAn MCP (Model Context Protocol) server that provides seamless integration between Fish Audio's Text-to-Speech API and LLMs like Claude, enabling natural language-driven speech synthesis.2171 npm14MIT
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.-