Skip to main content
Glama

VoiceMode

Claude Code(및 기타 MCP 지원 에이전트)와의 자연스러운 음성 대화

PyPI Downloads PyPI Downloads PyPI Downloads

VoiceMode는 Claude Code와 자연스러운 음성 대화를 가능하게 합니다. 음성은 타이핑을 대체하는 것이 아니라, 타이핑이 불가능할 때 사용할 수 있도록 하는 것입니다.

다음과 같은 상황에 완벽합니다:

  • 다음 회의 장소로 걸어갈 때

  • 요리하면서 디버깅할 때

  • 장시간 화면을 본 후 눈에 휴식을 주고 싶을 때

  • 커피(또는 반려견)를 들고 있을 때

  • 손이나 눈이 바쁜 모든 순간

작동 모습

VoiceMode Demo

Related MCP server: Voice Call MCP Server

빠른 시작

요구 사항: 마이크와 스피커가 있는 컴퓨터

옵션 1: Claude Code 플러그인 (권장)

Claude Code 사용자가 가장 빠르게 시작하는 방법:

# Add the VoiceMode marketplace
claude plugin marketplace add mbailey/voicemode

# Install VoiceMode plugin
claude plugin install voicemode@voicemode

## Install dependencies (CLI, Local Voice Services)

/voicemode:install

# Start talking!
/voicemode:converse

옵션 2: Python 설치 패키지

종속성 및 VoiceMode Python 패키지를 설치합니다.

# Install UV package manager (if needed)
curl -LsSf https://astral.sh/uv/install.sh | sh

# Run the installer (sets up dependencies and local voice services)
uvx voice-mode-install

# Add to Claude Code
claude mcp add --scope user voicemode -- uvx --refresh voice-mode

# Optional: Add OpenAI API key as fallback for local services
export OPENAI_API_KEY=your-openai-key

# Start a conversation
claude converse

수동 설정은 시작하기 가이드를 참조하세요.

기능

  • 자연스러운 대화 - 자연스럽게 말하고 즉시 응답을 듣습니다.

  • 오프라인 작동 - 선택적 로컬 음성 서비스(Whisper STT, Kokoro TTS) 지원

  • 낮은 지연 시간 - 실제 대화처럼 느껴질 만큼 빠름

  • 스마트 침묵 감지 - 말을 멈추면 녹음이 중단됩니다.

  • 개인정보 보호 옵션 - 완전히 로컬에서 실행하거나 클라우드 서비스를 사용합니다.

호환성

플랫폼: Linux, macOS, Windows (WSL), NixOS Python: 3.10-3.14

구성

VoiceMode는 설치 즉시 작동합니다. 사용자 정의를 원하시면:

# Set OpenAI API key (if using cloud services)
export OPENAI_API_KEY="your-key"

# Or configure via file
voicemode config edit

모든 옵션은 구성 가이드를 참조하세요.

권한 설정 (선택 사항)

권한 프롬프트 없이 VoiceMode를 사용하려면 ~/.claude/settings.json에 다음을 추가하세요:

{
  "permissions": {
    "allow": [
      "mcp__voicemode__converse",
      "mcp__voicemode__service"
    ]
  }
}

더 많은 옵션은 권한 가이드를 참조하세요.

로컬 음성 서비스

개인정보 보호나 오프라인 사용을 위해 로컬 음성 서비스를 설치하세요:

  • Whisper.cpp - 로컬 음성-텍스트 변환(STT)

  • Kokoro - 다양한 음성을 지원하는 로컬 텍스트-음성 변환(TTS)

이 서비스들은 OpenAI와 동일한 API를 제공하므로 VoiceMode가 원활하게 전환할 수 있습니다.

설치 세부 정보

Ubuntu/Debian

sudo apt update
sudo apt install -y ffmpeg gcc libasound2-dev libasound2-plugins libportaudio2 portaudio19-dev pulseaudio pulseaudio-utils python3-dev

WSL2 사용자: 마이크 액세스를 위해 위의 pulseaudio 패키지가 필요합니다.

Fedora/RHEL

sudo dnf install alsa-lib-devel ffmpeg gcc portaudio portaudio-devel python3-devel

macOS

brew install ffmpeg node portaudio

NixOS

# Use development shell
nix develop github:mbailey/voicemode

# Or install system-wide
nix profile install github:mbailey/voicemode

소스에서 설치

git clone https://github.com/mbailey/voicemode.git
cd voicemode
uv tool install -e .

NixOS 시스템 전체 설치

# In /etc/nixos/configuration.nix
environment.systemPackages = [
  (builtins.getFlake "github:mbailey/voicemode").packages.${pkgs.system}.default
];

문제 해결

문제

해결 방법

마이크 액세스 불가

터미널/앱 권한을 확인하세요. WSL2는 pulseaudio 패키지가 필요합니다.

UV를 찾을 수 없음

`curl -LsSf https://astral.sh/uv/install.sh

sh`를 실행하세요

OpenAI API 오류

OPENAI_API_KEY가 올바르게 설정되었는지 확인하세요

오디오 출력 없음

시스템 오디오 설정 및 사용 가능한 장치를 확인하세요

디버깅을 위한 오디오 저장

export VOICEMODE_SAVE_AUDIO=true
# Files saved to ~/.voicemode/audio/YYYY/MM/

문서

전체 문서: voice-mode.readthedocs.io

링크

라이선스

MIT - Failmode 프로젝트


mcp-name: com.failmode/voicemode

Related MCP Connectors

Related MCP Servers

  • A
    license
    Not graded
    quality
    C
    maintenance
    A Model Context Protocol server that integrates high-quality text-to-speech capabilities with Claude Desktop and other MCP-compatible clients, supporting multiple voice options and audio formats.
    17 npm
    1
    MIT
  • A
    license
    B
    quality
    D
    maintenance
    An MCP (Model Context Protocol) server that provides seamless integration between Fish Audio's Text-to-Speech API and LLMs like Claude, enabling natural language-driven speech synthesis.
    2
    171 npm
    14
    MIT
  • F
    license
    Not graded
    quality
    Not graded
    maintenance
    A local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.
    -