Skip to main content
Glama

🎙️ VoxAgent

Sprich mit deinem Coding-Agenten. Er antwortet.

Lokale Sprach-Ein-/Ausgabe für Claude Code, Cursor, OpenClaw und jeden MCP-Client.

CI License: MIT Python 3.10+ MCP

English · 简体中文

VoxAgent-Demo

Warum

Coding-Agenten haben sich von Autovervollständigung zu Kollegen entwickelt – aber die Schnittstelle ist immer noch eine Tastatur. VoxAgent gibt deinem Agenten Ohren und einen Mund:

  • 🎤 listen() — Diktiere Anweisungen, Code-Snippets oder Code-Review-Feedback.

  • 🔊 speak() — Gesprochene Fortschrittsmeldungen; hol dir einen Kaffee, während dein Agent spricht.

  • 🗣️ ask_user() — Der Agent fragt, du antwortest laut aus dem Nebenzimmer.

  • 🕹️ Push-to-talk — Halte einen globalen Hotkey an beliebiger Stelle gedrückt; deine Worte gehen direkt in claude -p, und die Antwort wird zurückgesprochen.

Alles läuft auf deiner Maschine. STT ist vollständig offline (faster-whisper); TTS startet mit einer Stimme ohne Einrichtung und kann auf einen lokalen CosyVoice-Server aufgerüstet werden, für Sprachausgabe in Produktionsqualität. Keine API-Schlüssel erforderlich.

Schnellstart

pip install 'voxagent[local]'
voxagent doctor        # check mic + deps
voxagent demo          # try the talk-loop standalone

# Register with Claude Code
claude mcp add voxagent -- voxagent serve

# Enable the agent skill (when to speak, how to behave)
mkdir -p ~/.claude/skills && cp -r skills/voice-control ~/.claude/skills/

# Push-to-talk daemon (optional): talk to Claude Code from any app
pip install 'voxagent[ptt]'
voxagent ptt --send 'claude -p'

Sag dann einfach „voice mode on“ – oder halte den PTT-Hotkey (Standard Ctrl+Shift+Space) gedrückt und sprich.

Funktioniert mit jedem MCP-Client – Cursor, OpenClaw, Codex und Co. sprechen alle MCP.

Architektur

        ┌─────────────┐     MCP (stdio)      ┌──────────────────┐
 mic ──▶│   listen()  │◀────────────────────▶│  Claude Code /   │
        │  (STT)      │                      │  Cursor / any    │
 spk ◀──│   speak()   │◀────────────────────▶│  MCP client      │
        │  (TTS)      │      tools+skill     └──────────────────┘
        └─────────────┘
          faster-whisper   edge-tts / CosyVoice (pluggable)
          ▲ fully offline           ▲ swap via env var

Engines sind austauschbar – eine Umgebungsvariable genügt, um eine der beiden Seiten zu wechseln:

Ebene

Standard

Upgrade-Pfad

Konfiguration

STT

faster-whisper (small)

medium / large-v3, GPU

WHISPER_MODEL, WHISPER_DEVICE

TTS

edge-tts (ohne Einrichtung)

lokaler CosyVoice-Server

VOXAGENT_TTS_ENGINE=cosyvoice

Sprache

automatische Erkennung

festlegen auf zh / en / ...

VOXAGENT_LANGUAGE

Alle Optionen findest du in .env.example.

MCP-Tools

Tool

Funktion

listen()

Mikrofon aufnehmen → Transkript. Automatischer Stopp bei Stille, VAD-gefiltert.

speak(text)

Text → Sprache auf deinen Lautsprechern. Gibt die gesprochene Dauer in Sekunden zurück.

ask_user(question)

Frage aussprechen, dann die gesprochene Antwort erfassen.

Die gebündelte Agent Skill (skills/voice-control) bringt dem Agenten bei, wann sie verwendet wird: kurze gesprochene Antworten, Sprachankündigungen vor langen Aufgaben, Spiegelung der Nutzersprache, eleganter Rückgriff auf Text.

Fehlerbehebung

Fehler beim Herunterladen des Modells (Netzwerkfehler von huggingface.co): Lade das Modell manuell von einem Mirror herunter und setze WHISPER_MODEL auf den Ordner.

bash scripts/download_model.sh tiny            # or base / small
export WHISPER_MODEL="$HOME/.voxagent/models/tiny"

Das Skript lädt von hf-mirror.com mit einfachem curl herunter und umgeht das huggingface_hub SDK vollständig. Alternativ kannst du vor dem Ausführen HF_ENDPOINT=https://hf-mirror.com und HF_HUB_DISABLE_XET=1 setzen, falls das SDK bei dir funktioniert.

Hotkey gedrückt halten gibt Zeichen in die fokussierte App ein (z. B. sendet ctrl+j in einem Terminal Zeilenumbrüche und scrollt es, während du sprichst): Unter macOS verschluckt der Daemon die Zeichentaste des Hotkeys, solange die Kombination gehalten wird. Falls der Unterdrücker nicht verfügbar ist, verwende besser einen zeichenfreien Hotkey wie --hotkey f6 oder --hotkey ctrl+cmd+j.

macOS-Hotkeys reagieren nicht: Erteile deinem Terminal die Berechtigung Bedienungshilfen / Eingabeüberwachung in den Systemeinstellungen → Datenschutz & Sicherheit und starte den Daemon anschließend neu.

Roadmap

  • Globaler Push-to-talk-Hotkey (voxagent ptt)

  • Streaming-STT (partielle Transkripte während du sprichst)

  • Sprachgedächtnis – klone deine eigene Stimme für Antworten des Agenten

  • Integrationsrezepte für OpenClaw / n8n

  • Docker-Image mit gebündeltem CosyVoice

Mitwirken

Issues und PRs sind willkommen – insbesondere neue Engine-Adapter (GPT-SoVITS, F5-TTS, Piper...). Jeder Adapter umfasst ~40 Zeilen; das Muster findest du in voxagent/tts/cosyvoice_engine.py.

Lizenz

MIT

-
license - not tested
-
quality - not tested
A
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.

  • Persistent memory and cross-session learning for AI coding assistants (hosted remote MCP).

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/zanezhao0708/voxagent'

If you have feedback or need assistance with the MCP directory API, please join our Discord server