voxagent
🎙️ VoxAgent
Sprich mit deinem Coding-Agenten. Er antwortet.
Lokale Sprach-Ein-/Ausgabe für Claude Code, Cursor, OpenClaw und jeden MCP-Client.

Warum
Coding-Agenten haben sich von Autovervollständigung zu Kollegen entwickelt – aber die Schnittstelle ist immer noch eine Tastatur. VoxAgent gibt deinem Agenten Ohren und einen Mund:
🎤
listen()— Diktiere Anweisungen, Code-Snippets oder Code-Review-Feedback.🔊
speak()— Gesprochene Fortschrittsmeldungen; hol dir einen Kaffee, während dein Agent spricht.🗣️
ask_user()— Der Agent fragt, du antwortest laut aus dem Nebenzimmer.🕹️ Push-to-talk — Halte einen globalen Hotkey an beliebiger Stelle gedrückt; deine Worte gehen direkt in
claude -p, und die Antwort wird zurückgesprochen.
Alles läuft auf deiner Maschine. STT ist vollständig offline (faster-whisper); TTS startet mit einer Stimme ohne Einrichtung und kann auf einen lokalen CosyVoice-Server aufgerüstet werden, für Sprachausgabe in Produktionsqualität. Keine API-Schlüssel erforderlich.
Schnellstart
pip install 'voxagent[local]'
voxagent doctor # check mic + deps
voxagent demo # try the talk-loop standalone
# Register with Claude Code
claude mcp add voxagent -- voxagent serve
# Enable the agent skill (when to speak, how to behave)
mkdir -p ~/.claude/skills && cp -r skills/voice-control ~/.claude/skills/
# Push-to-talk daemon (optional): talk to Claude Code from any app
pip install 'voxagent[ptt]'
voxagent ptt --send 'claude -p'Sag dann einfach „voice mode on“ – oder halte den PTT-Hotkey (Standard Ctrl+Shift+Space) gedrückt und sprich.
Funktioniert mit jedem MCP-Client – Cursor, OpenClaw, Codex und Co. sprechen alle MCP.
Architektur
┌─────────────┐ MCP (stdio) ┌──────────────────┐
mic ──▶│ listen() │◀────────────────────▶│ Claude Code / │
│ (STT) │ │ Cursor / any │
spk ◀──│ speak() │◀────────────────────▶│ MCP client │
│ (TTS) │ tools+skill └──────────────────┘
└─────────────┘
faster-whisper edge-tts / CosyVoice (pluggable)
▲ fully offline ▲ swap via env varEngines sind austauschbar – eine Umgebungsvariable genügt, um eine der beiden Seiten zu wechseln:
Ebene | Standard | Upgrade-Pfad | Konfiguration |
STT | faster-whisper ( |
|
|
TTS | edge-tts (ohne Einrichtung) | lokaler CosyVoice-Server |
|
Sprache | automatische Erkennung | festlegen auf |
|
Alle Optionen findest du in .env.example.
MCP-Tools
Tool | Funktion |
| Mikrofon aufnehmen → Transkript. Automatischer Stopp bei Stille, VAD-gefiltert. |
| Text → Sprache auf deinen Lautsprechern. Gibt die gesprochene Dauer in Sekunden zurück. |
| Frage aussprechen, dann die gesprochene Antwort erfassen. |
Die gebündelte Agent Skill (skills/voice-control) bringt dem Agenten bei, wann sie verwendet wird: kurze gesprochene Antworten, Sprachankündigungen vor langen Aufgaben, Spiegelung der Nutzersprache, eleganter Rückgriff auf Text.
Fehlerbehebung
Fehler beim Herunterladen des Modells (Netzwerkfehler von huggingface.co): Lade das Modell manuell von einem Mirror herunter und setze WHISPER_MODEL auf den Ordner.
bash scripts/download_model.sh tiny # or base / small
export WHISPER_MODEL="$HOME/.voxagent/models/tiny"Das Skript lädt von hf-mirror.com mit einfachem curl herunter und umgeht das huggingface_hub SDK vollständig. Alternativ kannst du vor dem Ausführen HF_ENDPOINT=https://hf-mirror.com und HF_HUB_DISABLE_XET=1 setzen, falls das SDK bei dir funktioniert.
Hotkey gedrückt halten gibt Zeichen in die fokussierte App ein (z. B. sendet ctrl+j in einem Terminal Zeilenumbrüche und scrollt es, während du sprichst): Unter macOS verschluckt der Daemon die Zeichentaste des Hotkeys, solange die Kombination gehalten wird. Falls der Unterdrücker nicht verfügbar ist, verwende besser einen zeichenfreien Hotkey wie --hotkey f6 oder --hotkey ctrl+cmd+j.
macOS-Hotkeys reagieren nicht: Erteile deinem Terminal die Berechtigung Bedienungshilfen / Eingabeüberwachung in den Systemeinstellungen → Datenschutz & Sicherheit und starte den Daemon anschließend neu.
Roadmap
Globaler Push-to-talk-Hotkey (
voxagent ptt)Streaming-STT (partielle Transkripte während du sprichst)
Sprachgedächtnis – klone deine eigene Stimme für Antworten des Agenten
Integrationsrezepte für OpenClaw / n8n
Docker-Image mit gebündeltem CosyVoice
Mitwirken
Issues und PRs sind willkommen – insbesondere neue Engine-Adapter (GPT-SoVITS, F5-TTS, Piper...). Jeder Adapter umfasst ~40 Zeilen; das Muster findest du in voxagent/tts/cosyvoice_engine.py.
Lizenz
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.
Persistent memory and cross-session learning for AI coding assistants (hosted remote MCP).
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/zanezhao0708/voxagent'
If you have feedback or need assistance with the MCP directory API, please join our Discord server