voice-dialog
voice-dialog
Ein MCP-Server, der KI-Agenten Sprachdialog-Fähigkeiten verleiht – und auch als Kommandozeilen-Tool verwendet werden kann. Wenn der Agent seine Arbeit erledigt hat, kann er es dir mündlich mitteilen; er kann aber auch eine Frage stellen und deine Antwort anhören. Die Erkennung läuft lokal über whisper, die Synthese nutzt die systemeigene TTS – durchgehend ohne Internetverbindung und ohne Audio-Übertragung.
Was es kann
你(没看屏幕):"搞定了吗?"
Agent(出声):"代码写完了,测试全过。要提交吗?" ← ask_by_voice
你:"先不提交,我看看再说" ← listen 收到,本地转写
Agent(出声):"好,先留着。" ← speakWerkzeug | Zweck |
| Einseitige Ansage (Aufgabe erledigt, Meilenstein) |
| Aufnahme + Erkennung (du diktierst Anweisungen) |
| Atomare Frage-Antwort: eine Ansage → einmal zuhören, niemals automatisch weiter zuhören (verhindert Endlosschleifen) |
| Ein-Klick-Initialisierung (siehe unten) |
| Umgebungs-Check (prüft nur, installiert nichts) |
Related MCP server: Pipecat MCP Server
Schnellstart
git clone https://github.com/VictorHuang0843/voice-dialog.git
cd voice-dialog
# 没装 uv?先来这个(Windows 用 install.ps1):
# curl -LsSf https://astral.sh/uv/install.sh | sh
uv run voice-dialog initinit ist eine 7-stufige, vollautomatische Anleitung: uv installieren → Abhängigkeiten installieren (uv installiert sogar Python für dich) → Whisper-Modell herunterladen (464 MB, läuft in chinesischen Netzwerken automatisch über hf-mirror) → Mikrofonberechtigung per Praxistest prüfen → TTS-Ausgabe per Praxistest prüfen → MCP-Registrierungsbefehl ausgeben. Schlägt ein Schritt fehl, wird der Reparaturbefehl für genau diesen Schritt angezeigt; nach der Reparatur einfach erneut ausführen.
Probier einen Satz aus:
uv run voice-dialog speak "语音系统就绪" --lang zh
uv run voice-dialog ask "请说话" --wait-start 60
# 你会听到:高亮上扬"叮↑"= 开始说话 → 停 3 秒 → 低沉"咚…咚↓"= 录音结束Agent-Anbindung
Beliebige MCP-Clients (Claude Code, Codex, Cursor, LoopX …):
{
"mcpServers": {
"voice-dialog": {
"command": "uv",
"args": ["--project", "/你的路径/voice-dialog", "run", "voice-dialog", "serve"]
}
}
}Claude Code: Registrierung mit einer Zeile:
claude mcp add voice-dialog -s user -- uv --project /你的路径/voice-dialog run voice-dialog serveTools ohne MCP-Unterstützung: CLI direkt aufrufen, uv run voice-dialog speak/listen/ask "...".
Claude Code Skill (optional, bringt dem Agenten bei, wann er sprechen und wann er zuhören soll): skills/voice-dialog/ nach ~/.claude/skills/ kopieren.
Unterstützte Plattformen
macOS | Windows | Linux | |
Spracherkennung | getestet | nutzbar | nutzbar |
Sprachsynthese | System-TTS | SAPI | erfordert espeak-ng |
Signaltöne | nutzbar | nutzbar | erfordert ffmpeg |
Die Sprache wird automatisch erkannt (whisper unterstützt ~100 Sprachen); mit VD_LANG=zh lässt sie sich festlegen; die Modellgröße lässt sich über VD_MODEL=small anpassen.
Häufige Probleme
Symptom | Lösung |
| Den curl-Installationsbefehl von oben ausführen, danach das Terminal neu öffnen |
Mikrofontest schlägt fehl | macOS: Systemeinstellungen → Datenschutz & Sicherheit → Mikrofon → dein Terminal aktivieren; Windows: Einstellungen → Datenschutz → Mikrofon |
Modell-Download schlägt fehl / extrem langsam |
|
TTS gibt keinen Ton aus | Prüfen, ob das System-Ausgabegerät von einer virtuellen Soundkarte (z. B. BlackHole) gekapert wurde |
Codeänderungen zeigen keine Wirkung | Der MCP-Server ist ein Dauerprozess: |
Datenschutz
Sprache wird lokal erkannt (faster-whisper), Text wird über die systemeigene TTS wiedergegeben. Es werden keine Cloud-APIs aufgerufen und keine Audiodaten hochgeladen.
Lizenz
MIT
Hinweise zum Modell
Was wird standardmäßig heruntergeladen? whisper small (int8-quantisiert, ca. 464 MB) – das ausgewogene Verhältnis zwischen Erkennungsqualität und -geschwindigkeit bei Chinesisch und Englisch. Beim ersten listen/init wird es automatisch heruntergeladen und danach lokal zwischengespeichert (macOS/Linux: ~/.cache/huggingface/hub/, Windows: %USERPROFILE%\.cache\huggingface\hub\); anschließend wird es nie wieder heruntergeladen.
Wie wird die Download-Quelle gewählt? Die Download-Logik ist nicht fest im Code verankert – beim Erzeugen von WhisperModel("small", ...) lädt die Bibliothek faster-whisper das Modell automatisch von HuggingFace herunter. Standardmäßig wird die offizielle Quelle huggingface.co verwendet; ist sie nicht erreichbar, wechselt der Code automatisch zum chinesischen Mirror hf-mirror.com und versucht es erneut (umgesetzt durch Setzen der Umgebungsvariable HF_ENDPOINT). Auch chinesische Nutzer können sie vorab manuell festlegen:
export HF_ENDPOINT=https://hf-mirror.com # 加进 ~/.zshrc 一劳永逸Auf ein größeres Modell wechseln? Die Umgebungsvariable VD_MODEL steuert die Auswahl; sie wird beim erneuten Ausführen wirksam:
VD_MODEL | Größe | Eigenschaften |
| ~75MB | am schnellsten, Genauigkeit durchschnittlich |
| ~142MB | schnell, für den Alltag ausreichend |
| ~464MB | ausgewogen, empfohlen |
| ~1.5GB | genauer; auf M-Chips braucht die Transkription statt Sekunden zehn Sekunden |
| ~3GB | am genauesten und langsamsten, für kurze Dialoge nicht empfohlen |
VD_MODEL=base uv run voice-dialog listen # 单次用 baseInstallation aus der Zip (ohne git clone)
Zip herunterladen (oder ein Freund schickt sie dir direkt) → an den gewünschten Ort entpacken, z. B. ~/tools/ → Terminal öffnen, in den Ordner wechseln – den Rest erledigt die KI:
帮我安装这个目录里的 voice-dialog 项目:
1. cd 到这个目录跑 uv run voice-dialog init(没装 uv 就先装:curl -LsSf https://astral.sh/uv/install.sh | sh)
2. init 全绿后,把打印出来的 claude mcp add 命令执行掉
3. 最后跑 uv run voice-dialog doctor 给我看结果Sie installiert alles und registriert es in Claude Code; nach einem Neustart der Sitzung ist es einsatzbereit.
Es geht auch manuell, mit nur zwei Befehlen:
cd 解压后的目录
uv run voice-dialog init # 结束时打印注册命令,复制执行Wer sich auf dem Mac mit dem Terminal nicht auskennt: Nach dem Entpacken Rechtsklick auf den Ordner → Dienste → „Neues Terminalfenster im Ordner“ – schon ist man im Verzeichnis.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.

Pipecat MCP Serverofficial
AlicenseNot gradedqualityCmaintenanceEnables voice conversations and screen capture for AI agents via MCP-compatible clients, using Pipecat for speech-to-text and text-to-speech, with support for browser, WebRTC, and phone transport.134BSD 2-Clause "Simplified"- AlicenseNot gradedqualityCmaintenanceEnables AI agents to generate high-quality speech with 54+ voices in multiple languages via MCP tools.17Apache 2.0
- AlicenseNot gradedqualityAmaintenanceGive your AI agents the ability to listen. Microphone capture and speech-to-text tools for MCP-compatible agents.1357Apache 2.0
Related MCP Connectors
Give AI agents real phone numbers, messages, and voice calls via MCP.
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Voice and chat for AI agents — Discord, Teams, Meet, Slack, Zoom, Telegram, WhatsApp, NC Talk, SIP
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/VictorHuang0843/voice-dialog'
If you have feedback or need assistance with the MCP directory API, please join our Discord server