Skip to main content
Glama

voice-dialog

Un servidor MCP que añade capacidad de conversación por voz a los agentes de IA, y que también puede usarse como herramienta de línea de comandos. Cuando el agente termina su trabajo, puede decírtelo hablando, y también puede preguntarte y escuchar tu respuesta. El reconocimiento se ejecuta en whisper local, y la síntesis usa el TTS del sistema; no se necesita conexión a internet en todo el proceso ni se envían audios.

Qué puede hacer

你(没看屏幕):"搞定了吗?"
Agent(出声):"代码写完了,测试全过。要提交吗?"      ← ask_by_voice
你:"先不提交,我看看再说"                             ← listen 收到,本地转写
Agent(出声):"好,先留着。"                          ← speak

Herramienta

Uso

speak

Aviso unidireccional (tarea completada, hitos)

listen

Grabación + reconocimiento (dictas instrucciones)

ask_by_voice

Pregunta-respuesta atómica: dice una frase → escucha una vez, nunca sigue escuchando automáticamente (evita bucles infinitos)

init

Inicialización con un clic (ver más abajo)

doctor

Chequeo del entorno (solo comprueba, no instala)

Related MCP server: Pipecat MCP Server

Inicio rápido

git clone https://github.com/VictorHuang0843/voice-dialog.git
cd voice-dialog

# 没装 uv?先来这个(Windows 用 install.ps1):
#   curl -LsSf https://astral.sh/uv/install.sh | sh

uv run voice-dialog init

init es una guía totalmente automática de 7 pasos: instala uv → instala dependencias (uv incluso te instala Python) → descarga el modelo whisper (464 MB; con red de China usa automáticamente hf-mirror) → prueba real de permisos de micrófono → prueba real de salida de TTS → imprime el comando de registro de MCP. Si un paso falla, te da el comando para arreglarlo; una vez arreglado, vuelve a ejecutarlo.

Prueba una frase:

uv run voice-dialog speak "语音系统就绪" --lang zh
uv run voice-dialog ask "请说话" --wait-start 60
# 你会听到:高亮上扬"叮↑"= 开始说话 → 停 3 秒 → 低沉"咚…咚↓"= 录音结束

Conecta tu agente

Cualquier cliente MCP (Claude Code, Codex, Cursor, LoopX…):

{
  "mcpServers": {
    "voice-dialog": {
      "command": "uv",
      "args": ["--project", "/你的路径/voice-dialog", "run", "voice-dialog", "serve"]
    }
  }
}

Registro en una línea con Claude Code:

claude mcp add voice-dialog -s user -- uv --project /你的路径/voice-dialog run voice-dialog serve

Herramientas que no admiten MCP: llama directamente a la CLI, uv run voice-dialog speak/listen/ask "...".

Claude Code Skill (opcional, enseña al agente cuándo hablar/escuchar): copia skills/voice-dialog/ a ~/.claude/skills/.

Plataformas compatibles

macOS

Windows

Linux

Reconocimiento de voz

Probado

Disponible

Disponible

Síntesis de voz

TTS del sistema

SAPI

Requiere espeak-ng

Sonido de aviso

Disponible

Disponible

Requiere ffmpeg

Detección automática de idioma (whisper admite ~100 idiomas); VD_LANG=zh permite fijarlo; el tamaño del modelo se ajusta con VD_MODEL=small.

Preguntas frecuentes

Síntoma

Solución

init informa que uv no está instalado

Ejecuta el comando de instalación con curl de arriba y, al terminar, reinicia la terminal

Falla la prueba del micrófono

macOS: Ajustes del Sistema → Privacidad y seguridad → Micrófono → marca tu terminal; Windows: Configuración → Privacidad → Micrófono

La descarga del modelo falla o es muy lenta

Vuelve a ejecutarlo después de export HF_ENDPOINT=https://hf-mirror.com

TTS sin sonido

Comprueba si el dispositivo de salida del sistema está siendo secuestrado por una tarjeta de sonido virtual (BlackHole, etc.)

Los cambios en el código no surten efecto

El servidor MCP es un proceso residente: pkill -f "voice-dialog serve"

Privacidad

La voz se reconoce localmente (faster-whisper), el texto se reproduce con el TTS del sistema, no se llama a ninguna API en la nube y no se sube ningún audio.

Licencia

MIT

Notas sobre el modelo

¿Qué se descarga por defecto? whisper small (cuantización int8, ~464 MB), el punto de equilibrio entre precisión y velocidad para reconocer chino e inglés. Se descarga automáticamente la primera vez que se ejecuta listen/init, y luego queda en caché local (macOS/Linux: ~/.cache/huggingface/hub/, Windows: %USERPROFILE%\.cache\huggingface\hub\); nunca se vuelve a descargar.

¿Cómo se elige la fuente de descarga? El código no fija la lógica de descarga: al construir WhisperModel("small", ...), la librería faster-whisper descarga automáticamente desde HuggingFace. Por defecto usa la fuente oficial huggingface.co; si no se puede conectar con la fuente oficial, el código cambia automáticamente al espejo nacional hf-mirror.com y reintenta (se hace configurando la variable de entorno HF_ENDPOINT). Los usuarios en China también pueden fijarlo manualmente de antemano:

export HF_ENDPOINT=https://hf-mirror.com   # 加进 ~/.zshrc 一劳永逸

¿Quieres cambiar a un modelo más grande? Lo controla la variable de entorno VD_MODEL; vuelve a ejecutar para que surta efecto:

VD_MODEL

Tamaño

Características

tiny

~75MB

El más rápido, precisión media

base

~142MB

Rápido, suficiente para el uso diario

small (predeterminado)

~464MB

Equilibrado, recomendado

medium

~1.5GB

Más preciso, en chips M la transcripción pasa de segundos a decenas de segundos

large-v3

~3GB

El más preciso y lento, no recomendado para conversaciones cortas

VD_MODEL=base uv run voice-dialog listen   # 单次用 base

Instalación desde zip (sin git clone)

Descarga el zip (o que un amigo te lo envíe directamente) → descomprímelo donde quieras, por ejemplo ~/tools/ → abre la terminal y entra en el directorio, y deja el resto a la IA:

En Claude Code (o cualquier herramienta de IA de programación que pueda ejecutar comandos), envíale el siguiente bloque tal cual:

帮我安装这个目录里的 voice-dialog 项目:
1. cd 到这个目录跑 uv run voice-dialog init(没装 uv 就先装:curl -LsSf https://astral.sh/uv/install.sh | sh)
2. init 全绿后,把打印出来的 claude mcp add 命令执行掉
3. 最后跑 uv run voice-dialog doctor 给我看结果

Instalará todo y lo registrará en Claude Code; reinicia la sesión y ya podrás usarlo.

También puedes hacerlo manualmente, solo dos comandos:

cd 解压后的目录
uv run voice-dialog init        # 结束时打印注册命令,复制执行

Si no estás familiarizado con la terminal en Mac: tras descomprimir, haz clic derecho en la carpeta → Servicios → Nueva terminal en la carpeta, y ya estarás en el directorio.

A
license - permissive license
Not graded
quality - not tested
A
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Give AI agents real phone numbers, messages, and voice calls via MCP.

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Voice and chat for AI agents — Discord, Teams, Meet, Slack, Zoom, Telegram, WhatsApp, NC Talk, SIP

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/VictorHuang0843/voice-dialog'

If you have feedback or need assistance with the MCP directory API, please join our Discord server