Skip to main content
Glama

VoiceCard

Clona tu voz y conviertelela en un vídeo de forma de onda que puedas compartir, todo impulsado por MCP. Sin GUI. Solo para Apple Silicon.

La clonación de voz ya es un commodity. El diferenciador es la entrega: un MP4 corto con una preciosa forma de onda reactiva al audio se reproduce en línea en WhatsApp, iMessage, Signal y Slack, donde los archivos de audio crudos se quedan atascados, no se autopreproducen o no pasan bien entre iOS/Android. Cada clip que envías es también un anuncio de la herramienta. Esa es toda la idea.

El frontend es el MCP. Puedes hablarle desde Claude Code, Cursor o cualquier agente compatible con MCP:

"Clona mi voz desde ~/Desktop/me.mov (aquí tienes la transcripción) y luego crea un clip de 15 segundos con la paleta Miami que diga feliz cumpleaños, con mi foto en el centro."

Cómo funciona

Es totalmente autónomo. La voz se genera localmente con mlx-audio (Qwen3-TTS via MLX), el vídeo de forma de onda se renderiza con MLX / Pillow y se multiplexa con ffmpeg. Sin nube, sin Voicebox, sin aplicación de escritorio.

La clonación es aprendizaje en contexto zero-shot: recorta la referencia a ~12 segundos y condiciona el modelo sobre ella. No hay paso de entrenamiento ni un modelo separado por voz.

Requisitos

  • Mac con Apple Silicon (arm64). Se comprueba al inicio.

  • ffmpeg en el PATH (brew install ffmpeg).

  • La primera ejecución descarga los pesos de Qwen3-TTS (algunos pocos GB) en la caché de Hugging Face.

Instalación

uv tool install ./voicecard-mcp        # or: uv run voicecard

Regístralo con Claude Code (stdio):

claude mcp add -s user voicecard -- uv --directory /path/to/voicecard-mcp run voicecard

Herramientas

Herramienta

Qué hace

list_voices()

Lista los perfiles de voz almacenados.

palettes()

Lista las paletas disponibles (nombre + colores) y renderiza una hoja de muestras visual (devuelve {palettes, swatch}); muestra la hoja para que el usuario elija a la vista.

clone_voice(name, source, transcript)

Clona a partir de un archivo de audio o vídeo. Recorta la referencia a ~12 s y guarda un perfil. Tú pasas la transcripción del audio de referencia (quien invoca / el agente la transcribe, p. ej., con mlx-whisper — debe ser precisa).

speak(text, voice)

Genera voz en la voz clonada; devuelve una ruta al archivo wav.

make_clip(text, voice, palette?, photo?, label?, aspect?, layout?, arc?)

Genera la voz y renderiza el mp4 de forma de onda compartible. Devuelve la ruta del MP4.

Paletas: Noir (predeterminada), 70s Gold, Miami, Aurora, Sunset, Mint, Blueprint Relación de aspecto: square (1080², predeterminada), portrait (9:16) Diseño: linear (predeterminado — foto del círculo + forma de onda compacta con degradado debajo, estilo Dynamic Island) · paule ... cirle (anillo central espectro reactivo al audio) Arco (solo con circle): full (predeterminado, anillo espejo) · top (picos en la mitad superior)

Configuración (env)

Variable

Valor predeterminado

VOICECARD_OUT

~/VoiceCard (perfiles + clips renderizados)

VOICECARD_MODEL

mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16

VOICECARD_URL

destino del QR impreso en cada clip

VOICECARD_TAGLINE

eslogan impreso en cada clip

Notas

  • La salida es estéreo, +faststart, perfil H.264 High — ajustada para que se reproduzca automáticamente en línea en los mensajeros.

  • La forma de onda está estilizada para verse siempre viva, no un analizador de espectro de diagnóstico.

  • La descarga del decodificador autorregresivo a Core ML / ANE no está planificada (formas de onda dinámicas + la caché KV + decodificación secuencial encajan mal en la ANE). La única pieza que merece la pena explorar es una futura descarga del vocoder a Core ML.

Licencia

MIT. Eres responsable de clonar solo voces que tienes o autorizadas a usar.

-
license - not tested
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.

  • Generate images, video, and audio with Glif's media-generation agent

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/JasonMakes801/voicecard-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server