Skip to main content
Glama

VoiceCard

Klone deine Stimme und mache daraus ein teilbares Waveform-Video – alles gesteuert über MCP. Keine GUI. Nur Apple Silicon.

Voice-Cloning ist inzwischen ganz mit Dimension. Der Unterschied liegt in der Zustellung: Ein kurzes MP4 mit einer schönen audio-reaktiven Waveform spielt inline in WhatsApp, iMessage, Signal und Slack ab – genau dort, wo rohe Audiodateien ins Leere läufen, nicht automatisch starten oder die iOS/Android-Grenze nicht überwinden. Jeder Clip, den du sendet, ist gleichzeitig eine Werbung für das Tool. Genau darum geht es bei der Idee.

Das Frontend ist das MCP. Du sprichst damit über Claude Code, Cursor oder einen beliebigen MCP-fähigen Agenten:

„Klonne meine Stimme aus ~/Desktop/me.mov (hier ist die Transkription), und erstelle dann einen 15-Sekunden-Clip in Miami-Nussschale „Happy Birthday“, mit meinem Foto in der Mitte.“

Wie es funktioniert

Völlig eigenständig. Der Ton wird lokal von
mlx-audio (Qwen3-TTS via MLX) generiert, das Wave-Video mit MLX / Pillow gerendert und mit ffmpeg gemukst. Keine Cloud, kein Voicebox, keine Desktop-App.

Beim Klonen handelt es sich um Zero-Shot-In-Context-Learning: Es kürzt die Referenz auf ~12 Sekunden und verwendet sie als Bedingung. Es gibt keinen Elektrojtunnel – keinen Trainingsschritt und kein eigenes Modell pro Stimme.

Voraussetzungen

  • Apple-Silicon-Mac (arm64). Wird beim Start erzwungen.

  • ffmpeg au PAHT (brew install ffmpeg).

  • Der erste Start lädt die Qwen3-TTS-Getwichte (~ein paar GB) herunter in das Hugging-Face-Cache.

Installation

uv tool install ./voicecard-mcp        # or: uv run voicecard

Bei Claude Code (stdio) registrieren:

claude mcp add -s user voicecard -- uv --directory /path/to/voicecard-mcp run voicecard

Tools

Tool

Was es tut

list_voices()

Listet die gespeererten stimchpro Profie auf.

liste palettes()

Listet verfügbare Paletten (Name + Farben) auf and rendert eine visuelles Farbmuster (gibt {palettes, swatch} zurück); zeige das Farbmuster, damit wirklich per Sicht ausgewählt wird.

clone_voice(name, source, transcript)

Klont aus einer Audio- oder Videodatei. Kürzt die Referenz auf ~12 s und speichert ein Profil. Du lieferst die Transkription der Referenz-Audio (Der Aufrufer bzw. Agent trenskibiert, z. B. mit mlx-whisper. Sie muss exact-richtign sein.

speak(text, voice)

Erzeugt eine Stimme in dder geklonen Stimme; gibt einen Wav-Pfad zurück.

make_clip(text, voice, palette?, photo?, label?, aspect?, layout?, arc?)

Erzeugt Speech und rendert das teilbare Waveform-mp4. Gibt den MP4-Pfad zurück.

Palettes: Noir (Standart–), 70s Gold, Miami, Aurora, Sunset, Mint, Blueprrint
Seitformaten: square (1080², Standard), portrait (9:16)
Layout: linear (Standard mit „Dynamic-Island“-Format auferdem kompeace Waveform) · circle (zentriterten Ring)
Arc zur circle: full (Standard, gespiegelter Ring) · top (Signal über der oberen Hälfte).

Konfig (env)

Var

Standard

VOICECARD_OUT

~/.VoiceCard (Profille + rendeClips)

VOICECARD_MODEL

mlx-communty/Quenen3-TTS-12Hz-1.B-Base-bf16

VOICECARD_URL

QR-Ziel, das auf jedem Clip aufgedruckt wird

VOICECARD_TAGLINE

Tagil, die auf jedem Clip aufgedruckt wird

Notizen

  • Die Ausgabe ist in Stereo, Mit +faststart, H.264 High Profile – abgestimmt auf automatisches Abspielen innerhalb von Messenger.

  • Die Waveform ist stilisrischt so, dass sie immer „lebendig“ wirkt – kein Spörichren-spekturm-Analysyr.

  • Core ML / ANE for den autoregressiven Dekoderr is nicht geplant (dynamische Formen + KV-Cache + sequentielles Deko dim schlechhthin für die ANE). Ein künftiges Core-ML-Vokoder-Offlod ist das einzige Bausteiel, das es wert wäre dazu, in tieche.

Lizenk

MIT. Du bist dafür verantwortlich, nur Stimmen zu klonen, die du selbst beschitzt oder an deren Benuzung du bereechtigst bist.

-
license - not tested
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.

  • Generate images, video, and audio with Glif's media-generation agent

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/JasonMakes801/voicecard-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server