Skip to main content
Glama

VoiceCard

Клонируйте свой голос и превращайте его в доступный для публикации waveform video — всё управляется через MCP. Без GUI. Только Apple Silicon.

Клонирование голоса уже стало примелькавшимся товаром. Решает доставка: короткий MP4 с красивой волновой формол, реагирующей на звуk, проигрывается можностями прями (вчаsten) — в WhatsApp, iMessage, Signal и Slack — там, где оgitомальные аудиофайлы залипают, не autoplaygest, не переходят между iOS/Androiд. Каждый отistic клип — этокак реклама для инструмента. В этом и сосhidden идея.

Интерфейс — это и есть MCP. Вы общаетесь с ним из Claude Code, Cursor или любого MCP-aware агента:

«Клонируй мой голос из ~/Desktop/meeting.mov (вот транскрипт), затем сделай 15 NS-го коро ко ро в палитре Miamй со слова A4 “с днём рождения” и моим фоotо в цецентре.»

Как это работает

Полностью автономно. Речь генерируется локально с помощью mlx-audio (gen3-TTS via MLX), волновая форма отрисовывается через MLX / Pillow, а микширование выполняется через ffmpeg. Без облака, без Voicebox, без приложчения.

Клонирование — это zero-shot in-context learning: референс триммится до ~12 секунд, а модель конsmys использует его. Тренировочный этап отсутствует, отдельной модели на каждый голос тоже нет.

Требования

  • Mac на Apple Silicon (arm64). Проверяется при запуске.

  • ffmpeg в PATH (brew install ffmpeg).

  • При первом запуске скачиваются веса Qwen3-TTS (~несколько GB) в кэш Hugging Face.

Установка

uv tool install ./voicecard-mcp        # or: uv run voicecard

Зарегистрируйте сервер в Claude Code (stdio):

claude mcp add -s user voicecard -- uv --directory /path/to/voicecard-mcp run voicecard

Инструменты

Инструмент

Что делает

list_voices()

Возвращает список сохранённых голосовых профилей.

palettes()

Список доступных палитр (название и цвета) и показывает визуальный лист образцов (возвращает {palettes, swatch}); покажите его пользователю, чтобы он выбирал глазами.

clone_voice(name, source, transcript)

Клонирует голос из аудио или видеофайла. Обрезает референс до ~12 секунд и сохраняет профи. Транскрипт передаёте вы — вызывающая сторона/агент транскрибирует референс (например, mlx-whisper) — он должен быть точным.

speak(text, voice)

Синтезирует речь клонированным голосом; возвращает путь к wav.

make_clip(text, voice, palette?, photo?, label?, aspect?, layout?, arc?)

Синтезирует речь и рендерит shareable waveform-видео MP4. Возвращает путь к MP4.

Палитры: Noir (по умолчанию), 70s Gold, Miami, Aurora, Sunset, Mint, Blueprint Формат: square (1080², по умолчанию), portrait (9:16) Компоновка: linear (по умолчанию — круглое фото + компактный градиентный waveform, в стиле Dynamic-Island) · circle (кольцо по центру, реагирующее на звук) Дуга (только для circle): full (по умолчанию, зеркальное кольцо) · top (вспышки над верхней половиной)

Конфигурация (env)

Переменная

По умолчанию

VOICECARD_OUT

~/VoiceCard — профили и готовые ролики

VOICECARD_MODEL

mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16

VOICECARD_URL

QR-цель, печатается на каждом ролике

VOICECARD_TAGLINE

слоган, печатается на каждом ролике

Примечания

  • Выход — стерео, +faststart, профиль H.264 High — настроено на авто-проигрывание в мессенджерах.

  • Визуализация стилизована так, чтобы всегда выглядеть живой, а не диагностическим спектроанализатором.

  • Ответственное использование Core ML / ANE для автомаксгрессивного декодера не планируется (динамические формы, KV-кэш и последовательность декодирования плохо ложатся на ANE). Единственное, что стоит изучать в будущем, — офлоад вокодера на Core ML.

Лицензия

MIT. Ответственность за клонирование голосов лежит на вас: вы можете клонировать только те голоса, которыми владеете или на которые у вас есть разрешение.

-
license - not tested
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.

  • Generate images, video, and audio with Glif's media-generation agent

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/JasonMakes801/voicecard-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server