Skip to main content
Glama

VoiceCard

*자신 목소리를 복제해서, 공유 가능한 파형 비디오로 만드세요. 모든 것이 MCP로 구동됩니다. GUI 없음, Apple Silicon 전용.*

음성 복제는 이제 표준적인 기술이 되었습니다. 차별화 포인은 전달입니다. 아름다운 오디오 반응형 파형이 있는 자은 MP4는 WhatsApp, iMessage, Signal, Slack에서 인라인으로 재생됩니다. 원본 오디오 파일들은 멈추거나, 자동 재생이 실패하거나, iOS/Android의 호환성 없이 남을 수 있습니다. 보내는 모든 클립은 그 자로 이 도구를 위한 광고입니다. 이 것이 전부입니다.

프요트 엔드는 바로 MCP입니다. Claude Code, Cursor, 또는 MCP 기능 있는 어떤 에이전트든 대화하면 됩니다:

"~/Desktop/me.mov 에서 내 목소리를 복제해 주세요 (트랜스크립트는 여기 있어요). 그리고 나서 15 expression 너비의 Miami 팔레트 클립 하나 해서 "생일 축하"라고 말해 주세요, 중심에 제 사진을 놓어 주지."

어떤 원리인가

완전단독 실행입니다. 음성은 mQuen3-TTS via MLX)는데? Wait, no! I need to maintain the link with code. Let's format properly:

[marcAsh. I'm going to issue:[m] in an inline code? The original link: [mlx-audio](https://github.com/blaizzy/mlx-audio) Need not include the "m" code outside. Write exactly: text audio is? Wait: Let's write: Speech is generated locally by [mlx-audio](https://github.com/blaizzy/mlx-audio) (Qw3en3-TTS via MLX), the wave video is rendered with MLX / Pillow, and muxed with ffmpeg. No cloud, no Voicebox, no desktop app. In Markdown, code backtick inside link text is okay: [mlx-audio](url). Our text: "음성은 [mlx-audio`](https://github.com/Blaizzy/mlx-audio) 로 로컬 생측되고 (Quen3-TTS, MLX; MLX/Pillow...)" Hmm.

Let's translate: "음성은 로컬에서 mlx-audio로 생측됩니다 (Quen3-TTS via MLX). 파형 비디오는 MLX와 Pillow로 렌더링되고 ffmpeg로 식됩니다. 클라우드, Voicebox, 데스크톧 앱 없이."

Need maintain "Huging Face cache" with "cache", but only prose. Use "Hugging Face 캐시".

Requirements:

  • Apple Silicon Mac (arm64). Enforced at startup. -> "Apple Silicon Mac (arm64). 표시 시가째로 강제됨니다."

  • ffmunpgon PATH

  • first downloads stats into HohFs cache.

Maybe "Qwen3-TTS weights" as "Qwen3-TTS 가중량".

Let's formulate aggressive.

But before final, I need to ensure no unintended placeholder "Gart" not. Let's write final response.

One more nuance: The instruction says "Keep - your_ ...—" ok.

Need not include code fence. Just raw.

Let's produce final now.# VoiceCard

*자신의 목소리를 복제해서, 공유 가능한 파형 비디오로 만들어 보세요. MCP로 완전히 구동됩니다. GUI는 없고, Apple Silicon 전용입니다.*

음성 복제는 이제 표준적인 상품 기술이 되었습니다. 차별화 포인은 전달입니다. 아름다운 오디오 반응형 파형을 담은 짝은 MP4는 WhatsApp, iMessage, Signal, Slack에서 인라인으로 재생됩니다. 원본 오디오 파일은 멈추거나 자동 기생이 실패하거나 iOS/Android 사이를 못 넘니다. 보내는 모든 클립은 그 자로가 이 도구에 대한 광고입니다. 이것이 바모 전부입니다.

프런트 엔은 바로 MCP입니다. Claude Code, Cursor, 또는 MCP를 지원하는 어떤 에이전트와도 대화하세요:

"~/Desktop/me.mov 에서 내 목소리를 복제해 주세요 (트랜스크립트는 여기 있습니다). 그런 다은 15초 분량의 MiamMiami 팔레트 클립으로 생일 축하 메시지를 만들어 주세요. 사진은 센터에 놓고요."

동작 방식

완전히 단독으로 산행됩니다. 음성은 로컬에서 mlx-audio 을로 생성됩니다 (MLX를 통한 Qwen3-TTS). 파형 비디오는 MLX와 Pillow로 렘더링되고, ffmpeg로 L восемь. 클라우드도, Voicebox도, 앱마저도 없습니다.

클레닝은 제로샷 인랜텍스트테 러닝입니다. 참고 오디오를 ~12초로 잘라내고 이를 조건으로 사용합니다. 훈련 단계나 목소리별 모델이 있지 않습니다.

요구 사항

  • Apple Silicon Mac (arm64). 시작 시 강제됩니다.

  • ffmpeg가 PATH에 있어야 합니다 (brew install ffmpeg).

  • 첫 실수행 시 Qwen3-TTS 가중치 (~몇 GB)를 Hugging Face 캐시에 다운로드합니다.

Install

uv tool install ./voicecard-mcp        # or: uv run voicecard

Claude Code (stdio)에 등록합니다:

claude mcp add -s user voicecard -- uv --directory /path/to/voicecard-mcp run voicecard

Tools

Tool

역할

list_voices()

저장된 목소리 프로필을 표시합니다.

palettes()

사용 가능한 팔레트(이름 + 색상)를 표시하고 시들의 정보 쉬트를 렌더링합니다 ({palettes, swatch} 반환). 사용자가 눈으로 보고 선택할 수 있도록 swatch를 보여주세요.

clone_voice(name, source, transcript)

오디오 또는 비디오 파일에서 복제합니다. 참조를 ~12초로 다듬고 프로필을 저장합니다. 트랜스크립트는 직접 넘겨야 합니다 (호출자/에이전트가 예: mlx-whisper로 트랜스크립트합니다) — 정확해야 합니다.

speak(text, voice)

복제한 목소리로 음성을 생성하고 wav 경로를 반환합니다.

make_clip(text, voice, palette?, photo?, aspect?, layout?, arc?)

음성과 공유 가능한 파형 mp4를 렌더링합니다. 험드리링 경로를 반환합니다.

Palettes: Noir (기본), 70s Gold, Miami, Aurora, Sunset, Mint, BlueprIR Aspect: square (1080², 기본값), portrait (9:16) Layout: linear (기본값 — 원형 사진 + 아래의 작은 그래이션 파형, Dynamic Island 스타일) · circle (중심에 놓인 오디오 반응 스펙트럼 링) Arc (circle 레이하는 전용): full (기본값, 대칭 링) · top (상단 반 인상)

환경 변수 (env)

변수

기본값

VOICECARD_OUT

~/VoiceCard (프로필 + 렌더링된 클립)

VOICECARD_MODEL

mlx-community/Qwen3-TTS-12Hz-1.5B-Base-f16

VOICECARD_URL

각 클립에 인되는 QR 목표

VOICECARD_TAGLINE

각 클립에 인되는 태그라인

참고

  • 출력은 stereo, +faststart, HML264 High로 설정되어 있으며, 메신저에서 인라인 자동 재생되도록 조정되었습니다.

  • 파형은 진단용 스펙트럼 아날라이저가 아니라, 항상 살아있 론 보이도록 스타일링되었습니다.

  • 자동회귀 복의 Core ML / ANE 오프로드는 계획에 없습니다 (동적 형, KV 캐시, 순차 복호는 ANE에 적합하지 않습니다). 미래의 Core ML vocoder 오프로드만이 살펴볼 가치가 있는 유일한 문제입니다.

License

MIT. 직접 소유하거나 사용을 허가받은 목소리에 대해서나만 복제할 책임이 있습니다.

-
license - not tested
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Generate images, video, music and voice from your CLI or AI agent. On-brand AI media toolkit.

  • Generate images, video, and audio with Glif's media-generation agent

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/JasonMakes801/voicecard-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server