vocotype
VocoType - 정밀한 오프라인 음성 입력기
VocoType은 개인정보 보호와 효율성을 중시하는 전문가를 위해 설계된 완전 무료 데스크톱 음성 입력기입니다. 모든 인식 과정은 로컬에서 완료되므로 인터넷 연결이 끊겨도 걱정 없으며, 어떠한 데이터도 업로드되지 않습니다.
이 GitHub 프로젝트는 VocoType 핵심 엔진의 CLI(명령줄) 오픈 소스 버전으로, 주로 개발자를 대상으로 합니다.
➡️ 최고의 경험을 원하시나요? 지금 바로 무료 데스크톱 버전을 다운로드하세요!
설치 즉시 사용 가능하며, 더 완전한 기능을 제공하고 기술적 배경지식이 필요 없습니다.
공식 웹사이트를 방문하여 무료, 완전판 VocoType 데스크톱 버전 다운로드
기능 소개
VocoType은 스마트 음성 입력 도구로, 단축키를 통해 음성을 실시간으로 텍스트로 변환하여 현재 사용 중인 애플리케이션에 자동으로 입력합니다. MCP 음성-텍스트 변환, AI 텍스트 최적화, 사용자 정의 대체 사전 등의 기능을 지원하여 음성 입력을 더욱 효율적이고 정확하게 만들어 줍니다.
📹 데모 영상
Related MCP server: vibevoice-asr
다운로드
OS | Download |
Windows | |
macOS |
|
🤔 VocoType이 특별한 이유
특징 | ✅ VocoType | 기존 클라우드 입력기 | 운영체제 기본 입력기 |
개인정보 보호 | 로컬 오프라인, 절대 업로드 안 함 | ❌ 데이터 클라우드 업로드 필요 | ⚠️ 복잡한 개인정보 정책 |
네트워크 의존성 | 네트워크 연결 불필요 | ❌ 반드시 인터넷 연결 필요 | ❌ 강한 네트워크 의존성 |
응답 속도 | 0.1초 수준 | 느림, 네트워크 속도 영향 | 느림, 네트워크 속도 영향 |
커스터마이징 | 강력한 사용자 정의 단어장 | 약하거나 없음 | 거의 없음 |
✅ 핵심 기능
완전한 그래픽 사용자 인터페이스(GUI): 설치 즉시 사용 가능하며, 모든 작업이 명확하고 직관적입니다.
시스템 전역 입력: 어떤 소프트웨어, 어떤 텍스트 상자에서든 직접 음성 입력이 가능합니다.
사용자 정의 사전: 20개의 자주 사용하는 용어, 인명 등을 추가하여 인식 정확도를 높일 수 있습니다.
100% 오프라인 실행: 절대적인 개인정보 및 데이터 보안.
플래그십급 인식 엔진: 중문과 영문 혼용 콘텐츠를 정밀하게 인식.
AI 스마트 최적화: 다양한 AI 모델 선택을 지원하며, 커스터마이징 가능한 프롬프트 템플릿을 통해 음성 전사 중 발생하는 오타, 동음이의어, 자기 수정 등을 자동으로 교정합니다. 구어체의 수정 명령(예: "아니", "~로 바꿔")을 스마트하게 인식하여 출력 텍스트를 더욱 정확하고 매끄럽게 만듭니다.
(더 높은 요구사항을 가진 전문 사용자를 위해 앱 내에서 Pro 버전으로 업그레이드하여 무제한 사전 등 고급 기능을 잠금 해제할 수 있는 옵션을 제공합니다.)
🎯 다양한 전문 분야에 적합
글쓰기 작업자, 변호사, 학자, 게이머, 일반 사무직 등 VocoType은 당신의 신뢰할 수 있는 효율성 파트너가 될 것입니다.
사용자 | 시나리오 |
작가 및 크리에이터 | 기사, 소설 작성, 회의록 정리 시 생각을 음성으로 즉시 텍스트화하여 창작 자체에 집중할 수 있습니다. |
법률 & 의료 전문가 | 민감한 고객 정보나 진료 기록 처리 시 100% 오프라인으로 데이터 보안을 보장합니다. 사용자 정의 단어장으로 업계 용어를 쉽게 처리합니다. |
학생 및 학자 | 수업 노트, 인터뷰 녹음 정리, 학술 논문 작성 시 번거로운 타이핑에서 벗어나 생각과 연구에 더 많은 에너지를 쏟을 수 있습니다. |
개발자 & 프로그래머 | AI와 페어 프로그래밍을 하거나 기술 문서를 작성할 때 |
게이머 | 치열한 게임 대전 중 음성으로 빠르게 타이핑하여 팀원과 소통하며, 조작을 멈추지 않고 게임 흐름을 유지하여 팀워크 효율을 높입니다. |
✨ VocoType 핵심 엔진 특징
모든 VocoType 버전은 동일한 강력한 핵심 엔진을 공유합니다.
🛡️ 100% 오프라인, 개인정보 걱정 끝: 모든 음성 인식은 컴퓨터 로컬에서 완료됩니다.
⚡️ 플래그십급 인식 엔진: 중영 혼용 입력도 정확하여 반복 수정이 필요 없습니다.
⚙️ 높은 커스터마이징: 독창적인 대체 단어장 기능으로 인명, 지명, 업계 용어를 한 번에 정확하게 인식합니다.
💻 경량화 설계: 700MB 메모리만 필요하며, 순수 CPU 추론으로 고가의 그래픽 카드가 필요 없습니다.
🚀 0.1초 수준 응답: 말하는 즉시 텍스트가 출력되는 쾌적함을 경험하여 기다림으로 인해 영감이 끊기지 않게 합니다.
🛠️ 【개발자 전용】 CLI 버전 설치 가이드
주의: 이 버전은 기술적 배경지식이 있는 개발자를 대상으로 합니다. 명령줄이 익숙하지 않다면 공식 웹사이트를 방문하여 사용하기 쉬운 VocoType 무료 데스크톱 버전을 다운로드하는 것을 강력히 권장합니다.
1. 환경 의존성
Python 3.12
uv또는venv를 사용하여 가상 환경을 생성하는 것을 강력히 권장합니다.
2. 클론 및 설치
# 1. 克隆仓库
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli
# 2. (推荐) 创建并激活虚拟环境
pip install uv
uv venv --python 3.12
source .venv/bin/activate # macOS/Linux
# 或者 .\.venv\Scripts\activate (Windows)
# 3. 安装依赖
uv pip install -r requirements.txt
# 4. 运行
python main.py
# 保存数据集运行
python main.py --save-dataset모델 다운로드: 처음 실행 시 프로그램이 약 500MB의 모델 파일을 자동으로 다운로드하므로 네트워크 연결이 안정적인지 확인하십시오.
🌐 Volcengine 화산엔진 BigASR 스트리밍 인식 백엔드 (선택 사항)
기본 로컬 FunASR 오프라인 엔진 외에도 VocoType CLI는 화산엔진 도우바오 대모델 스트리밍 음성 인식을 클라우드 인식 백엔드로 연결하는 것을 지원합니다.
장점
특징 | 로컬 FunASR | Volcengine BigASR |
네트워크 요구사항 | 없음 | 인터넷 연결 필요 |
모델 다운로드 | ~500 MB | 다운로드 불필요 |
응답 지연 | 로컬 추론 | 클라우드 초저지연 |
인식 품질 | 높음 | 플래그십급 대모델 |
데이터 개인정보 | 완전 오프라인 | 오디오가 화산엔진으로 전송됨 |
설정 단계
화산엔진 콘솔에 로그인하여 음성 애플리케이션을 생성하고 App Key와 Access Key를 획득합니다.
프로젝트 디렉토리에
config.json을 생성합니다:
{
"backend": "volcengine",
"volcengine": {
"app_key": "YOUR_APP_KEY",
"access_key": "YOUR_ACCESS_KEY",
"resource_id": "volc.bigasr.sauc.duration",
"enable_punc": true,
"enable_itn": true
}
}--config매개변수로 시작합니다:
python main.py --config config.json주의: Volcengine 백엔드 사용 시 녹음 데이터가 화산엔진 서버로 전송되어 인식되므로 더 이상 완전 오프라인이 아닙니다. 개인정보 보호 요구사항이 엄격하다면 기본 로컬 FunASR 백엔드를 계속 사용하십시오.
자주 묻는 질문 (FAQ)
Q: 내 데이터는 안전한가요?
A: 100% 안전합니다. 모든 음성 인식은 로컬에서 오프라인으로 완료되며, 귀하의 오디오 데이터는 어떠한 서버로도 업로드되지 않습니다.
📞 문의하기
버그 및 제안: GitHub Issues를 우선적으로 사용해 주십시오.
최신 소식 팔로우: https://vocotype.com
🙏 감사의 말
VocoType의 탄생은 다음과 같은 훌륭한 오픈 소스 프로젝트 덕분입니다:
FunASR - 알리바바 다모 아카데미에서 오픈 소스로 공개한 음성 인식 프레임워크로, VocoType에 강력한 오프라인 음성 인식 기능을 제공했습니다.
QuQu - 훌륭한 오픈 소스 프로젝트로, VocoType에 중요한 기술적 참고와 영감을 제공했습니다.
오픈 소스 커뮤니티의 아낌없는 기여에 감사드립니다!
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.
- AlicenseAqualityDmaintenanceLocal speech-to-text transcription using Microsoft's VibeVoice-ASR model with speaker diarization, enabling audio transcription directly in AI tools like Claude Code, Cursor, and OpenCode.32MIT
- AlicenseAqualityCmaintenanceCaptures and transcribes system audio in real-time using OpenAI Whisper, enabling meeting transcription, content creation, and accessibility through natural language.8203MIT
- AlicenseNot gradedqualityBmaintenance从抖音/B站视频链接下载音频并自动提取语音文案,支持MCP集成,可配合Claude Desktop等AI应用使用。Apache 2.0
Related MCP Connectors
Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.
MCP-native collaborative markdown editor with real-time AI document editing
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Appeared in Searches
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/233stone/vocotype-cli'
If you have feedback or need assistance with the MCP directory API, please join our Discord server