vocotype
VocoType - Präzise Offline-Spracheingabe
VocoType ist eine vollständig kostenlose Desktop-Spracheingabemethode, die speziell für Profis entwickelt wurde, die Wert auf Datenschutz und Effizienz legen. Die gesamte Erkennung erfolgt lokal – ohne Internetverbindung und ohne Datenübertragung.
Dieses GitHub-Projekt ist die CLI-Open-Source-Version (Kommandozeile) der VocoType-Kern-Engine und richtet sich primär an Entwickler.
➡️ Möchten Sie das beste Erlebnis? Laden Sie jetzt die kostenlose Desktop-Version herunter!
Sofort einsatzbereit, mit vollem Funktionsumfang und ohne technisches Vorwissen.
Funktionsübersicht
VocoType ist ein intelligentes Tool zur Spracheingabe, das Sprache in Echtzeit per Tastenkombination in Text umwandelt und automatisch in die aktuelle Anwendung einfügt. Es unterstützt Funktionen wie MCP-Sprache-zu-Text, KI-Textoptimierung und benutzerdefinierte Ersetzungswörterbücher, um die Spracheingabe effizienter und präziser zu machen.
📹 Demo-Video
Related MCP server: vibevoice-asr
Download
OS | Download |
Windows | |
macOS |
|
🤔 Was macht VocoType so besonders?
Eigenschaft | ✅ VocoType | Herkömmliche Cloud-Eingabemethoden | Betriebssystem-Standard |
Datenschutz | Lokal & offline, keine Übertragung | ❌ Daten werden in die Cloud geladen | ⚠️ Komplexe Datenschutzrichtlinien |
Netzwerkabhängigkeit | Keine Internetverbindung nötig | ❌ Internet zwingend erforderlich | ❌ Starke Netzwerkabhängigkeit |
Reaktionszeit | 0,1 Sekunden | Langsam, abhängig von der Internetgeschwindigkeit | Langsam, abhängig von der Internetgeschwindigkeit |
Anpassbarkeit | Leistungsstarke benutzerdefinierte Wortlisten | Schwach oder nicht vorhanden | Kaum vorhanden |
✅ Kernfunktionen
Vollständige grafische Benutzeroberfläche: Sofort einsatzbereit, alle Vorgänge sind klar und intuitiv.
Systemweite Eingabe: Direkte Spracheingabe in jeder Software und jedem Textfeld.
Benutzerdefiniertes Wörterbuch: Unterstützung für bis zu 20 häufig verwendete Begriffe und Namen zur Verbesserung der Erkennungsgenauigkeit.
100% Offline-Betrieb: Absolute Privatsphäre und Datensicherheit.
Flaggschiff-Erkennungs-Engine: Präzise Erkennung von gemischten chinesischen und englischen Inhalten.
KI-Intelligente Optimierung: Unterstützung für verschiedene KI-Modelle. Durch anpassbare Prompt-Vorlagen werden Tippfehler, Homophone und Selbstkorrekturen in der Transkription automatisch behoben. Intelligente Erkennung von Korrekturbefehlen in der Umgangssprache (z. B. "nein", "ändere zu"), um den Ausgabetext präziser und flüssiger zu gestalten.
(Für professionelle Anwender mit höheren Anforderungen bietet die App eine Option zum Upgrade auf die Pro-Version, um Funktionen wie unbegrenzte Wörterbücher freizuschalten.)
🎯 Geeignet für verschiedene professionelle Szenarien
Ob für Texter, Anwälte, Wissenschaftler, Gamer oder den Büroalltag – VocoType ist Ihr zuverlässiger Effizienzpartner.
Benutzer | Szenario |
Autoren & Kreative | Schreiben von Artikeln, Romanen oder Protokollen. Gedanken werden sofort per Sprache in Text umgewandelt, sodass Sie sich voll auf die Kreativität konzentrieren können. |
Rechts- & Medizinberufe | Verarbeitung hochsensibler Kundendaten oder Krankenakten mit 100% Offline-Sicherheit. Benutzerdefinierte Wortlisten erleichtern die Handhabung von Fachbegriffen. |
Studenten & Wissenschaftler | Schnelles Erfassen von Vorlesungsnotizen, Transkribieren von Interviews oder Verfassen wissenschaftlicher Arbeiten. Schluss mit mühsamem Tippen, mehr Fokus auf Denken und Forschung. |
Entwickler & Programmierer | Ob beim Pair-Programming mit KI oder beim Schreiben technischer Dokumentationen – Fachbegriffe wie |
Gamer | Schnelle Kommunikation mit Teamkollegen per Sprache während intensiver Spielgefechte, ohne die Steuerung zu unterbrechen – für bessere Teamarbeit. |
✨ Merkmale der VocoType-Kern-Engine
Alle VocoType-Versionen teilen sich dieselbe leistungsstarke Kern-Engine.
🛡️ 100% Offline, keine Sorgen um den Datenschutz: Die gesamte Spracherkennung erfolgt lokal auf Ihrem Computer.
⚡️ Flaggschiff-Erkennungs-Engine: Präzise Erkennung auch bei gemischten chinesischen und englischen Inhalten.
⚙️ Hochgradig anpassbar: Einzigartige Ersetzungswortlisten sorgen dafür, dass Namen, Orte und Fachbegriffe sofort korrekt erkannt werden.
💻 Leichtgewichtiges Design: Benötigt nur 700 MB Arbeitsspeicher, reine CPU-Inferenz, keine teure Grafikkarte erforderlich.
🚀 0,1 Sekunden Reaktionszeit: Erleben Sie die Schnelligkeit von "Gesprochenem als Text", damit Ihre Inspiration nicht durch Wartezeiten unterbrochen wird.
🛠️ Installationsanleitung für die CLI-Version (für Entwickler)
Hinweis: Diese Version richtet sich an Entwickler mit technischem Hintergrund. Wenn Sie nicht mit der Kommandozeile vertraut sind, empfehlen wir Ihnen dringend, die offizielle Website zu besuchen und die benutzerfreundliche kostenlose VocoType-Desktop-Version herunterzuladen.
1. Systemvoraussetzungen
Python 3.12
Wir empfehlen dringend die Verwendung von
uvodervenvzur Erstellung einer virtuellen Umgebung.
2. Klonen und Installation
# 1. 克隆仓库
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli
# 2. (推荐) 创建并激活虚拟环境
pip install uv
uv venv --python 3.12
source .venv/bin/activate # macOS/Linux
# 或者 .\.venv\Scripts\activate (Windows)
# 3. 安装依赖
uv pip install -r requirements.txt
# 4. 运行
python main.py
# 保存数据集运行
python main.py --save-datasetModell-Download: Beim ersten Start lädt das Programm automatisch etwa 500 MB an Modelldateien herunter. Bitte stellen Sie sicher, dass eine stabile Internetverbindung besteht.
🌐 Volcengine BigASR Streaming-Erkennungs-Backend (optional)
Zusätzlich zur standardmäßigen lokalen FunASR-Offline-Engine unterstützt VocoType CLI die Anbindung der Volcengine Doubao Large Model Streaming-Spracherkennung als Cloud-Backend.
Vorteile
Eigenschaft | Lokales FunASR | Volcengine BigASR |
Netzwerkanforderung | Keine | Internet erforderlich |
Modell-Download | ~500 MB | Kein Download nötig |
Reaktionsverzögerung | Lokale Inferenz | Extrem niedrige Latenz in der Cloud |
Erkennungsqualität | Hoch | Flaggschiff-Großmodell |
Datenschutz | Vollständig offline | Audio wird an Volcengine gesendet |
Konfigurationsschritte
Melden Sie sich in der Volcengine-Konsole an, erstellen Sie eine Sprach-App und rufen Sie den App Key und Access Key ab.
Erstellen Sie eine
config.jsonim Projektverzeichnis:
{
"backend": "volcengine",
"volcengine": {
"app_key": "YOUR_APP_KEY",
"access_key": "YOUR_ACCESS_KEY",
"resource_id": "volc.bigasr.sauc.duration",
"enable_punc": true,
"enable_itn": true
}
}Starten Sie mit dem Parameter
--config:
python main.py --config config.jsonHinweis: Bei Verwendung des Volcengine-Backends werden Audiodaten zur Erkennung an die Volcengine-Server gesendet und sind nicht mehr vollständig offline. Wenn Sie strenge Datenschutzanforderungen haben, verwenden Sie bitte weiterhin das standardmäßige lokale FunASR-Backend.
Häufig gestellte Fragen (FAQ)
F: Sind meine Daten sicher?
A: 100% sicher. Alle Spracherkennungen erfolgen lokal offline. Ihre Audiodaten werden nicht auf Server hochgeladen.
📞 Kontaktieren Sie uns
Fehler und Vorschläge: Bitte nutzen Sie vorzugsweise GitHub Issues.
Folgen Sie uns für aktuelle Updates: https://vocotype.com
🙏 Danksagungen
VocoType wäre ohne die folgenden hervorragenden Open-Source-Projekte nicht möglich gewesen:
FunASR – Ein von der Alibaba DAMO Academy quelloffenes Spracherkennungs-Framework, das VocoType leistungsstarke Offline-Spracherkennungsfähigkeiten verleiht.
QuQu – Ein exzellentes Open-Source-Projekt, das wichtige technische Referenzen und Inspiration für VocoType lieferte.
Wir danken diesen Open-Source-Communities für ihre selbstlosen Beiträge!
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.
- AlicenseAqualityDmaintenanceLocal speech-to-text transcription using Microsoft's VibeVoice-ASR model with speaker diarization, enabling audio transcription directly in AI tools like Claude Code, Cursor, and OpenCode.32MIT
- AlicenseAqualityCmaintenanceCaptures and transcribes system audio in real-time using OpenAI Whisper, enabling meeting transcription, content creation, and accessibility through natural language.8203MIT
- AlicenseNot gradedqualityBmaintenance从抖音/B站视频链接下载音频并自动提取语音文案,支持MCP集成,可配合Claude Desktop等AI应用使用。Apache 2.0
Related MCP Connectors
Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.
MCP-native collaborative markdown editor with real-time AI document editing
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Appeared in Searches
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/233stone/vocotype-cli'
If you have feedback or need assistance with the MCP directory API, please join our Discord server