vocotype
VocoType - Método de entrada de voz offline preciso
VocoType es un método de entrada de voz de escritorio totalmente gratuito, diseñado para profesionales que valoran la privacidad y la eficiencia. Todo el reconocimiento se realiza localmente, sin miedo a desconexiones y sin subir ningún dato.
Este proyecto de GitHub es la versión CLI (línea de comandos) de código abierto del motor central de VocoType, orientado principalmente a desarrolladores.
➡️ ¿Quieres obtener la mejor experiencia? ¡Descarga la versión de escritorio gratuita ahora!
Listo para usar, con funciones más completas y sin necesidad de conocimientos técnicos.
Introducción a las funciones
VocoType es una herramienta inteligente de entrada de voz que permite convertir voz a texto en tiempo real mediante atajos de teclado e ingresarlo automáticamente en la aplicación actual. Admite funciones como MCP de voz a texto, optimización de texto mediante IA y diccionarios de reemplazo personalizados, haciendo que la entrada de voz sea más eficiente y precisa.
📹 Video de demostración
Related MCP server: vibevoice-asr
Descarga
SO | Descarga |
Windows | |
macOS |
|
🤔 ¿Por qué VocoType es diferente?
Característica | ✅ VocoType | Método de entrada en la nube tradicional | Integrado en el SO |
Privacidad y seguridad | Local y offline, nunca sube datos | ❌ Los datos deben subirse a la nube | ⚠️ Política de privacidad compleja |
Dependencia de red | Sin necesidad de conexión | ❌ Requiere conexión | ❌ Dependencia fuerte de la red |
Velocidad de respuesta | Nivel de 0.1 segundos | Lento, afectado por la velocidad de red | Lento, afectado por la velocidad de red |
Capacidad de personalización | Potente diccionario personalizado | Débil o inexistente | Básicamente inexistente |
✅ Funciones principales
Interfaz gráfica de usuario completa: Listo para usar, todas las operaciones son claras e intuitivas.
Entrada global a nivel de sistema: Entrada de voz directa en cualquier software o cuadro de texto.
Diccionario personalizado: Admite la adición de 20 términos comunes y nombres propios para mejorar la precisión del reconocimiento.
Funcionamiento 100% offline: Privacidad y seguridad de datos absoluta.
Motor de reconocimiento de nivel insignia: Reconocimiento preciso de contenido mixto en chino e inglés.
Optimización inteligente mediante IA: Admite la selección de múltiples modelos de IA para corregir automáticamente errores tipográficos, homófonos y autocorrecciones en la transcripción de voz mediante plantillas de Prompt personalizables. Identifica inteligentemente instrucciones de corrección en el lenguaje hablado (como "no", "cambiar a", etc.), haciendo que el texto de salida sea más preciso y fluido.
(Para usuarios profesionales con mayores necesidades, la aplicación ofrece una opción para actualizar a la versión Pro y desbloquear funciones avanzadas como diccionarios ilimitados.)
🎯 Adecuado para diversos escenarios profesionales
Ya sea para escritores, abogados, académicos, jugadores o trabajo diario de oficina, VocoType puede ser su socio de eficiencia de confianza.
Usuario | Escenario |
Escritores y creadores | Escribir artículos, novelas, organizar actas de reuniones, permitiendo que los pensamientos se conviertan instantáneamente en texto a través de la voz, sin distracciones, centrándose en la creación misma. |
Profesionales legales y médicos | Al manejar información altamente sensible de clientes o registros médicos, el 100% offline garantiza la seguridad de los datos. El diccionario personalizado facilita el manejo de terminología industrial. |
Estudiantes y académicos | Registrar rápidamente notas de clase, organizar grabaciones de entrevistas, escribir tesis académicas. Adiós a la tediosa escritura, dedicando más energía al pensamiento y la investigación. |
Desarrolladores y programadores | Ya sea programando en pareja con IA o escribiendo documentación técnica, puede reconocer con precisión términos técnicos como |
Jugadores | En intensas batallas de juego, escribir rápidamente por voz para comunicarse con los compañeros de equipo sin detener la acción, manteniendo el ritmo del juego y mejorando la eficiencia de la colaboración en equipo. |
✨ Características del motor central de VocoType
Todas las versiones de VocoType comparten el mismo motor central potente.
🛡️ 100% offline, sin preocupaciones de privacidad: Todo el reconocimiento de voz se realiza localmente en su ordenador.
⚡️ Motor de reconocimiento de nivel insignia: La entrada mixta en chino e inglés es igualmente precisa, adiós a las modificaciones repetidas.
⚙️ Altamente personalizable: Función original de tabla de reemplazo de palabras, para que nombres, lugares y términos técnicos sean correctos a la primera.
💻 Diseño ligero: Solo requiere 700 MB de memoria, inferencia puramente por CPU, sin necesidad de tarjetas gráficas costosas.
🚀 Respuesta de nivel de 0.1 segundos: Sienta la rapidez de lo que dice es lo que obtiene, para que su inspiración no se interrumpa por esperar.
🛠️ Guía de instalación de la versión CLI [Exclusivo para desarrolladores]
Nota: Esta versión está orientada a desarrolladores con ciertos conocimientos técnicos. Si no está familiarizado con la línea de comandos, le recomendamos encarecidamente que visite el sitio web oficial y descargue la versión de escritorio gratuita de VocoType, fácil de usar.
1. Dependencias del entorno
Python 3.12
Recomendamos encarecidamente usar
uvovenvpara crear un entorno virtual.
2. Clonación e instalación
# 1. 克隆仓库
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli
# 2. (推荐) 创建并激活虚拟环境
pip install uv
uv venv --python 3.12
source .venv/bin/activate # macOS/Linux
# 或者 .\.venv\Scripts\activate (Windows)
# 3. 安装依赖
uv pip install -r requirements.txt
# 4. 运行
python main.py
# 保存数据集运行
python main.py --save-datasetDescarga del modelo: Al ejecutarse por primera vez, el programa descargará automáticamente archivos de modelo de aproximadamente 500 MB, asegúrese de que la conexión de red sea estable.
🌐 Backend de reconocimiento de flujo Volcengine BigASR (Opcional)
Además del motor offline FunASR predeterminado, VocoType CLI también admite la conexión con el reconocimiento de voz en flujo del modelo grande Doubao de Volcengine como backend de reconocimiento en la nube.
Ventajas
Característica | FunASR local | Volcengine BigASR |
Requisitos de red | Ninguno | Requiere conexión |
Descarga de modelo | ~500 MB | No requiere descarga |
Latencia de respuesta | Inferencia local | Latencia extremadamente baja en la nube |
Calidad de reconocimiento | Alta | Modelo grande de nivel insignia |
Privacidad de datos | Completamente offline | El audio se envía a Volcengine |
Pasos de configuración
Inicie sesión en la consola de Volcengine, cree una aplicación de voz y obtenga el App Key y el Access Key.
Cree un archivo
config.jsonen el directorio del proyecto:
{
"backend": "volcengine",
"volcengine": {
"app_key": "YOUR_APP_KEY",
"access_key": "YOUR_ACCESS_KEY",
"resource_id": "volc.bigasr.sauc.duration",
"enable_punc": true,
"enable_itn": true
}
}Inicie con el parámetro
--config:
python main.py --config config.jsonNota: Al usar el backend de Volcengine, los datos de grabación se enviarán al servidor de Volcengine para su reconocimiento, por lo que ya no estará completamente offline. Si tiene requisitos estrictos de privacidad, continúe utilizando el backend local FunASR predeterminado.
Preguntas frecuentes (FAQ)
P: ¿Están seguros mis datos?
R: 100% seguros. Todo el reconocimiento de voz se realiza localmente offline, sus datos de audio no se subirán a ningún servidor.
📞 Contáctenos
Errores y sugerencias: Utilice preferiblemente GitHub Issues.
Síganos para obtener las últimas noticias: https://vocotype.com
🙏 Agradecimientos
El nacimiento de VocoType no habría sido posible sin los siguientes excelentes proyectos de código abierto:
FunASR - Marco de reconocimiento de voz de código abierto de Alibaba DAMO Academy, que proporciona a VocoType una potente capacidad de reconocimiento de voz offline.
QuQu - Excelente proyecto de código abierto que proporcionó referencias técnicas importantes e inspiración para VocoType.
¡Gracias a estas comunidades de código abierto por sus contribuciones desinteresadas!
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.
- AlicenseAqualityDmaintenanceLocal speech-to-text transcription using Microsoft's VibeVoice-ASR model with speaker diarization, enabling audio transcription directly in AI tools like Claude Code, Cursor, and OpenCode.32MIT
- AlicenseAqualityCmaintenanceCaptures and transcribes system audio in real-time using OpenAI Whisper, enabling meeting transcription, content creation, and accessibility through natural language.8203MIT
- AlicenseNot gradedqualityBmaintenance从抖音/B站视频链接下载音频并自动提取语音文案,支持MCP集成,可配合Claude Desktop等AI应用使用。Apache 2.0
Related MCP Connectors
Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.
MCP-native collaborative markdown editor with real-time AI document editing
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Appeared in Searches
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/233stone/vocotype-cli'
If you have feedback or need assistance with the MCP directory API, please join our Discord server