Skip to main content
Glama

VocoType - Método de entrada de voz offline preciso

VocoType es un método de entrada de voz de escritorio totalmente gratuito, diseñado para profesionales que valoran la privacidad y la eficiencia. Todo el reconocimiento se realiza localmente, sin miedo a desconexiones y sin subir ningún dato.

Este proyecto de GitHub es la versión CLI (línea de comandos) de código abierto del motor central de VocoType, orientado principalmente a desarrolladores.


➡️ ¿Quieres obtener la mejor experiencia? ¡Descarga la versión de escritorio gratuita ahora!

Listo para usar, con funciones más completas y sin necesidad de conocimientos técnicos.

Visita el sitio web oficial ahora para descargar la versión de escritorio gratuita y completa de VocoType

Introducción a las funciones

VocoType es una herramienta inteligente de entrada de voz que permite convertir voz a texto en tiempo real mediante atajos de teclado e ingresarlo automáticamente en la aplicación actual. Admite funciones como MCP de voz a texto, optimización de texto mediante IA y diccionarios de reemplazo personalizados, haciendo que la entrada de voz sea más eficiente y precisa.

📹 Video de demostración

Related MCP server: vibevoice-asr

Descarga

SO

Descarga

Windows

Setup

macOS

DMG DMG


🤔 ¿Por qué VocoType es diferente?

Característica

VocoType

Método de entrada en la nube tradicional

Integrado en el SO

Privacidad y seguridad

Local y offline, nunca sube datos

❌ Los datos deben subirse a la nube

⚠️ Política de privacidad compleja

Dependencia de red

Sin necesidad de conexión

❌ Requiere conexión

❌ Dependencia fuerte de la red

Velocidad de respuesta

Nivel de 0.1 segundos

Lento, afectado por la velocidad de red

Lento, afectado por la velocidad de red

Capacidad de personalización

Potente diccionario personalizado

Débil o inexistente

Básicamente inexistente

✅ Funciones principales

  • Interfaz gráfica de usuario completa: Listo para usar, todas las operaciones son claras e intuitivas.

  • Entrada global a nivel de sistema: Entrada de voz directa en cualquier software o cuadro de texto.

  • Diccionario personalizado: Admite la adición de 20 términos comunes y nombres propios para mejorar la precisión del reconocimiento.

  • Funcionamiento 100% offline: Privacidad y seguridad de datos absoluta.

  • Motor de reconocimiento de nivel insignia: Reconocimiento preciso de contenido mixto en chino e inglés.

  • Optimización inteligente mediante IA: Admite la selección de múltiples modelos de IA para corregir automáticamente errores tipográficos, homófonos y autocorrecciones en la transcripción de voz mediante plantillas de Prompt personalizables. Identifica inteligentemente instrucciones de corrección en el lenguaje hablado (como "no", "cambiar a", etc.), haciendo que el texto de salida sea más preciso y fluido.

(Para usuarios profesionales con mayores necesidades, la aplicación ofrece una opción para actualizar a la versión Pro y desbloquear funciones avanzadas como diccionarios ilimitados.)

🎯 Adecuado para diversos escenarios profesionales

Ya sea para escritores, abogados, académicos, jugadores o trabajo diario de oficina, VocoType puede ser su socio de eficiencia de confianza.

Usuario

Escenario

Escritores y creadores

Escribir artículos, novelas, organizar actas de reuniones, permitiendo que los pensamientos se conviertan instantáneamente en texto a través de la voz, sin distracciones, centrándose en la creación misma.

Profesionales legales y médicos

Al manejar información altamente sensible de clientes o registros médicos, el 100% offline garantiza la seguridad de los datos. El diccionario personalizado facilita el manejo de terminología industrial.

Estudiantes y académicos

Registrar rápidamente notas de clase, organizar grabaciones de entrevistas, escribir tesis académicas. Adiós a la tediosa escritura, dedicando más energía al pensamiento y la investigación.

Desarrolladores y programadores

Ya sea programando en pareja con IA o escribiendo documentación técnica, puede reconocer con precisión términos técnicos como function o Kubernetes pod.

Jugadores

En intensas batallas de juego, escribir rápidamente por voz para comunicarse con los compañeros de equipo sin detener la acción, manteniendo el ritmo del juego y mejorando la eficiencia de la colaboración en equipo.

✨ Características del motor central de VocoType

Todas las versiones de VocoType comparten el mismo motor central potente.

  • 🛡️ 100% offline, sin preocupaciones de privacidad: Todo el reconocimiento de voz se realiza localmente en su ordenador.

  • ⚡️ Motor de reconocimiento de nivel insignia: La entrada mixta en chino e inglés es igualmente precisa, adiós a las modificaciones repetidas.

  • ⚙️ Altamente personalizable: Función original de tabla de reemplazo de palabras, para que nombres, lugares y términos técnicos sean correctos a la primera.

  • 💻 Diseño ligero: Solo requiere 700 MB de memoria, inferencia puramente por CPU, sin necesidad de tarjetas gráficas costosas.

  • 🚀 Respuesta de nivel de 0.1 segundos: Sienta la rapidez de lo que dice es lo que obtiene, para que su inspiración no se interrumpa por esperar.


🛠️ Guía de instalación de la versión CLI [Exclusivo para desarrolladores]

Nota: Esta versión está orientada a desarrolladores con ciertos conocimientos técnicos. Si no está familiarizado con la línea de comandos, le recomendamos encarecidamente que visite el sitio web oficial y descargue la versión de escritorio gratuita de VocoType, fácil de usar.

1. Dependencias del entorno

  • Python 3.12

  • Recomendamos encarecidamente usar uv o venv para crear un entorno virtual.

2. Clonación e instalación

# 1. 克隆仓库
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli

# 2. (推荐) 创建并激活虚拟环境
pip install uv
uv venv --python 3.12
source .venv/bin/activate  # macOS/Linux
# 或者 .\.venv\Scripts\activate  (Windows)

# 3. 安装依赖
uv pip install -r requirements.txt

# 4. 运行
python main.py

# 保存数据集运行
python main.py --save-dataset

Descarga del modelo: Al ejecutarse por primera vez, el programa descargará automáticamente archivos de modelo de aproximadamente 500 MB, asegúrese de que la conexión de red sea estable.

🌐 Backend de reconocimiento de flujo Volcengine BigASR (Opcional)

Además del motor offline FunASR predeterminado, VocoType CLI también admite la conexión con el reconocimiento de voz en flujo del modelo grande Doubao de Volcengine como backend de reconocimiento en la nube.

Ventajas

Característica

FunASR local

Volcengine BigASR

Requisitos de red

Ninguno

Requiere conexión

Descarga de modelo

~500 MB

No requiere descarga

Latencia de respuesta

Inferencia local

Latencia extremadamente baja en la nube

Calidad de reconocimiento

Alta

Modelo grande de nivel insignia

Privacidad de datos

Completamente offline

El audio se envía a Volcengine

Pasos de configuración

  1. Inicie sesión en la consola de Volcengine, cree una aplicación de voz y obtenga el App Key y el Access Key.

  2. Cree un archivo config.json en el directorio del proyecto:

{
  "backend": "volcengine",
  "volcengine": {
    "app_key": "YOUR_APP_KEY",
    "access_key": "YOUR_ACCESS_KEY",
    "resource_id": "volc.bigasr.sauc.duration",
    "enable_punc": true,
    "enable_itn": true
  }
}
  1. Inicie con el parámetro --config:

python main.py --config config.json

Nota: Al usar el backend de Volcengine, los datos de grabación se enviarán al servidor de Volcengine para su reconocimiento, por lo que ya no estará completamente offline. Si tiene requisitos estrictos de privacidad, continúe utilizando el backend local FunASR predeterminado.

Preguntas frecuentes (FAQ)

P: ¿Están seguros mis datos?

R: 100% seguros. Todo el reconocimiento de voz se realiza localmente offline, sus datos de audio no se subirán a ningún servidor.

📞 Contáctenos

  • Errores y sugerencias: Utilice preferiblemente GitHub Issues.

  • Síganos para obtener las últimas noticias: https://vocotype.com

🙏 Agradecimientos

El nacimiento de VocoType no habría sido posible sin los siguientes excelentes proyectos de código abierto:

  • FunASR - Marco de reconocimiento de voz de código abierto de Alibaba DAMO Academy, que proporciona a VocoType una potente capacidad de reconocimiento de voz offline.

  • QuQu - Excelente proyecto de código abierto que proporcionó referencias técnicas importantes e inspiración para VocoType.

¡Gracias a estas comunidades de código abierto por sus contribuciones desinteresadas!

F
license - not found
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
2dResponse time
2wRelease cycle
18Releases (12mo)
Commit activity
Issues opened vs closed

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.

  • MCP-native collaborative markdown editor with real-time AI document editing

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/233stone/vocotype-cli'

If you have feedback or need assistance with the MCP directory API, please join our Discord server