vocotype
VocoType — точный офлайн-инструмент для голосового ввода
VocoType — это полностью бесплатный настольный инструмент для голосового ввода, созданный для профессионалов, которые ценят конфиденциальность и эффективность. Все распознавание выполняется локально: не бойтесь отсутствия интернета, данные никуда не передаются.
Этот проект на GitHub является CLI (командной строкой) версией с открытым исходным кодом ядра VocoType и предназначен в первую очередь для разработчиков.
➡️ Хотите получить лучший опыт? Скачайте бесплатную настольную версию прямо сейчас!
Готовое решение, более полный функционал, не требует технических навыков.
Посетите официальный сайт, чтобы скачать бесплатную полную версию VocoType для рабочего стола
Краткий обзор функций
VocoType — это интеллектуальный инструмент для голосового ввода, который позволяет преобразовывать речь в текст в реальном времени и автоматически вставлять его в текущее приложение с помощью горячих клавиш. Поддерживает MCP для преобразования речи в текст, AI-оптимизацию текста, пользовательские словари замен и другие функции, делая голосовой ввод более эффективным и точным.
📹 Демонстрационное видео
Related MCP server: vibevoice-asr
Скачивание
ОС | Скачать |
Windows | |
macOS |
|
🤔 Почему VocoType уникален?
Характеристика | ✅ VocoType | Традиционные облачные методы | Встроенные в ОС |
Конфиденциальность | Локально, офлайн, без передачи данных | ❌ Данные отправляются в облако | ⚠️ Сложная политика конфиденциальности |
Зависимость от сети | Полностью офлайн | ❌ Требуется интернет | ❌ Сильная зависимость от сети |
Скорость отклика | 0.1 секунды | Медленно, зависит от сети | Медленно, зависит от сети |
Возможности настройки | Мощные пользовательские словари | Слабые или отсутствуют | Практически отсутствуют |
✅ Основные функции
Полноценный графический интерфейс: готов к работе сразу после установки, все операции понятны и интуитивны.
Системный глобальный ввод: голосовой ввод работает в любом приложении и любом текстовом поле.
Пользовательский словарь: поддержка добавления до 20 часто используемых терминов и имен для повышения точности распознавания.
100% офлайн-работа: абсолютная конфиденциальность и безопасность данных.
Флагманский движок распознавания: точное распознавание смешанной китайско-английской речи.
AI-оптимизация: поддержка выбора различных AI-моделей, которые с помощью настраиваемых шаблонов промптов автоматически исправляют опечатки, омофоны и ошибки в транскрипции, а также распознают команды самокоррекции в разговорной речи (например, "неправильно", "измени на"), делая текст более точным и плавным.
(Для профессиональных пользователей с более высокими требованиями в приложении предусмотрена возможность перехода на версию Pro для разблокировки неограниченного словаря и других расширенных функций.)
🎯 Подходит для различных профессиональных сценариев
Будь вы писатель, юрист, ученый, геймер или офисный работник, VocoType станет вашим надежным помощником в повышении эффективности.
Пользователь | Сценарий |
Писатели и авторы | Написание статей, романов, протоколов совещаний. Превращайте мысли в текст мгновенно, не отвлекаясь от творчества. |
Юристы и медики | Работа с конфиденциальной информацией клиентов или медицинскими картами с гарантией 100% офлайн-безопасности. Пользовательские словари помогут легко справляться с отраслевой терминологией. |
Студенты и ученые | Быстрая запись лекций, расшифровка интервью, написание научных работ. Забудьте о утомительном наборе текста и сосредоточьтесь на исследованиях. |
Разработчики и программисты | Будь то парное программирование с AI или написание технической документации, VocoType точно распознает термины вроде |
Геймеры | Быстрое общение с командой в пылу сражения без необходимости отвлекаться от управления, сохраняя темп игры и повышая эффективность командной работы. |
✨ Характеристики ядра VocoType
Все версии VocoType используют одно и то же мощное ядро.
🛡️ 100% офлайн, конфиденциальность гарантирована: все распознавание речи происходит локально на вашем компьютере.
⚡️ Флагманский движок распознавания: точный ввод смешанной китайско-английской речи без необходимости постоянных правок.
⚙️ Высокая степень настройки: уникальная функция словаря замен позволяет с первого раза правильно распознавать имена, географические названия и отраслевые термины.
💻 Легкий дизайн: потребляет всего 700 МБ оперативной памяти, работает на CPU, не требует дорогостоящей видеокарты.
🚀 Отклик 0.1 секунды: почувствуйте скорость «сказал — получил», чтобы ваши идеи не прерывались из-за ожидания.
🛠️ Руководство по установке CLI-версии (для разработчиков)
Внимание: эта версия предназначена для разработчиков с техническим бэкграундом. Если вы не знакомы с командной строкой, мы настоятельно рекомендуем посетить официальный сайт и скачать простую в использовании бесплатную настольную версию VocoType.
1. Системные требования
Python 3.12
Мы настоятельно рекомендуем использовать
uvилиvenvдля создания виртуального окружения.
2. Клонирование и установка
# 1. 克隆仓库
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli
# 2. (推荐) 创建并激活虚拟环境
pip install uv
uv venv --python 3.12
source .venv/bin/activate # macOS/Linux
# 或者 .\.venv\Scripts\activate (Windows)
# 3. 安装依赖
uv pip install -r requirements.txt
# 4. 运行
python main.py
# 保存数据集运行
python main.py --save-datasetЗагрузка модели: при первом запуске программа автоматически загрузит файлы модели объемом около 500 МБ, пожалуйста, убедитесь в стабильности интернет-соединения.
🌐 Бэкенд потокового распознавания Volcengine BigASR (опционально)
Помимо стандартного локального движка FunASR, VocoType CLI поддерживает подключение потокового распознавания речи Volcengine Doubao в качестве облачного бэкенда.
Преимущества
Характеристика | Локальный FunASR | Volcengine BigASR |
Требования к сети | Нет | Требуется интернет |
Загрузка модели | ~500 МБ | Не требуется |
Задержка отклика | Локальная обработка | Очень низкая (облако) |
Качество распознавания | Высокое | Флагманская модель |
Конфиденциальность данных | Полностью офлайн | Аудио отправляется в Volcengine |
Шаги настройки
Войдите в консоль Volcengine, создайте голосовое приложение и получите App Key и Access Key.
Создайте файл
config.jsonв директории проекта:
{
"backend": "volcengine",
"volcengine": {
"app_key": "YOUR_APP_KEY",
"access_key": "YOUR_ACCESS_KEY",
"resource_id": "volc.bigasr.sauc.duration",
"enable_punc": true,
"enable_itn": true
}
}Запустите с параметром
--config:
python main.py --config config.jsonПримечание: при использовании бэкенда Volcengine данные записи отправляются на серверы Volcengine для распознавания и перестают быть полностью офлайновыми. Если у вас строгие требования к конфиденциальности, продолжайте использовать стандартный локальный бэкенд FunASR.
Часто задаваемые вопросы (FAQ)
Q: Безопасны ли мои данные?
A: На 100% безопасны. Все распознавание речи выполняется локально в офлайн-режиме, ваши аудиоданные не загружаются ни на какие серверы.
📞 Свяжитесь с нами
Баги и предложения: пожалуйста, используйте GitHub Issues.
Следите за обновлениями: https://vocotype.com
🙏 Благодарности
Создание VocoType было бы невозможно без следующих замечательных проектов с открытым исходным кодом:
FunASR — фреймворк для распознавания речи от Alibaba DAMO Academy, предоставивший VocoType мощные возможности офлайн-распознавания.
QuQu — отличный проект с открытым исходным кодом, ставший важным техническим ориентиром и источником вдохновения для VocoType.
Спасибо сообществу open-source за их бескорыстный вклад!
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.
- AlicenseAqualityDmaintenanceLocal speech-to-text transcription using Microsoft's VibeVoice-ASR model with speaker diarization, enabling audio transcription directly in AI tools like Claude Code, Cursor, and OpenCode.32MIT
- AlicenseAqualityCmaintenanceCaptures and transcribes system audio in real-time using OpenAI Whisper, enabling meeting transcription, content creation, and accessibility through natural language.8203MIT
- AlicenseNot gradedqualityBmaintenance从抖音/B站视频链接下载音频并自动提取语音文案,支持MCP集成,可配合Claude Desktop等AI应用使用。Apache 2.0
Related MCP Connectors
Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.
MCP-native collaborative markdown editor with real-time AI document editing
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Appeared in Searches
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/233stone/vocotype-cli'
If you have feedback or need assistance with the MCP directory API, please join our Discord server