vocotype
VocoType - 高精度なオフライン音声入力ソフト
VocoType は、プライバシーと効率を重視するプロフェッショナルのために設計された、完全無料のデスクトップ向け音声入力ソフトです。すべての認識処理はローカルで完結するため、ネット環境を気にせず、データのアップロードも一切行われません。
このGitHubプロジェクトは、VocoTypeコアエンジンの CLI(コマンドライン)オープンソース版であり、主に開発者向けに提供されています。
➡️ 最適な体験をお求めですか?今すぐ無料デスクトップ版をダウンロード!
インストールしてすぐに使え、機能も充実しており、技術的な知識は不要です。
公式サイトにアクセスし、無料の完全版VocoTypeデスクトップ版をダウンロード
機能概要
VocoTypeはインテリジェントな音声入力ツールで、ショートカットキーを使用して音声をリアルタイムでテキストに変換し、現在使用中のアプリケーションに自動入力できます。MCP音声テキスト変換、AIによるテキスト最適化、カスタム置換辞書などの機能をサポートし、音声入力をより効率的かつ正確にします。
📹 デモ動画
Related MCP server: vibevoice-asr
ダウンロード
OS | Download |
Windows | |
macOS |
|
🤔 VocoTypeが選ばれる理由
特徴 | ✅ VocoType | 従来のクラウド入力ソフト | OS標準機能 |
プライバシー | ローカルオフライン、アップロードなし | ❌ クラウドへデータ送信 | ⚠️ プライバシーポリシーが複雑 |
ネット環境 | 完全オフライン対応 | ❌ 常時接続必須 | ❌ ネット依存 |
応答速度 | 0.1秒単位 | 遅い(通信速度に依存) | 遅い(通信速度に依存) |
カスタマイズ | 強力なカスタム辞書 | 弱いまたは不可 | ほぼなし |
✅ 主要機能
完全なGUI:インストール後すぐに使え、操作は直感的で分かりやすいです。
システム全体で入力可能:あらゆるソフトウェアやテキストボックスで直接音声入力が可能です。
カスタム辞書:20個までの常用語や人名を登録でき、認識精度を向上させます。
100%オフライン動作:究極のプライバシーとデータセキュリティを実現。
フラッグシップ級の認識エンジン:中英混合のテキストも正確に認識します。
AIインテリジェント最適化:複数のAIモデルを選択可能。カスタマイズ可能なプロンプトテンプレートを通じて、音声書き起こし時の誤字や同音異義語を自動修正し、口語的な修正指示(「違う」「~に変えて」など)をインテリジェントに認識することで、より正確でスムーズなテキストを出力します。
(より高度なニーズを持つプロユーザー向けに、アプリ内でPro版へのアップグレードオプションを提供しており、辞書登録数の無制限化などの高度な機能が利用可能です。)
🎯 さまざまな専門シーンに対応
ライター、弁護士、研究者、ゲーマー、そして日常のオフィスワークまで、VocoTypeは信頼できる効率化のパートナーとなります。
ユーザー | シーン |
ライター・クリエイター | 記事や小説の執筆、会議議事録の整理。思考を音声で即座にテキスト化し、創作活動に集中できます。 |
法律・医療関係者 | 機密性の高い顧客情報やカルテを扱う際、100%オフラインでデータセキュリティを確保。カスタム辞書で専門用語も正確に認識。 |
学生・研究者 | 講義ノートの記録、インタビュー録音の整理、論文執筆。面倒なタイピングから解放され、思考と研究に集中できます。 |
開発者・プログラマー | AIとのペアプログラミングや技術ドキュメント作成時、 |
ゲーマー | 白熱した対戦中、操作を止めることなく音声で素早くチャットし、チーム連携を強化します。 |
✨ VocoTypeコアエンジンの特徴
すべてのVocoTypeバージョンは、同一の強力なコアエンジンを共有しています。
🛡️ 100%オフライン、プライバシー安心:すべての音声認識はPCローカルで完結します。
⚡️ フラッグシップ級の認識エンジン:中英混合入力も正確で、修正の手間を省きます。
⚙️ 高いカスタマイズ性:独自の置換辞書機能により、人名、地名、業界用語も一発で正しく変換。
💻 軽量設計:メモリ使用量はわずか700MB。CPUのみで推論可能なため、高価なグラフィックボードは不要です。
🚀 0.1秒単位の応答:待ち時間による思考の分断を防ぎ、快適な入力体験を提供します。
🛠️ 【開発者向け】CLI版インストールガイド
注意: このバージョンは技術的な知識を持つ開発者向けです。コマンドラインに不慣れな場合は、公式サイトから簡単で使いやすい VocoType無料デスクトップ版 をダウンロードすることを強く推奨します。
1. 環境要件
Python 3.12
uvまたはvenvを使用して仮想環境を作成することを強く推奨します。
2. クローンとインストール
# 1. 克隆仓库
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli
# 2. (推荐) 创建并激活虚拟环境
pip install uv
uv venv --python 3.12
source .venv/bin/activate # macOS/Linux
# 或者 .\.venv\Scripts\activate (Windows)
# 3. 安装依赖
uv pip install -r requirements.txt
# 4. 运行
python main.py
# 保存数据集运行
python main.py --save-datasetモデルのダウンロード:初回実行時に、プログラムが約500MBのモデルファイルを自動的にダウンロードします。ネットワーク接続が安定していることを確認してください。
🌐 Volcengine(火山エンジン)BigASRストリーミング認識バックエンド(オプション)
デフォルトのローカルFunASRオフラインエンジンに加え、VocoType CLIは火山エンジン豆包(Doubao)大規模モデルストリーミング音声認識をクラウド認識バックエンドとして接続可能です。
メリット
特徴 | ローカル FunASR | Volcengine BigASR |
ネットワーク要件 | 不要 | 必要 |
モデルダウンロード | ~500 MB | 不要 |
応答遅延 | ローカル推論 | クラウド超低遅延 |
認識品質 | 高 | フラッグシップ級大規模モデル |
データプライバシー | 完全オフライン | 音声が火山エンジンへ送信される |
設定手順
火山エンジンコンソールにログインし、音声アプリケーションを作成して App Key と Access Key を取得します。
プロジェクトディレクトリに
config.jsonを作成します:
{
"backend": "volcengine",
"volcengine": {
"app_key": "YOUR_APP_KEY",
"access_key": "YOUR_ACCESS_KEY",
"resource_id": "volc.bigasr.sauc.duration",
"enable_punc": true,
"enable_itn": true
}
}--configパラメータを指定して起動します:
python main.py --config config.json注意:Volcengineバックエンドを使用する場合、録音データは認識のために火山エンジンのサーバーへ送信されるため、完全オフラインではなくなります。プライバシー要件が厳しい場合は、デフォルトのローカルFunASRエンジンを引き続き使用してください。
よくある質問 (FAQ)
Q: データは安全ですか?
A: 100%安全です。すべての音声認識はローカルでオフライン処理されるため、音声データがサーバーにアップロードされることはありません。
📞 お問い合わせ
バグ報告・提案:GitHub Issuesをご利用ください。
最新情報のフォロー:https://vocotype.com
🙏 謝辞
VocoTypeは、以下の優れたオープンソースプロジェクトの貢献によって成り立っています:
FunASR - アリババ達摩院(DAMO Academy)がオープンソース化した音声認識フレームワーク。VocoTypeに強力なオフライン音声認識能力を提供しています。
QuQu - 優れたオープンソースプロジェクト。VocoTypeに重要な技術的参考とインスピレーションを提供しました。
オープンソースコミュニティの皆様の無私な貢献に感謝いたします!
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityNot gradedmaintenanceA local voice interface providing high-performance speech recognition and natural text-to-speech with voice cloning capabilities. It enables AI assistants to speak, listen, and engage in character-based voice conversations through integrated MCP tools.
- AlicenseAqualityDmaintenanceLocal speech-to-text transcription using Microsoft's VibeVoice-ASR model with speaker diarization, enabling audio transcription directly in AI tools like Claude Code, Cursor, and OpenCode.32MIT
- AlicenseAqualityCmaintenanceCaptures and transcribes system audio in real-time using OpenAI Whisper, enabling meeting transcription, content creation, and accessibility through natural language.8203MIT
- AlicenseNot gradedqualityBmaintenance从抖音/B站视频链接下载音频并自动提取语音文案,支持MCP集成,可配合Claude Desktop等AI应用使用。Apache 2.0
Related MCP Connectors
Voice-powered bug reporting with 13 MCP tools. Record bugs by talking; let AI find and fix them.
MCP-native collaborative markdown editor with real-time AI document editing
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Appeared in Searches
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/233stone/vocotype-cli'
If you have feedback or need assistance with the MCP directory API, please join our Discord server