Skip to main content
Glama

VocoType - 高精度なオフライン音声入力ソフト

VocoType は、プライバシーと効率を重視するプロフェッショナルのために設計された、完全無料のデスクトップ向け音声入力ソフトです。すべての認識処理はローカルで完結するため、ネット環境を気にせず、データのアップロードも一切行われません。

このGitHubプロジェクトは、VocoTypeコアエンジンの CLI(コマンドライン)オープンソース版であり、主に開発者向けに提供されています。


➡️ 最適な体験をお求めですか?今すぐ無料デスクトップ版をダウンロード!

インストールしてすぐに使え、機能も充実しており、技術的な知識は不要です。

公式サイトにアクセスし、無料の完全版VocoTypeデスクトップ版をダウンロード

機能概要

VocoTypeはインテリジェントな音声入力ツールで、ショートカットキーを使用して音声をリアルタイムでテキストに変換し、現在使用中のアプリケーションに自動入力できます。MCP音声テキスト変換、AIによるテキスト最適化、カスタム置換辞書などの機能をサポートし、音声入力をより効率的かつ正確にします。

📹 デモ動画

Related MCP server: vibevoice-asr

ダウンロード

OS

Download

Windows

Setup

macOS

DMG DMG


🤔 VocoTypeが選ばれる理由

特徴

✅ VocoType

従来のクラウド入力ソフト

OS標準機能

プライバシー

ローカルオフライン、アップロードなし

❌ クラウドへデータ送信

⚠️ プライバシーポリシーが複雑

ネット環境

完全オフライン対応

❌ 常時接続必須

❌ ネット依存

応答速度

0.1秒単位

遅い(通信速度に依存)

遅い(通信速度に依存)

カスタマイズ

強力なカスタム辞書

弱いまたは不可

ほぼなし

✅ 主要機能

  • 完全なGUI:インストール後すぐに使え、操作は直感的で分かりやすいです。

  • システム全体で入力可能:あらゆるソフトウェアやテキストボックスで直接音声入力が可能です。

  • カスタム辞書:20個までの常用語や人名を登録でき、認識精度を向上させます。

  • 100%オフライン動作:究極のプライバシーとデータセキュリティを実現。

  • フラッグシップ級の認識エンジン:中英混合のテキストも正確に認識します。

  • AIインテリジェント最適化:複数のAIモデルを選択可能。カスタマイズ可能なプロンプトテンプレートを通じて、音声書き起こし時の誤字や同音異義語を自動修正し、口語的な修正指示(「違う」「~に変えて」など)をインテリジェントに認識することで、より正確でスムーズなテキストを出力します。

(より高度なニーズを持つプロユーザー向けに、アプリ内でPro版へのアップグレードオプションを提供しており、辞書登録数の無制限化などの高度な機能が利用可能です。)

🎯 さまざまな専門シーンに対応

ライター、弁護士、研究者、ゲーマー、そして日常のオフィスワークまで、VocoTypeは信頼できる効率化のパートナーとなります。

ユーザー

シーン

ライター・クリエイター

記事や小説の執筆、会議議事録の整理。思考を音声で即座にテキスト化し、創作活動に集中できます。

法律・医療関係者

機密性の高い顧客情報やカルテを扱う際、100%オフラインでデータセキュリティを確保。カスタム辞書で専門用語も正確に認識。

学生・研究者

講義ノートの記録、インタビュー録音の整理、論文執筆。面倒なタイピングから解放され、思考と研究に集中できます。

開発者・プログラマー

AIとのペアプログラミングや技術ドキュメント作成時、functionやKubernetes podなどの専門用語も正確に認識します。

ゲーマー

白熱した対戦中、操作を止めることなく音声で素早くチャットし、チーム連携を強化します。

✨ VocoTypeコアエンジンの特徴

すべてのVocoTypeバージョンは、同一の強力なコアエンジンを共有しています。

  • 🛡️ 100%オフライン、プライバシー安心:すべての音声認識はPCローカルで完結します。

  • ⚡️ フラッグシップ級の認識エンジン:中英混合入力も正確で、修正の手間を省きます。

  • ⚙️ 高いカスタマイズ性:独自の置換辞書機能により、人名、地名、業界用語も一発で正しく変換。

  • 💻 軽量設計:メモリ使用量はわずか700MB。CPUのみで推論可能なため、高価なグラフィックボードは不要です。

  • 🚀 0.1秒単位の応答:待ち時間による思考の分断を防ぎ、快適な入力体験を提供します。


🛠️ 【開発者向け】CLI版インストールガイド

注意: このバージョンは技術的な知識を持つ開発者向けです。コマンドラインに不慣れな場合は、公式サイトから簡単で使いやすい VocoType無料デスクトップ版 をダウンロードすることを強く推奨します。

1. 環境要件

  • Python 3.12

  • uv または venv を使用して仮想環境を作成することを強く推奨します。

2. クローンとインストール

# 1. 克隆仓库
git clone https://github.com/233stone/vocotype-cli.git
cd vocotype-cli

# 2. (推荐) 创建并激活虚拟环境
pip install uv
uv venv --python 3.12
source .venv/bin/activate  # macOS/Linux
# 或者 .\.venv\Scripts\activate  (Windows)

# 3. 安装依赖
uv pip install -r requirements.txt

# 4. 运行
python main.py

# 保存数据集运行
python main.py --save-dataset

モデルのダウンロード:初回実行時に、プログラムが約500MBのモデルファイルを自動的にダウンロードします。ネットワーク接続が安定していることを確認してください。

🌐 Volcengine(火山エンジン)BigASRストリーミング認識バックエンド(オプション)

デフォルトのローカルFunASRオフラインエンジンに加え、VocoType CLIは火山エンジン豆包(Doubao)大規模モデルストリーミング音声認識をクラウド認識バックエンドとして接続可能です。

メリット

特徴

ローカル FunASR

Volcengine BigASR

ネットワーク要件

不要

必要

モデルダウンロード

~500 MB

不要

応答遅延

ローカル推論

クラウド超低遅延

認識品質

高

フラッグシップ級大規模モデル

データプライバシー

完全オフライン

音声が火山エンジンへ送信される

設定手順

  1. 火山エンジンコンソールにログインし、音声アプリケーションを作成して App Key と Access Key を取得します。

  2. プロジェクトディレクトリに config.json を作成します:

{
  "backend": "volcengine",
  "volcengine": {
    "app_key": "YOUR_APP_KEY",
    "access_key": "YOUR_ACCESS_KEY",
    "resource_id": "volc.bigasr.sauc.duration",
    "enable_punc": true,
    "enable_itn": true
  }
}
  1. --config パラメータを指定して起動します:

python main.py --config config.json

注意:Volcengineバックエンドを使用する場合、録音データは認識のために火山エンジンのサーバーへ送信されるため、完全オフラインではなくなります。プライバシー要件が厳しい場合は、デフォルトのローカルFunASRエンジンを引き続き使用してください。

よくある質問 (FAQ)

Q: データは安全ですか?

A: 100%安全です。すべての音声認識はローカルでオフライン処理されるため、音声データがサーバーにアップロードされることはありません。

📞 お問い合わせ

  • バグ報告・提案:GitHub Issuesをご利用ください。

  • 最新情報のフォロー:https://vocotype.com

🙏 謝辞

VocoTypeは、以下の優れたオープンソースプロジェクトの貢献によって成り立っています:

  • FunASR - アリババ達摩院(DAMO Academy)がオープンソース化した音声認識フレームワーク。VocoTypeに強力なオフライン音声認識能力を提供しています。

  • QuQu - 優れたオープンソースプロジェクト。VocoTypeに重要な技術的参考とインスピレーションを提供しました。

オープンソースコミュニティの皆様の無私な貢献に感謝いたします!

Related MCP Connectors

Related MCP Servers