Voice Recognition MCP Service
Служба распознавания голоса MCP
Эта служба обеспечивает возможности распознавания голоса и извлечения текста как в режимах stdio, так и в режимах MCP.
Функции
Распознавание голоса из файла
Распознавание голоса из данных, закодированных в base64
Извлечение текста
Поддержка режимов stdio и MCP
Структурированные результаты распознавания голоса
Related MCP server: GhostMinutes MCP
Структура проекта
voice_service.py— реализация основного сервисаstdio_server.py- точка входа в режим stdiomcp_server.py— точка входа в режим MCPbuild.py— скрипт сборки исполняемых файловbuild_exec.sh— скрипт выполнения сборкиtest_*.sh— тестовые скрипты для различных функций
Установка
Клонируйте репозиторий:
git clone https://github.com/AIO-2030/mcp_voice_identify.git
cd mcp_voice_identifyУстановите зависимости:
pip install -r requirements.txtНастройте переменные среды в
.env:
API_URL=your_api_url
API_KEY=your_api_keyИспользование
Режим stdio
Запустите службу:
python stdio_server.pyОтправляйте запросы JSON-RPC через stdin:
{
"jsonrpc": "2.0",
"method": "help",
"params": {},
"id": 1
}Или используйте исполняемый файл:
./dist/voice_stdioРежим МКП
Запустите службу:
python mcp_server.pyИли используйте исполняемый файл:
./dist/voice_mcpРезультаты распознавания голоса
Сервис предоставляет структурированные результаты распознавания голоса. Вот пример формата ответа:
Исходный ответ API
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": "<|en|><|EMO_UNKNOWN|><|Speech|><|woitn|>test test test"
},
"id": 1
}Реструктурированный ответ
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": {
"lan": "en",
"emo": "unknown",
"type": "speech",
"speaker": "woitn",
"text": "test test test"
}
},
"id": 1
}Поля результатов метки
Поле label_result содержит следующую структурированную информацию:
Поле | Описание | Пример значения |
лан | Код языка | "ru" |
эмо | Эмоциональное состояние | "неизвестный" |
тип | Тип аудио | "речь" |
спикер | Идентификатор говорящего | "woitn" |
текст | Распознанное текстовое содержимое | "тест тест тест" |
Специальные этикетки
Служба распознает и обрабатывает следующие специальные метки в исходном ответе:
<|en|>- Код языка<|EMO_UNKNOWN|>- Состояние эмоций<|Speech|>- Тип аудио<|woitn|>- Идентификатор говорящего
Создание исполняемых файлов
Сделайте скрипт сборки исполняемым:
chmod +x build_exec.shСобрать исполняемый файл в режиме stdio:
./build_exec.shСобрать исполняемый файл режима MCP:
./build_exec.sh mcpИсполняемые файлы будут созданы по адресу:
режим stdio:
dist/voice_stdioРежим MCP:
dist/voice_mcp
Тестирование
Запустите тестовые скрипты:
chmod +x test_*.sh
./test_help.sh
./test_voice_file.sh
./test_voice_base64.shЛицензия
Данный проект лицензирован по лицензии MIT — подробности см. в файле LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityDmaintenanceA powerful speech-to-text MCP server that supports multiple audio formats and recognition engines including remote APIs (Bailian, OpenAI Whisper, iFLYTEK), Google Speech Recognition, and CMU Sphinx.1
- AlicenseAqualityDmaintenanceProvides accurate meeting transcription with speaker diarization and multilingual support, allowing users to submit audio URLs, poll transcription status, get transcripts, and summarize via MCP tools in their IDE.81MIT
- FlicenseNot gradedqualityDmaintenanceA high-performance speech recognition MCP server based on Faster Whisper, providing efficient audio transcription capabilities with support for multiple model sizes, batch processing, and various output formats.17
- FlicenseNot gradedqualityCmaintenanceA Model Context Protocol (MCP) server that gives AI agents the ability to process audio files — transcribe speech to text, detect spoken languages, and extract audio metadata.1
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
MCP server exposing the AceDataCloud Fish Audio API (text-to-speech with voice conditioning)
A paid remote MCP for AI SDK data query MCP, built to return verdicts, receipts, usage logs, and aud
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/yangsenessa/mcp_voice_identify'
If you have feedback or need assistance with the MCP directory API, please join our Discord server