Voice Recognition MCP Service
Servicio MCP de reconocimiento de voz
Este servicio proporciona capacidades de reconocimiento de voz y extracción de texto a través de los modos stdio y MCP.
Características
Reconocimiento de voz desde archivo
Reconocimiento de voz a partir de datos codificados en base64
Extracción de texto
Soporte para los modos stdio y MCP
Resultados del reconocimiento de voz estructurado
Related MCP server: GhostMinutes MCP
Estructura del proyecto
voice_service.py- Implementación del servicio principalstdio_server.py- punto de entrada del modo stdiomcp_server.py- Punto de entrada del modo MCPbuild.py- Script de compilación para ejecutablesbuild_exec.sh- Script de ejecución de compilacióntest_*.sh- Scripts de prueba para diferentes funcionalidades
Instalación
Clonar el repositorio:
git clone https://github.com/AIO-2030/mcp_voice_identify.git
cd mcp_voice_identifyInstalar dependencias:
pip install -r requirements.txtConfigurar variables de entorno en
.env:
API_URL=your_api_url
API_KEY=your_api_keyUso
Modo stdio
Ejecutar el servicio:
python stdio_server.pyEnviar solicitudes JSON-RPC a través de stdin:
{
"jsonrpc": "2.0",
"method": "help",
"params": {},
"id": 1
}O utilice el ejecutable:
./dist/voice_stdioModo MCP
Ejecutar el servicio:
python mcp_server.pyO utilice el ejecutable:
./dist/voice_mcpResultados del reconocimiento de voz
El servicio proporciona resultados de reconocimiento de voz estructurados. A continuación, se muestra un ejemplo del formato de respuesta:
Respuesta de la API original
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": "<|en|><|EMO_UNKNOWN|><|Speech|><|woitn|>test test test"
},
"id": 1
}Respuesta reestructurada
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": {
"lan": "en",
"emo": "unknown",
"type": "speech",
"speaker": "woitn",
"text": "test test test"
}
},
"id": 1
}Campos de resultados de etiquetas
El campo label_result contiene la siguiente información estructurada:
Campo | Descripción | Valor de ejemplo |
lan | Código de idioma | "en" |
emo | Estado emocional | "desconocido" |
tipo | Tipo de audio | "discurso" |
vocero | Identificador del hablante | "woitn" |
texto | Contenido de texto reconocido | "prueba, prueba, prueba" |
Etiquetas especiales
El servicio reconoce y procesa las siguientes etiquetas especiales en la respuesta original:
<|en|>- Código de idioma<|EMO_UNKNOWN|>- Estado emocional<|Speech|>- Tipo de audio<|woitn|>- Identificador del hablante
Construyendo ejecutables
Hacer que el script de compilación sea ejecutable:
chmod +x build_exec.shConstruir ejecutable en modo stdio:
./build_exec.shConstruir ejecutable en modo MCP:
./build_exec.sh mcpLos ejecutables se crearán en:
Modo stdio:
dist/voice_stdioModo MCP:
dist/voice_mcp
Pruebas
Ejecute los scripts de prueba:
chmod +x test_*.sh
./test_help.sh
./test_voice_file.sh
./test_voice_base64.shLicencia
Este proyecto está licenciado bajo la licencia MIT: consulte el archivo de LICENCIA para obtener más detalles.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityDmaintenanceA powerful speech-to-text MCP server that supports multiple audio formats and recognition engines including remote APIs (Bailian, OpenAI Whisper, iFLYTEK), Google Speech Recognition, and CMU Sphinx.1
- AlicenseAqualityDmaintenanceProvides accurate meeting transcription with speaker diarization and multilingual support, allowing users to submit audio URLs, poll transcription status, get transcripts, and summarize via MCP tools in their IDE.81MIT
- FlicenseNot gradedqualityDmaintenanceA high-performance speech recognition MCP server based on Faster Whisper, providing efficient audio transcription capabilities with support for multiple model sizes, batch processing, and various output formats.17
- FlicenseNot gradedqualityCmaintenanceA Model Context Protocol (MCP) server that gives AI agents the ability to process audio files — transcribe speech to text, detect spoken languages, and extract audio metadata.1
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
MCP server exposing the AceDataCloud Fish Audio API (text-to-speech with voice conditioning)
A paid remote MCP for AI SDK data query MCP, built to return verdicts, receipts, usage logs, and aud
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/yangsenessa/mcp_voice_identify'
If you have feedback or need assistance with the MCP directory API, please join our Discord server