Voice Recognition MCP Service
MCP-Dienst zur Spracherkennung
Dieser Dienst bietet Spracherkennungs- und Textextraktionsfunktionen sowohl im Standard- als auch im MCP-Modus.
Merkmale
Spracherkennung aus Datei
Spracherkennung aus Base64-kodierten Daten
Textextraktion
Unterstützung für Standard- und MCP-Modus
Strukturierte Spracherkennungsergebnisse
Related MCP server: GhostMinutes MCP
Projektstruktur
voice_service.py– Implementierung des Kerndienstesstdio_server.py– Einstiegspunkt für den Stdio-Modusmcp_server.py- Einstiegspunkt für den MCP-Modusbuild.py- Build-Skript für ausführbare Dateienbuild_exec.sh- Build-Ausführungsskripttest_*.sh- Testskripte für verschiedene Funktionalitäten
Installation
Klonen Sie das Repository:
git clone https://github.com/AIO-2030/mcp_voice_identify.git
cd mcp_voice_identifyInstallieren Sie Abhängigkeiten:
pip install -r requirements.txtRichten Sie Umgebungsvariablen in
.envein:
API_URL=your_api_url
API_KEY=your_api_keyVerwendung
stdio-Modus
Führen Sie den Dienst aus:
python stdio_server.pySenden Sie JSON-RPC-Anfragen über stdin:
{
"jsonrpc": "2.0",
"method": "help",
"params": {},
"id": 1
}Oder verwenden Sie die ausführbare Datei:
./dist/voice_stdioMCP-Modus
Führen Sie den Dienst aus:
python mcp_server.pyOder verwenden Sie die ausführbare Datei:
./dist/voice_mcpErgebnisse der Spracherkennung
Der Dienst liefert strukturierte Spracherkennungsergebnisse. Hier ist ein Beispiel für das Antwortformat:
Ursprüngliche API-Antwort
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": "<|en|><|EMO_UNKNOWN|><|Speech|><|woitn|>test test test"
},
"id": 1
}Umstrukturierte Antwort
{
"jsonrpc": "2.0",
"result": {
"message": "input processed successfully",
"results": "test test test",
"label_result": {
"lan": "en",
"emo": "unknown",
"type": "speech",
"speaker": "woitn",
"text": "test test test"
}
},
"id": 1
}Ergebnisfelder beschriften
Das Feld label_result enthält die folgenden strukturierten Informationen:
Feld | Beschreibung | Beispielwert |
lan | Sprachcode | "en" |
Emo | Emotionaler Zustand | "unbekannt" |
Typ | Audiotyp | "Rede" |
Lautsprecher | Sprecherkennung | "woitn" |
Text | Erkannter Textinhalt | "Test, Test, Test" |
Spezialetiketten
Der Dienst erkennt und verarbeitet die folgenden speziellen Bezeichnungen in der Originalantwort:
<|en|>- Sprachcode<|EMO_UNKNOWN|>– Emotionaler Zustand<|Speech|>- Audiotyp<|woitn|>– Sprecherkennung
Erstellen ausführbarer Dateien
Machen Sie das Build-Skript ausführbar:
chmod +x build_exec.shAusführbare Datei im stdio-Modus erstellen:
./build_exec.shAusführbare Datei im MCP-Modus erstellen:
./build_exec.sh mcpDie ausführbaren Dateien werden erstellt unter:
stdio-Modus:
dist/voice_stdioMCP-Modus:
dist/voice_mcp
Testen
Führen Sie die Testskripte aus:
chmod +x test_*.sh
./test_help.sh
./test_voice_file.sh
./test_voice_base64.shLizenz
Dieses Projekt ist unter der MIT-Lizenz lizenziert – Einzelheiten finden Sie in der Datei LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityDmaintenanceA powerful speech-to-text MCP server that supports multiple audio formats and recognition engines including remote APIs (Bailian, OpenAI Whisper, iFLYTEK), Google Speech Recognition, and CMU Sphinx.1
- AlicenseAqualityDmaintenanceProvides accurate meeting transcription with speaker diarization and multilingual support, allowing users to submit audio URLs, poll transcription status, get transcripts, and summarize via MCP tools in their IDE.81MIT
- FlicenseNot gradedqualityDmaintenanceA high-performance speech recognition MCP server based on Faster Whisper, providing efficient audio transcription capabilities with support for multiple model sizes, batch processing, and various output formats.17
- FlicenseNot gradedqualityCmaintenanceA Model Context Protocol (MCP) server that gives AI agents the ability to process audio files — transcribe speech to text, detect spoken languages, and extract audio metadata.1
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
MCP server exposing the AceDataCloud Fish Audio API (text-to-speech with voice conditioning)
A paid remote MCP for AI SDK data query MCP, built to return verdicts, receipts, usage logs, and aud
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/yangsenessa/mcp_voice_identify'
If you have feedback or need assistance with the MCP directory API, please join our Discord server