MCP Video Recognition Server
MCP Video Recognition Server
Ein MCP-Server, der Bilder beschreibt, Audio transkribiert und Videos aus lokalen Dateien zusammenfasst. Er verwendet standardmäßig Google Gemini oder einen beliebigen OpenAI-kompatiblen Endpunkt wie OpenRouter.
Funktionen
Wählen Sie Ihren Anbieter: Google Gemini (Standard) oder einen OpenAI-kompatiblen Endpunkt
Drei MCP-Tools für lokale Bilder, Audio und Video
Optionale Gemini-Modell-Fallback plus ein letztes OpenAI-kompatibles Backup
Die Modellunterstützung variiert. Die Wahl des OpenAI-kompatiblen Anbieters bedeutet nicht, dass jeder Endpunkt oder jedes Modell jeden Medientyp verarbeitet, und der Server ersetzt für Sie niemals ein Modell oder einen Anbieter.
Related MCP server: Puter MCP Server
Voraussetzungen
Node.js 18.0.0 oder höher
Ein API-Schlüssel für Ihren Anbieter:
Gemini:
GOOGLE_API_KEYOpenAI-kompatibel:
OPENAI_COMPATIBLE_API_KEY
Installation
git clone https://github.com/yourusername/mcp-video-recognition.git
cd mcp-video-recognition
npm install
npm run buildSchnellstart
Fügen Sie den Server zu Ihrer MCP-Client-Konfiguration hinzu und verweisen Sie auf das erstellte dist/index.js:
{
"mcpServers": {
"video-recognition": {
"command": "node",
"args": ["/path/to/mcp-video-recognition/dist/index.js"],
"env": {
"GOOGLE_API_KEY": "your_google_api_key"
}
}
}
}Unter Windows verwenden Sie Schrägstriche oder doppelte Backslashes (\\) im Pfad. Speichern Sie die Datei und verbinden Sie Ihren MCP-Client neu.
Für OpenRouter oder einen anderen OpenAI-kompatiblen Endpunkt setzen Sie RECOGNITION_PROVIDER=openai-compatible sowie dessen Variablen. Siehe Konfiguration für ein fertiges Beispiel.
Mit FLUJO:
Klicken Sie auf Server hinzufügen.
Fügen Sie die GitHub-URL ein.
Klicken Sie auf Parsen, Klonen, Installieren, Erstellen und Speichern.
Konfiguration
Der Server liest Umgebungsvariablen. Die häufigsten sind:
Variable | Standard | Zweck |
|
|
|
| keine | Gemini-API-Schlüssel |
|
| Zu verwendendes Gemini-Modell |
| keine | OpenAI-kompatibler API-Schlüssel |
| keine | Basis-URL des Endpunkts |
| xiaomi/mimo-v2.5 | Zu verwendendes Modell |
| keine | Medienverzeichnisse für den OpenAI-kompatiblen Anbieter und das Gemini-Backup |
Ungültige Werte verhindern den Start; sie werden nicht stillschweigend korrigiert.
Die vollständige Variablenliste, Validierungsregeln, das OpenRouter-Beispiel und unterstützte Medientypen finden Sie in der Konfigurationsreferenz.
Für den Gemini-Modell-Fallback und das letzte Backup siehe Referenz zur Anbieter-Wiederherstellung.
Tools
Der Server stellt drei MCP-Tools bereit. Jedes nimmt einen lokalen filepath, einen optionalen prompt (Standard Describe this content) und eine optionale modelname-Überschreibung.
image_recognition— ein Bild beschreibenaudio_recognition— Audio transkribieren oder beschreibenvideo_recognition— ein Video beschreiben
Beispiel:
{
"name": "video_recognition",
"arguments": {
"filepath": "/path/to/video.mp4",
"prompt": "Describe what happens in this video"
}
}Sicherheit
HTTPS ist standardmäßig erforderlich. Nur-Text-HTTP ist nur für einen explizit aktivierten lokalen Endpunkt erlaubt.
Der OpenAI-kompatible Anbieter und das Gemini-Backup lesen Medien nur aus Verzeichnissen, die Sie in
ALLOWED_MEDIA_ROOTSangeben.Schlüssel bleiben in der Prozessumgebung. Nehmen Sie keine echten Schlüssel in die Versionskontrolle auf.
Endpunktregeln, Ressourcengrenzen und Reaktion auf Vorfälle finden Sie in der Sicherheitsreferenz.
Entwicklung
# Run in development mode
GOOGLE_API_KEY=your_api_key npm run dev
# Build and run the provider foundation tests
npm run verify:provider-foundationProjektstruktur
src/index.ts: Einstiegspunkt und Anbieterkonstruktionsrc/server.ts: MCP-Server und Transportsrc/tools/: die drei Erkennungstoolssrc/services/: Gemini- und OpenAI-kompatible Anbietersrc/types/: gemeinsame Typensrc/utils/: Hilfsfunktionen
Lizenz
MIT
Maintenance
Related MCP Servers
- FlicenseNot gradedqualityDmaintenanceEnables text-to-image generation, style transfer, background removal, and automatic image cropping using Google's Imagen AI models through the Model Context Protocol.
- AlicenseNot gradedqualityCmaintenanceProvides AI-powered media generation tools including image, speech, video, OCR, and voice conversion via the Model Context Protocol.20MIT
- AlicenseAqualityCmaintenanceProvides AI-powered image and video analysis using Google Gemini and Vertex AI models through the Model Context Protocol.514172MIT
- AlicenseNot gradedqualityBmaintenanceProvides image analysis, inspection, cropping, OCR, and comparison capabilities via the Model Context Protocol, allowing AI agents to process and manipulate images using vision models.2MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
A Model Context Protocol server for Wix AI tools
Appeared in Searches
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/mario-andreschak/mcp_video_recognition'
If you have feedback or need assistance with the MCP directory API, please join our Discord server