Skip to main content
Glama

MCP Video Recognition Server

Ein MCP-Server, der Bilder beschreibt, Audio transkribiert und Videos aus lokalen Dateien zusammenfasst. Er verwendet standardmäßig Google Gemini oder einen beliebigen OpenAI-kompatiblen Endpunkt wie OpenRouter.

Funktionen

  • Wählen Sie Ihren Anbieter: Google Gemini (Standard) oder einen OpenAI-kompatiblen Endpunkt

  • Drei MCP-Tools für lokale Bilder, Audio und Video

  • Optionale Gemini-Modell-Fallback plus ein letztes OpenAI-kompatibles Backup

Die Modellunterstützung variiert. Die Wahl des OpenAI-kompatiblen Anbieters bedeutet nicht, dass jeder Endpunkt oder jedes Modell jeden Medientyp verarbeitet, und der Server ersetzt für Sie niemals ein Modell oder einen Anbieter.

Related MCP server: Puter MCP Server

Voraussetzungen

  • Node.js 18.0.0 oder höher

  • Ein API-Schlüssel für Ihren Anbieter:

    • Gemini: GOOGLE_API_KEY

    • OpenAI-kompatibel: OPENAI_COMPATIBLE_API_KEY

Installation

git clone https://github.com/yourusername/mcp-video-recognition.git
cd mcp-video-recognition
npm install
npm run build

Schnellstart

Fügen Sie den Server zu Ihrer MCP-Client-Konfiguration hinzu und verweisen Sie auf das erstellte dist/index.js:

{
  "mcpServers": {
    "video-recognition": {
      "command": "node",
      "args": ["/path/to/mcp-video-recognition/dist/index.js"],
      "env": {
        "GOOGLE_API_KEY": "your_google_api_key"
      }
    }
  }
}

Unter Windows verwenden Sie Schrägstriche oder doppelte Backslashes (\\) im Pfad. Speichern Sie die Datei und verbinden Sie Ihren MCP-Client neu.

Für OpenRouter oder einen anderen OpenAI-kompatiblen Endpunkt setzen Sie RECOGNITION_PROVIDER=openai-compatible sowie dessen Variablen. Siehe Konfiguration für ein fertiges Beispiel.

Mit FLUJO:

  1. Klicken Sie auf Server hinzufügen.

  2. Fügen Sie die GitHub-URL ein.

  3. Klicken Sie auf Parsen, Klonen, Installieren, Erstellen und Speichern.

Konfiguration

Der Server liest Umgebungsvariablen. Die häufigsten sind:

Variable

Standard

Zweck

RECOGNITION_PROVIDER

gemini

gemini oder openai-compatible

GOOGLE_API_KEY

keine

Gemini-API-Schlüssel

GEMINI_MODEL

gemini-3.5-flash

Zu verwendendes Gemini-Modell

OPENAI_COMPATIBLE_API_KEY

keine

OpenAI-kompatibler API-Schlüssel

OPENAI_COMPATIBLE_BASE_URL

keine

Basis-URL des Endpunkts

OPENAI_COMPATIBLE_MODEL

xiaomi/mimo-v2.5

Zu verwendendes Modell

ALLOWED_MEDIA_ROOTS

keine

Medienverzeichnisse für den OpenAI-kompatiblen Anbieter und das Gemini-Backup

Ungültige Werte verhindern den Start; sie werden nicht stillschweigend korrigiert.

Die vollständige Variablenliste, Validierungsregeln, das OpenRouter-Beispiel und unterstützte Medientypen finden Sie in der Konfigurationsreferenz.

Für den Gemini-Modell-Fallback und das letzte Backup siehe Referenz zur Anbieter-Wiederherstellung.

Tools

Der Server stellt drei MCP-Tools bereit. Jedes nimmt einen lokalen filepath, einen optionalen prompt (Standard Describe this content) und eine optionale modelname-Überschreibung.

  • image_recognition — ein Bild beschreiben

  • audio_recognition — Audio transkribieren oder beschreiben

  • video_recognition — ein Video beschreiben

Beispiel:

{
  "name": "video_recognition",
  "arguments": {
    "filepath": "/path/to/video.mp4",
    "prompt": "Describe what happens in this video"
  }
}

Sicherheit

  • HTTPS ist standardmäßig erforderlich. Nur-Text-HTTP ist nur für einen explizit aktivierten lokalen Endpunkt erlaubt.

  • Der OpenAI-kompatible Anbieter und das Gemini-Backup lesen Medien nur aus Verzeichnissen, die Sie in ALLOWED_MEDIA_ROOTS angeben.

  • Schlüssel bleiben in der Prozessumgebung. Nehmen Sie keine echten Schlüssel in die Versionskontrolle auf.

Endpunktregeln, Ressourcengrenzen und Reaktion auf Vorfälle finden Sie in der Sicherheitsreferenz.

Entwicklung

# Run in development mode
GOOGLE_API_KEY=your_api_key npm run dev

# Build and run the provider foundation tests
npm run verify:provider-foundation

Projektstruktur

  • src/index.ts: Einstiegspunkt und Anbieterkonstruktion

  • src/server.ts: MCP-Server und Transport

  • src/tools/: die drei Erkennungstools

  • src/services/: Gemini- und OpenAI-kompatible Anbieter

  • src/types/: gemeinsame Typen

  • src/utils/: Hilfsfunktionen

Lizenz

MIT

Install Server
A
license - permissive license
B
quality
A
maintenance

Maintenance

Maintainers
<1hResponse time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

  • A Model Context Protocol server for Wix AI tools

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/mario-andreschak/mcp_video_recognition'

If you have feedback or need assistance with the MCP directory API, please join our Discord server