MCP Video Recognition Server
MCP Video Recognition Server
MCP-сервер, который описывает изображения, транскрибирует аудио и резюмирует видео из локальных файлов. По умолчанию используется Google Gemini или любой OpenAI-совместимый эндпоинт, например OpenRouter.
Возможности
Выберите провайдера: Google Gemini (по умолчанию) или OpenAI-совместимый эндпоинт
Три MCP-инструмента для локальных изображений, аудио и видео
Опциональный запасной вариант модели Gemini, плюс финальный резервный OpenAI-совместимый вариант
Поддержка моделей различается. Выбор OpenAI-совместимого провайдера не означает, что каждый эндпоинт или модель обрабатывает все типы медиа, и сервер никогда не подменяет модель или провайдера за вас.
Related MCP server: Puter MCP Server
Предварительные требования
Node.js 18.0.0 или новее
Ключ API для вашего провайдера:
Gemini:
GOOGLE_API_KEYOpenAI-совместимый:
OPENAI_COMPATIBLE_API_KEY
Установка
git clone https://github.com/yourusername/mcp-video-recognition.git
cd mcp-video-recognition
npm install
npm run buildБыстрый старт
Добавьте сервер в конфигурацию вашего MCP-клиента и укажите его на собранный dist/index.js:
{
"mcpServers": {
"video-recognition": {
"command": "node",
"args": ["/path/to/mcp-video-recognition/dist/index.js"],
"env": {
"GOOGLE_API_KEY": "your_google_api_key"
}
}
}
}В Windows используйте прямые слэши или удвоенные обратные слэши (\\) в пути. Сохраните файл и переподключите ваш MCP-клиент.
Для OpenRouter или другого OpenAI-совместимого эндпоинта установите RECOGNITION_PROVIDER=openai-compatible и его переменные. Готовый пример см. в Конфигурации.
С помощью FLUJO:
Нажмите Add Server.
Вставьте URL репозитория GitHub.
Нажмите Parse, Clone, Install, Build and Save.
Конфигурация
Сервер считывает переменные окружения. Наиболее распространённые:
Переменная | По умолчанию | Назначение |
|
|
|
| нет | Ключ API Gemini |
|
| Используемая модель Gemini |
| нет | OpenAI-совместимый ключ API |
| нет | Базовый URL эндпоинта |
| xiaomi/mimo-v2.5 | Используемая модель |
| нет | Медиакаталоги для OpenAI-совместимого провайдера и резервного варианта Gemini |
Некорректные значения останавливают запуск; они не исправляются молча.
Полный список переменных, правила валидации, пример для OpenRouter и поддерживаемые типы медиа см. в Справочнике по конфигурации.
О запасном варианте модели Gemini и финальном резервном варианте см. в Справочнике по восстановлению провайдера.
Инструменты
Сервер предоставляет три MCP-инструмента. Каждый принимает локальный filepath, необязательный prompt (по умолчанию Describe this content) и необязательный параметр modelname для переопределения.
image_recognition— описать изображениеaudio_recognition— транскрибировать или описать аудиоvideo_recognition— описать видео
Пример:
{
"name": "video_recognition",
"arguments": {
"filepath": "/path/to/video.mp4",
"prompt": "Describe what happens in this video"
}
}Безопасность
HTTPS требуется по умолчанию. Обычный HTTP разрешён только для явно включённого локального эндпоинта.
OpenAI-совместимый провайдер и резервный вариант Gemini читают медиа только из каталогов, перечисленных в
ALLOWED_MEDIA_ROOTS.Ключи остаются в окружении процесса. Не коммитьте реальные ключи.
Правила эндпоинтов, лимиты ресурсов и порядок действий при инцидентах см. в Справочнике по безопасности.
Разработка
# Run in development mode
GOOGLE_API_KEY=your_api_key npm run dev
# Build and run the provider foundation tests
npm run verify:provider-foundationСтруктура проекта
src/index.ts: точка входа и создание провайдераsrc/server.ts: MCP-сервер и транспортsrc/tools/: три инструмента распознаванияsrc/services/: провайдеры Gemini и OpenAI-совместимыйsrc/types/: общие типыsrc/utils/: вспомогательные функции
Лицензия
MIT
Maintenance
Related MCP Servers
- FlicenseNot gradedqualityDmaintenanceEnables text-to-image generation, style transfer, background removal, and automatic image cropping using Google's Imagen AI models through the Model Context Protocol.
- AlicenseNot gradedqualityCmaintenanceProvides AI-powered media generation tools including image, speech, video, OCR, and voice conversion via the Model Context Protocol.20MIT
- AlicenseAqualityCmaintenanceProvides AI-powered image and video analysis using Google Gemini and Vertex AI models through the Model Context Protocol.514172MIT
- AlicenseNot gradedqualityBmaintenanceProvides image analysis, inspection, cropping, OCR, and comparison capabilities via the Model Context Protocol, allowing AI agents to process and manipulate images using vision models.2MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.
A Model Context Protocol server for Wix AI tools
Appeared in Searches
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/mario-andreschak/mcp_video_recognition'
If you have feedback or need assistance with the MCP directory API, please join our Discord server