Skip to main content
Glama

MCP Video Recognition Server

MCP-сервер, который описывает изображения, транскрибирует аудио и резюмирует видео из локальных файлов. По умолчанию используется Google Gemini или любой OpenAI-совместимый эндпоинт, например OpenRouter.

Возможности

  • Выберите провайдера: Google Gemini (по умолчанию) или OpenAI-совместимый эндпоинт

  • Три MCP-инструмента для локальных изображений, аудио и видео

  • Опциональный запасной вариант модели Gemini, плюс финальный резервный OpenAI-совместимый вариант

Поддержка моделей различается. Выбор OpenAI-совместимого провайдера не означает, что каждый эндпоинт или модель обрабатывает все типы медиа, и сервер никогда не подменяет модель или провайдера за вас.

Related MCP server: Puter MCP Server

Предварительные требования

  • Node.js 18.0.0 или новее

  • Ключ API для вашего провайдера:

    • Gemini: GOOGLE_API_KEY

    • OpenAI-совместимый: OPENAI_COMPATIBLE_API_KEY

Установка

git clone https://github.com/yourusername/mcp-video-recognition.git
cd mcp-video-recognition
npm install
npm run build

Быстрый старт

Добавьте сервер в конфигурацию вашего MCP-клиента и укажите его на собранный dist/index.js:

{
  "mcpServers": {
    "video-recognition": {
      "command": "node",
      "args": ["/path/to/mcp-video-recognition/dist/index.js"],
      "env": {
        "GOOGLE_API_KEY": "your_google_api_key"
      }
    }
  }
}

В Windows используйте прямые слэши или удвоенные обратные слэши (\\) в пути. Сохраните файл и переподключите ваш MCP-клиент.

Для OpenRouter или другого OpenAI-совместимого эндпоинта установите RECOGNITION_PROVIDER=openai-compatible и его переменные. Готовый пример см. в Конфигурации.

С помощью FLUJO:

  1. Нажмите Add Server.

  2. Вставьте URL репозитория GitHub.

  3. Нажмите Parse, Clone, Install, Build and Save.

Конфигурация

Сервер считывает переменные окружения. Наиболее распространённые:

Переменная

По умолчанию

Назначение

RECOGNITION_PROVIDER

gemini

gemini или openai-compatible

GOOGLE_API_KEY

нет

Ключ API Gemini

GEMINI_MODEL

gemini-3.5-flash

Используемая модель Gemini

OPENAI_COMPATIBLE_API_KEY

нет

OpenAI-совместимый ключ API

OPENAI_COMPATIBLE_BASE_URL

нет

Базовый URL эндпоинта

OPENAI_COMPATIBLE_MODEL

xiaomi/mimo-v2.5

Используемая модель

ALLOWED_MEDIA_ROOTS

нет

Медиакаталоги для OpenAI-совместимого провайдера и резервного варианта Gemini

Некорректные значения останавливают запуск; они не исправляются молча.

Полный список переменных, правила валидации, пример для OpenRouter и поддерживаемые типы медиа см. в Справочнике по конфигурации.

О запасном варианте модели Gemini и финальном резервном варианте см. в Справочнике по восстановлению провайдера.

Инструменты

Сервер предоставляет три MCP-инструмента. Каждый принимает локальный filepath, необязательный prompt (по умолчанию Describe this content) и необязательный параметр modelname для переопределения.

  • image_recognition — описать изображение

  • audio_recognition — транскрибировать или описать аудио

  • video_recognition — описать видео

Пример:

{
  "name": "video_recognition",
  "arguments": {
    "filepath": "/path/to/video.mp4",
    "prompt": "Describe what happens in this video"
  }
}

Безопасность

  • HTTPS требуется по умолчанию. Обычный HTTP разрешён только для явно включённого локального эндпоинта.

  • OpenAI-совместимый провайдер и резервный вариант Gemini читают медиа только из каталогов, перечисленных в ALLOWED_MEDIA_ROOTS.

  • Ключи остаются в окружении процесса. Не коммитьте реальные ключи.

Правила эндпоинтов, лимиты ресурсов и порядок действий при инцидентах см. в Справочнике по безопасности.

Разработка

# Run in development mode
GOOGLE_API_KEY=your_api_key npm run dev

# Build and run the provider foundation tests
npm run verify:provider-foundation

Структура проекта

  • src/index.ts: точка входа и создание провайдера

  • src/server.ts: MCP-сервер и транспорт

  • src/tools/: три инструмента распознавания

  • src/services/: провайдеры Gemini и OpenAI-совместимый

  • src/types/: общие типы

  • src/utils/: вспомогательные функции

Лицензия

MIT

Install Server
A
license - permissive license
B
quality
A
maintenance

Maintenance

Maintainers
<1hResponse time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • OCR, transcription, file extraction, and image generation for AI agents via MCP.

  • Transform video, audio and images, and generate media from prompts. FFmpeg, captions, models.

  • A Model Context Protocol server for Wix AI tools

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/mario-andreschak/mcp_video_recognition'

If you have feedback or need assistance with the MCP directory API, please join our Discord server