Skip to main content
Glama
README.md
# mcp-video-vision

MCP server em TypeScript que dá ao Claude a capacidade de "ver" vídeos — extraindo frames e detectando cenas — para uso como ferramenta de edição assistida por IA.

## O que faz

Registrado no Claude Code via transporte stdio, expõe ferramentas que permitem ao assistente analisar vídeos sem precisar scrubbar a timeline manualmente.

## Tools disponíveis

| Tool | Descrição |
|------|-----------|
| `video_info` | Metadata do vídeo (duração, fps, resolução, codec) via ffprobe |
| `extract_frames` | Extrai frames por fps fixo ou automático, com controle de resolução e formato |
| `detect_scenes` | Detecta cortes de cena via ffmpeg com threshold ajustável |
| `frame_at` | Extrai 1 frame de um timestamp exato |
| `decupar` | Tool principal: detecta cenas, mescla cortes curtos, extrai 1 frame representativo por plano e devolve log navegável com timecodes |

## Requisitos

- Node.js 18+
- [ffmpeg](https://ffmpeg.org/) instalado e no PATH (inclui ffprobe)

## Instalação

```bash
git clone https://github.com/danusiojr/mcp-video-vision
cd mcp-video-vision
npm install
npm run build
```

## Registrar no Claude Code

Adicione ao seu `claude_desktop_config.json`:

```json
{
  "mcpServers": {
    "video-vision": {
      "command": "node",
      "args": ["/caminho/para/mcp-video-vision/dist/index.js"]
    }
  }
}
```

## Uso

Com o server registrado, use no Claude Code:

- *"analise o vídeo em /footage/EP011.mp4 e me dê a decupagem completa"*
- *"quais cenas têm mais de 10 segundos nesse clipe?"*
- *"extraia o frame do minuto 2:34 desse vídeo"*

## Stack

TypeScript · [@modelcontextprotocol/sdk](https://github.com/modelcontextprotocol/typescript-sdk) · ffmpeg/ffprobe · Node.js

TDQS

B3.4/5.0

Scored across 8 tools

Disambiguation4/5

Most tools have clearly distinct purposes (e.g., transcribe, video_info, generate_xml). However, there is some overlap: decupar and detect_scenes both detect scenes, and catalog_brolls also extracts representative frames, which could cause confusion. The descriptions help differentiate but ambiguity remains for these tools.

Naming Consistency2/5

Tool names mix English and Portuguese (catalog_brolls, decurpar vs. detect_scenes, extract_frames). Naming patterns are inconsistent: some are verb_noun (detect_scenes, extract_frames), others are noun_verb? (catalog_brolls) or single verbs (decupar). This inconsistency makes it harder to predict tool functions from names alone.

Tool Count5/5

8 tools is an appropriate number for a video analysis and editing server. Each tool covers a distinct part of the workflow (metadata, scene detection, frame extraction, transcription, XML generation) without being overwhelming or too sparse.

Completeness4/5

The tool set covers the core video analysis pipeline: metadata extraction, scene detection, frame extraction, audio transcription, and XML export for editing. Minor gaps exist: no tool for searching within transcriptions or for directly combining scenes into edit decisions, but these are manageable for an agent.

Maintenance

ActivityStale
ResponsivenessNo issues