video-agent-mcp
Video Agent Runtime
Edición de vídeo nativa para agentes, construida sobre planes duraderos, versiones revisables y renderizado determinista.
Edita vídeo como datos estructurados, no como comandos de shell opacos.
Inicio rápido · Agente y MCP · Voz y habla · Móvil · Documentación · Benchmarks
¿Qué es?
Video Agent Runtime es un motor de edición sin interfaz gráfica para agentes como Claude Code, Codex o cualquier cliente compatible con MCP.
En lugar de permitir que un modelo genere directamente comandos de FFmpeg, convierte el material multimedia en datos de proyecto duraderos:
Transcript → EditingStrategy → EditPlan / EditPatch → Timeline → Version → Preview → Approval → Export
El modelo decide qué debería cambiar. El runtime valida si ese cambio está permitido, lo aplica de forma transaccional, renderiza el resultado y mantiene cada mutación revisable y reversible.
Está diseñado principalmente para vídeos de persona hablando, entrevistas, podcasts, conferencias, grabaciones de pantalla y flujos de formato largo a formato corto.
[!NOTE] Esto no es un NLE de escritorio y no intenta reproducir Premiere o CapCut. La interfaz principal es un agente, CLI, cliente MCP o host móvil orientado a la revisión.
Related MCP server: video-editor
Cómo funciona
flowchart LR
A[Source video] --> B[ASR + visual evidence]
B --> C[Transcript / Timeline context]
C --> D[LLM proposes EditingStrategy]
D --> E{User approves?}
E -- no --> D
E -- yes --> F[Structured EditPlan]
F --> G[Validate + Diff + Apply]
G --> H[Immutable Version]
H --> I[Preview render]
I --> J{Review}
J -- feedback --> K[EditPatch or Replan]
K --> G
J -- approve --> L[Final export]Una interacción típica se ve así:
Import interview.mp4
↓
"剪成一分钟,开头抓人,删掉废话"
↓
Agent proposes a hook-first strategy
↓
User approves
↓
Runtime validates and applies an EditPlan
↓
Preview
↓
"前 20 秒还是太慢"
↓
Minimal EditPatch → new Version → new preview
↓
Final approval → exportCapacidades principales
Área | Qué está implementado |
Modelo de edición duradero | Timeline de microsegundos enteros, EditPlan y EditPatch de primera clase, Versiones inmutables, persistencia atómica y bloqueo por proyecto |
Flujo de aprobación | Propuesta de estrategia → aprobación → validación del plan → vista previa → retroalimentación → diagnóstico/replanificación → aprobación final → exportación |
Planificación estructurada | Salida LLM restringida por JSON-Schema, validación independiente con Zod, reintentos de reparación, procedencia de llamadas al proveedor y cancelación |
Edición basada en transcripción | Palabras/segmentos con marca de tiempo, hablantes, procedencia de alineación, búsqueda en transcripción y contexto de timeline legible por LLM |
Voz y habla | ASR/TTS local y alojado, narración generada, ajuste de duración, clonación/diseño autorizado de VoiceProfile, doblaje y procedencia |
Evidencia visual | Inspección de tomas/fotogramas clave bajo demanda en lugar de subir todo el vídeo fuente a un modelo |
Renderizado | Renderizador de vista previa/final con FFmpeg detrás de un contrato de capacidades; sin cadenas de shell escritas por el agente |
Trabajos duraderos | Concurrencia limitada, eventos de progreso, clasificación de reintentos, cancelación, idempotencia y recuperación tras reinicio |
Evaluación | Evaluaciones CI deterministas más aceptación opcional con proveedores reales de ASR/LLM/TTS/clonación de voz y agregación de benchmarks |
Voz y habla
El habla es un subsistema de edición de primera clase, no un complemento de subtítulos. ASR produce el timeline semántico utilizado por el editor; las salidas de TTS y VoiceProfile se convierten en activos explícitos del proyecto y clips del timeline.
ASR
Proveedor / runtime | Ejecución | Mejor ajuste | Notas |
faster-whisper | Local | ASR local generalista maduro | Línea base local ligera |
Qwen3-ASR | Local | Transcripción china, multilingüe y local de alta calidad | Usa alineación de marcas de tiempo para una salida segura para edición |
OpenAI transcription | API alojada | Transcripción en la nube con tu propia clave (BYOK) | Admite modo de segmentos diarizados o marcas de tiempo de palabras de Whisper según el modelo |
WhisperX | Local, enriquecimiento opcional | Alineación / diarización | Fusiona palabras alineadas e intervalos de hablante de nuevo en el Transcript canónico |
TTS e identidad de voz
Proveedor / runtime | Ejecución | Capacidades |
Kokoro | Local | TTS ligero con voces predefinidas |
Qwen3-TTS | Local | TTS, diseño de voz, clonación de voz autorizada zero-shot, reutilización entre idiomas |
OpenAI speech | API alojada | TTS alojado / voces del proveedor |
La clonación de voz nunca es automática. Un VoiceProfile clonado requiere evidencia de autorización explícita, una referencia verificada por calidad y—donde el proveedor lo admita—un rango de referencia exacto respaldado por transcripción. El material multimedia con varios hablantes no se adivina en silencio.
El código de los modelos, los pesos, los activos de voz y las API alojadas pueden tener licencias o términos comerciales diferentes. Consulta investigación de modelos de voz e identidad de voz antes de implementar una configuración de proveedor.
Agente y MCP
Todas las superficies públicas son adaptadores delgados sobre el mismo VideoAgentCore; no mantienen modelos de proyecto o timeline separados.
Superficie | Punto de entrada | Caso de uso |
CLI |
| Desarrollo local, scripting, depuración y control explícito del flujo de trabajo |
Project MCP |
| Superficie de herramientas de edición completa con ámbito de proyecto para Claude Code, Codex y otros clientes MCP |
Speech MCP |
| Flujos de trabajo ligeros de ASR → LLM estructurado → TTS sin construir el grafo de edición completo |
Agent Skill | Flujo de trabajo de agente recomendado, reglas de revisión y límites de seguridad | |
Control API | Superficie de control HTTP local estrecha con autenticación por bearer | |
Mobile Host | Prototipo de host nativo sin servidor que usa los mismos contratos de dominio/runtime |
Conectar Claude Code / Codex
Compila el repositorio y luego apunta un cliente compatible con MCP al servidor stdio:
npm install
npm run buildmcp.example.json contiene una forma de configuración mínima. Los secretos del proveedor se leen del entorno o del almacenamiento seguro del host y nunca se escriben en el JSON del proyecto.
Inicio rápido
Requisitos
Node.js 22+
FFmpeg / FFprobe para renderizado de medios reales
Entorno Python opcional para modelos de voz locales
Instalar y verificar
npm install
npm run typecheck
npm test
npm run build
npm run smoke:mcp
npm run demonpm run demo crea material fuente sintético localmente y ejecuta el flujo de trabajo real del proyecto a través de transcripción → estrategia → versiones → vistas previas → parche de retroalimentación → narración → exportación final con FFmpeg.
Comprueba la máquina actual sin hacer una llamada de modelo de pago:
npm run cli -- doctorConfigurar proveedores
Copia los valores relevantes de .env.example a tu entorno.
# Workspace
VIDEO_AGENT_WORKSPACE=./video-projects
# Planner
VIDEO_AGENT_PLANNER=openai
OPENAI_MODEL=gpt-5.4-mini
OPENAI_API_KEY=...
# Local ASR example
VIDEO_AGENT_ASR=qwen3-asr
VIDEO_AGENT_ASR_MODEL=Qwen/Qwen3-ASR-0.6B
# Local TTS / voice example
VIDEO_AGENT_TTS=qwen3-tts
VIDEO_AGENT_TTS_MODEL=Qwen/Qwen3-TTS-12Hz-0.6B-Base
VIDEO_AGENT_PYTHON=pythonOtras opciones compatibles están documentadas directamente en .env.example.
Validación con proveedores reales
La CI normal no descarga intencionalmente modelos de voz grandes ni usa credenciales de pago. Los proveedores reales se verifican mediante un arnés de aceptación explícito:
VIDEO_AGENT_REAL_ACCEPTANCE=true \
VIDEO_AGENT_ASR=qwen3-asr \
VIDEO_AGENT_PLANNER=openai \
VIDEO_AGENT_TTS=qwen3-tts \
OPENAI_API_KEY=... \
npm run eval:speech-realEl arnés registra la latencia real de cada etapa, el factor de tiempo real de ASR/TTS, los metadatos del proveedor/modelo, el RSS del controlador Node y la memoria GPU aproximada cuando está disponible. La aceptación de clonación de voz autorizada debe habilitarse por separado y no puede ejecutarse silenciosamente contra un hablante arbitrario.
Después de varias ejecuciones, agrega resultados comparables con:
npm run benchmark:speech-summaryConsulta aceptación de voz real, benchmarks e investigación de modelos de voz.
Host móvil
El objetivo móvil está diseñado en torno a una arquitectura local-first, sin servidor de aplicaciones:
Mobile App
├── VideoAgentCore
├── durable ProjectRepository
├── Workflow / Job Queue
├── Timeline / EditPatch / Version
├── native media adapters
└── direct BYOK provider access when configuredEl material fuente permanece en el dispositivo por defecto; los proveedores remotos reciben solo el ContextPack/evidencia aprobados necesarios para la inferencia. Las credenciales de API se referencian a través del almacenamiento seguro del host en lugar del JSON del proyecto.
[!WARNING] La implementación actual de iOS/Android sigue siendo un prototipo de host nativo a nivel de código fuente. Los contratos de TypeScript/móvil se verifican en CI, pero las compilaciones nativas de Xcode/Gradle, la corrección de medios en dispositivos físicos, el comportamiento térmico y la fiabilidad de la exportación en segundo plano aún requieren la pasada de validación de dispositivos documentada.
Comienza en docs/mobile/README.md y estado del host nativo.
Arquitectura
Agent / CLI / MCP / Mobile
│
▼
VideoAgentCore
│
┌─────────────────┼──────────────────┐
▼ ▼ ▼
Workflow ProjectStore Job Queue
│ │ │
└──────────┬──────┴──────────┬──────┘
▼ ▼
Edit / Timeline Provider contracts
│ │
Version / Diff ASR / LLM / TTS
│ │
└────────┬────────┘
▼
Renderer
│
Preview
│
Review / ExportEl invariante principal es simple: el runtime posee el estado; los modelos proponen cambios estructurados.
Para los límites de paquetes, el diseño de persistencia y la semántica de recuperación, lee architecture.md.
Documentación y desarrollo
El README es el punto de entrada del producto. Los detalles técnicos viven en docs/.
Tema | Documento |
Arquitectura y estado duradero | |
Seguridad y manejo de secretos | |
Speech MCP | |
Panorama de modelos de voz | |
Identidad de voz y clonación | |
Aceptación con proveedores reales | |
Benchmarks | |
Host móvil | |
Investigación previa / upstream | |
Historial de versiones |
Estado del proyecto
El runtime de Node es la ruta principal verificada: CLI, MCP, estado de proyecto duradero, renderizado con FFmpeg, trabajos, evaluación determinista, adaptadores de proveedores de voz y herramientas de aceptación con proveedores reales están implementados y cubiertos por CI donde no requieren pesos de modelos externos o credenciales de pago.
La calidad real del modelo local, la latencia, la VRAM y el comportamiento del modelo alojado deben medirse aún en la máquina de destino mediante el arnés de aceptación opcional; el CI no finge que esas ejecuciones ocurrieron.
El host móvil sigue siendo un prototipo a nivel de código fuente hasta que se completen la compilación nativa y la validación en dispositivos reales.
Principios de seguridad
Los agentes nunca reciben ejecución arbitraria de shell a través de la API de edición.
Las cadenas FFmpeg sin procesar no son estado de edición autoritativo.
Las claves de API nunca se persisten en el JSON del proyecto, los registros de ProviderCall ni los informes de referencia.
El material de origen permanece local a menos que un flujo de trabajo autorice explícitamente la evidencia remota.
La clonación de voz requiere autorización explícita y procedencia.
Las capacidades no compatibles del renderizador/proveedor fallan explícitamente en lugar de degradarse silenciosamente.
Consulte docs/security.md para conocer el límite completo.
Licencia
MIT. Consulte LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityFmaintenanceEnables video editing operations such as trimming, merging, adding audio/text/effects, and exporting via MCP protocol, leveraging CapCut core functionalities.92
- AlicenseNot gradedqualityBmaintenanceAn MCP server for programmatic video editing using ffmpeg, enabling draft creation and refinement via natural language.5ISC
- AlicenseNot gradedqualityAmaintenanceProvides a headless video editing workflow using portable JSON projects and Kdenlive for review, enabling automated video rendering and project management.5Apache 2.0
- AlicenseNot gradedqualityBmaintenanceA real video editor for AI agents, served over MCP, enabling journaled timeline editing, rendering via FFmpeg/MLT, and deterministic CLI operation.MIT
Related MCP Connectors
MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.
A real timeline video editor for AI agents: journaled edits, FFmpeg/MLT rendering, exports
MCP server for generating rough-draft project plans from natural-language prompts.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/YansIlinta/video-agent-runtime'
If you have feedback or need assistance with the MCP directory API, please join our Discord server