Skip to main content
Glama

Video Agent Runtime

Edición de vídeo nativa para agentes, construida sobre planes duraderos, versiones revisables y renderizado determinista.

Edita vídeo como datos estructurados, no como comandos de shell opacos.

CI License: MIT Node.js TypeScript

Inicio rápido · Agente y MCP · Voz y habla · Móvil · Documentación · Benchmarks

¿Qué es?

Video Agent Runtime es un motor de edición sin interfaz gráfica para agentes como Claude Code, Codex o cualquier cliente compatible con MCP.

En lugar de permitir que un modelo genere directamente comandos de FFmpeg, convierte el material multimedia en datos de proyecto duraderos:

Transcript → EditingStrategy → EditPlan / EditPatch → Timeline → Version → Preview → Approval → Export

El modelo decide qué debería cambiar. El runtime valida si ese cambio está permitido, lo aplica de forma transaccional, renderiza el resultado y mantiene cada mutación revisable y reversible.

Está diseñado principalmente para vídeos de persona hablando, entrevistas, podcasts, conferencias, grabaciones de pantalla y flujos de formato largo a formato corto.

[!NOTE] Esto no es un NLE de escritorio y no intenta reproducir Premiere o CapCut. La interfaz principal es un agente, CLI, cliente MCP o host móvil orientado a la revisión.

Related MCP server: video-editor

Cómo funciona

flowchart LR
    A[Source video] --> B[ASR + visual evidence]
    B --> C[Transcript / Timeline context]
    C --> D[LLM proposes EditingStrategy]
    D --> E{User approves?}
    E -- no --> D
    E -- yes --> F[Structured EditPlan]
    F --> G[Validate + Diff + Apply]
    G --> H[Immutable Version]
    H --> I[Preview render]
    I --> J{Review}
    J -- feedback --> K[EditPatch or Replan]
    K --> G
    J -- approve --> L[Final export]

Una interacción típica se ve así:

Import interview.mp4
↓
"剪成一分钟,开头抓人,删掉废话"
↓
Agent proposes a hook-first strategy
↓
User approves
↓
Runtime validates and applies an EditPlan
↓
Preview
↓
"前 20 秒还是太慢"
↓
Minimal EditPatch → new Version → new preview
↓
Final approval → export

Capacidades principales

Área

Qué está implementado

Modelo de edición duradero

Timeline de microsegundos enteros, EditPlan y EditPatch de primera clase, Versiones inmutables, persistencia atómica y bloqueo por proyecto

Flujo de aprobación

Propuesta de estrategia → aprobación → validación del plan → vista previa → retroalimentación → diagnóstico/replanificación → aprobación final → exportación

Planificación estructurada

Salida LLM restringida por JSON-Schema, validación independiente con Zod, reintentos de reparación, procedencia de llamadas al proveedor y cancelación

Edición basada en transcripción

Palabras/segmentos con marca de tiempo, hablantes, procedencia de alineación, búsqueda en transcripción y contexto de timeline legible por LLM

Voz y habla

ASR/TTS local y alojado, narración generada, ajuste de duración, clonación/diseño autorizado de VoiceProfile, doblaje y procedencia

Evidencia visual

Inspección de tomas/fotogramas clave bajo demanda en lugar de subir todo el vídeo fuente a un modelo

Renderizado

Renderizador de vista previa/final con FFmpeg detrás de un contrato de capacidades; sin cadenas de shell escritas por el agente

Trabajos duraderos

Concurrencia limitada, eventos de progreso, clasificación de reintentos, cancelación, idempotencia y recuperación tras reinicio

Evaluación

Evaluaciones CI deterministas más aceptación opcional con proveedores reales de ASR/LLM/TTS/clonación de voz y agregación de benchmarks

Voz y habla

El habla es un subsistema de edición de primera clase, no un complemento de subtítulos. ASR produce el timeline semántico utilizado por el editor; las salidas de TTS y VoiceProfile se convierten en activos explícitos del proyecto y clips del timeline.

ASR

Proveedor / runtime

Ejecución

Mejor ajuste

Notas

faster-whisper

Local

ASR local generalista maduro

Línea base local ligera

Qwen3-ASR

Local

Transcripción china, multilingüe y local de alta calidad

Usa alineación de marcas de tiempo para una salida segura para edición

OpenAI transcription

API alojada

Transcripción en la nube con tu propia clave (BYOK)

Admite modo de segmentos diarizados o marcas de tiempo de palabras de Whisper según el modelo

WhisperX

Local, enriquecimiento opcional

Alineación / diarización

Fusiona palabras alineadas e intervalos de hablante de nuevo en el Transcript canónico

TTS e identidad de voz

Proveedor / runtime

Ejecución

Capacidades

Kokoro

Local

TTS ligero con voces predefinidas

Qwen3-TTS

Local

TTS, diseño de voz, clonación de voz autorizada zero-shot, reutilización entre idiomas

OpenAI speech

API alojada

TTS alojado / voces del proveedor

La clonación de voz nunca es automática. Un VoiceProfile clonado requiere evidencia de autorización explícita, una referencia verificada por calidad y—donde el proveedor lo admita—un rango de referencia exacto respaldado por transcripción. El material multimedia con varios hablantes no se adivina en silencio.

El código de los modelos, los pesos, los activos de voz y las API alojadas pueden tener licencias o términos comerciales diferentes. Consulta investigación de modelos de voz e identidad de voz antes de implementar una configuración de proveedor.

Agente y MCP

Todas las superficies públicas son adaptadores delgados sobre el mismo VideoAgentCore; no mantienen modelos de proyecto o timeline separados.

Superficie

Punto de entrada

Caso de uso

CLI

video-agent

Desarrollo local, scripting, depuración y control explícito del flujo de trabajo

Project MCP

video-agent-mcp

Superficie de herramientas de edición completa con ámbito de proyecto para Claude Code, Codex y otros clientes MCP

Speech MCP

video-agent-speech-mcp

Flujos de trabajo ligeros de ASR → LLM estructurado → TTS sin construir el grafo de edición completo

Agent Skill

skills/video-editing/SKILL.md

Flujo de trabajo de agente recomendado, reglas de revisión y límites de seguridad

Control API

docs/control-api.md

Superficie de control HTTP local estrecha con autenticación por bearer

Mobile Host

docs/mobile/

Prototipo de host nativo sin servidor que usa los mismos contratos de dominio/runtime

Conectar Claude Code / Codex

Compila el repositorio y luego apunta un cliente compatible con MCP al servidor stdio:

npm install
npm run build

mcp.example.json contiene una forma de configuración mínima. Los secretos del proveedor se leen del entorno o del almacenamiento seguro del host y nunca se escriben en el JSON del proyecto.

Inicio rápido

Requisitos

  • Node.js 22+

  • FFmpeg / FFprobe para renderizado de medios reales

  • Entorno Python opcional para modelos de voz locales

Instalar y verificar

npm install
npm run typecheck
npm test
npm run build
npm run smoke:mcp
npm run demo

npm run demo crea material fuente sintético localmente y ejecuta el flujo de trabajo real del proyecto a través de transcripción → estrategia → versiones → vistas previas → parche de retroalimentación → narración → exportación final con FFmpeg.

Comprueba la máquina actual sin hacer una llamada de modelo de pago:

npm run cli -- doctor

Configurar proveedores

Copia los valores relevantes de .env.example a tu entorno.

# Workspace
VIDEO_AGENT_WORKSPACE=./video-projects

# Planner
VIDEO_AGENT_PLANNER=openai
OPENAI_MODEL=gpt-5.4-mini
OPENAI_API_KEY=...

# Local ASR example
VIDEO_AGENT_ASR=qwen3-asr
VIDEO_AGENT_ASR_MODEL=Qwen/Qwen3-ASR-0.6B

# Local TTS / voice example
VIDEO_AGENT_TTS=qwen3-tts
VIDEO_AGENT_TTS_MODEL=Qwen/Qwen3-TTS-12Hz-0.6B-Base
VIDEO_AGENT_PYTHON=python

Otras opciones compatibles están documentadas directamente en .env.example.

Validación con proveedores reales

La CI normal no descarga intencionalmente modelos de voz grandes ni usa credenciales de pago. Los proveedores reales se verifican mediante un arnés de aceptación explícito:

VIDEO_AGENT_REAL_ACCEPTANCE=true \
VIDEO_AGENT_ASR=qwen3-asr \
VIDEO_AGENT_PLANNER=openai \
VIDEO_AGENT_TTS=qwen3-tts \
OPENAI_API_KEY=... \
npm run eval:speech-real

El arnés registra la latencia real de cada etapa, el factor de tiempo real de ASR/TTS, los metadatos del proveedor/modelo, el RSS del controlador Node y la memoria GPU aproximada cuando está disponible. La aceptación de clonación de voz autorizada debe habilitarse por separado y no puede ejecutarse silenciosamente contra un hablante arbitrario.

Después de varias ejecuciones, agrega resultados comparables con:

npm run benchmark:speech-summary

Consulta aceptación de voz real, benchmarks e investigación de modelos de voz.

Host móvil

El objetivo móvil está diseñado en torno a una arquitectura local-first, sin servidor de aplicaciones:

Mobile App
  ├── VideoAgentCore
  ├── durable ProjectRepository
  ├── Workflow / Job Queue
  ├── Timeline / EditPatch / Version
  ├── native media adapters
  └── direct BYOK provider access when configured

El material fuente permanece en el dispositivo por defecto; los proveedores remotos reciben solo el ContextPack/evidencia aprobados necesarios para la inferencia. Las credenciales de API se referencian a través del almacenamiento seguro del host en lugar del JSON del proyecto.

[!WARNING] La implementación actual de iOS/Android sigue siendo un prototipo de host nativo a nivel de código fuente. Los contratos de TypeScript/móvil se verifican en CI, pero las compilaciones nativas de Xcode/Gradle, la corrección de medios en dispositivos físicos, el comportamiento térmico y la fiabilidad de la exportación en segundo plano aún requieren la pasada de validación de dispositivos documentada.

Comienza en docs/mobile/README.md y estado del host nativo.

Arquitectura

                 Agent / CLI / MCP / Mobile
                          │
                          ▼
                    VideoAgentCore
                          │
        ┌─────────────────┼──────────────────┐
        ▼                 ▼                  ▼
     Workflow          ProjectStore       Job Queue
        │                 │                  │
        └──────────┬──────┴──────────┬──────┘
                   ▼                 ▼
              Edit / Timeline    Provider contracts
                   │                 │
             Version / Diff     ASR / LLM / TTS
                   │                 │
                   └────────┬────────┘
                            ▼
                         Renderer
                            │
                         Preview
                            │
                      Review / Export

El invariante principal es simple: el runtime posee el estado; los modelos proponen cambios estructurados.

Para los límites de paquetes, el diseño de persistencia y la semántica de recuperación, lee architecture.md.

Documentación y desarrollo

El README es el punto de entrada del producto. Los detalles técnicos viven en docs/.

Tema

Documento

Arquitectura y estado duradero

docs/architecture.md

Seguridad y manejo de secretos

docs/security.md

Speech MCP

docs/speech-mcp.md

Panorama de modelos de voz

docs/speech-models-2026.md

Identidad de voz y clonación

docs/voice-identity.md

Aceptación con proveedores reales

docs/real-speech-acceptance.md

Benchmarks

docs/benchmarks.md

Host móvil

docs/mobile/README.md

Investigación previa / upstream

docs/upstream-study.md

Historial de versiones

CHANGELOG.md

Estado del proyecto

El runtime de Node es la ruta principal verificada: CLI, MCP, estado de proyecto duradero, renderizado con FFmpeg, trabajos, evaluación determinista, adaptadores de proveedores de voz y herramientas de aceptación con proveedores reales están implementados y cubiertos por CI donde no requieren pesos de modelos externos o credenciales de pago.

La calidad real del modelo local, la latencia, la VRAM y el comportamiento del modelo alojado deben medirse aún en la máquina de destino mediante el arnés de aceptación opcional; el CI no finge que esas ejecuciones ocurrieron.

El host móvil sigue siendo un prototipo a nivel de código fuente hasta que se completen la compilación nativa y la validación en dispositivos reales.

Principios de seguridad

  • Los agentes nunca reciben ejecución arbitraria de shell a través de la API de edición.

  • Las cadenas FFmpeg sin procesar no son estado de edición autoritativo.

  • Las claves de API nunca se persisten en el JSON del proyecto, los registros de ProviderCall ni los informes de referencia.

  • El material de origen permanece local a menos que un flujo de trabajo autorice explícitamente la evidencia remota.

  • La clonación de voz requiere autorización explícita y procedencia.

  • Las capacidades no compatibles del renderizador/proveedor fallan explícitamente en lugar de degradarse silenciosamente.

Consulte docs/security.md para conocer el límite completo.

Licencia

MIT. Consulte LICENSE.

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • F
    license
    Not graded
    quality
    F
    maintenance
    Enables video editing operations such as trimming, merging, adding audio/text/effects, and exporting via MCP protocol, leveraging CapCut core functionalities.
    92
  • A
    license
    Not graded
    quality
    A
    maintenance
    Provides a headless video editing workflow using portable JSON projects and Kdenlive for review, enabling automated video rendering and project management.
    5
    Apache 2.0

View all related MCP servers

Related MCP Connectors

  • MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.

  • A real timeline video editor for AI agents: journaled edits, FFmpeg/MLT rendering, exports

  • MCP server for generating rough-draft project plans from natural-language prompts.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/YansIlinta/video-agent-runtime'

If you have feedback or need assistance with the MCP directory API, please join our Discord server