Skip to main content
Glama

Video Agent Runtime

Agent-native Videobearbeitung, aufgebaut auf dauerhaften Plänen, überprüfbaren Versionen und deterministischem Rendering.

Video als strukturierte Daten bearbeiten – nicht als undurchsichtige Shell-Befehle.

CI License: MIT Node.js TypeScript

Schnellstart · Agent & MCP · Sprache & Stimme · Mobil · Dokumentation · Benchmarks

Was ist das?

Video Agent Runtime ist eine Headless-Bearbeitungs-Engine für Agenten wie Claude Code, Codex oder jeden MCP-fähigen Client.

Anstatt ein Modell direkt FFmpeg-Befehle erstellen zu lassen, wandelt es Medien in dauerhafte Projektdaten um:

Transkript → EditingStrategy → EditPlan / EditPatch → Timeline → Version → Vorschau → Freigabe → Export

Das Modell entscheidet, was sich ändern soll. Die Runtime validiert, ob diese Änderung zulässig ist, wendet sie transaktional an, rendert das Ergebnis und hält jede Mutation überprüfbar und umkehrbar.

Es ist in erster Linie für Talking-Head-Videos, Interviews, Podcasts, Vorlesungen, Bildschirmaufnahmen und Workflows von Langform zu Kurzform konzipiert.

[!NOTE] Dies ist kein Desktop-NLE und versucht nicht, Premiere oder CapCut zu reproduzieren. Die primäre Schnittstelle ist ein Agent, CLI, MCP-Client oder ein review-orientierter mobiler Host.

Related MCP server: video-editor

So funktioniert es

flowchart LR
    A[Source video] --> B[ASR + visual evidence]
    B --> C[Transcript / Timeline context]
    C --> D[LLM proposes EditingStrategy]
    D --> E{User approves?}
    E -- no --> D
    E -- yes --> F[Structured EditPlan]
    F --> G[Validate + Diff + Apply]
    G --> H[Immutable Version]
    H --> I[Preview render]
    I --> J{Review}
    J -- feedback --> K[EditPatch or Replan]
    K --> G
    J -- approve --> L[Final export]

Eine typische Interaktion sieht so aus:

Import interview.mp4
↓
"剪成一分钟,开头抓人,删掉废话"
↓
Agent proposes a hook-first strategy
↓
User approves
↓
Runtime validates and applies an EditPlan
↓
Preview
↓
"前 20 秒还是太慢"
↓
Minimal EditPatch → new Version → new preview
↓
Final approval → export

Kernfunktionen

Bereich

Was implementiert ist

Dauerhaftes Bearbeitungsmodell

Integer-Mikrosekunden-Timeline, erstklassiger EditPlan und EditPatch, unveränderliche Versionen, atomare Persistenz und projektspezifische Sperren

Freigabe-Workflow

Strategievorschlag → Freigabe → Planvalidierung → Vorschau → Feedback → Diagnose/Neuplanung → endgültige Freigabe → Export

Strukturierte Planung

JSON-Schema-beschränkte LLM-Ausgabe, unabhängige Zod-Validierung, Reparatur-Wiederholungen, Provider-Aufruf-Herkunft und Abbruch

Transkript-zentrierte Bearbeitung

Zeitgestempelte Wörter/Segmente, Sprecher, Ausrichtungs-Herkunft, Transkriptsuche und LLM-lesbarer Timeline-Kontext

Sprache & Stimme

Lokale und gehostete ASR/TTS, generierte Erzählung, Daueranpassung, autorisiertes VoiceProfile-Klonen/Design, Synchronisation und Herkunft

Visuelle Beweise

On-Demand-Shot/Keyframe-Inspektion anstatt das gesamte Quellvideo an ein Modell hochzuladen

Rendering

FFmpeg-Vorschau/End-Renderer hinter einem Fähigkeitsvertrag; keine vom Agenten verfassten Shell-Strings

Dauerhafte Jobs

Begrenzte Parallelität, Fortschrittsereignisse, Wiederholungsklassifizierung, Abbruch, Idempotenz und Neustart-Wiederherstellung

Evaluierung

Deterministische CI-Evaluierungen plus optionale echte Provider-ASR/LLM/TTS/Stimmklon-Abnahme und Benchmark-Aggregation

Sprache & Stimme

Sprache ist ein erstklassiges Bearbeitungssubsystem, kein Untertitel-Add-on. ASR erzeugt die semantische Timeline, die der Editor verwendet; TTS- und VoiceProfile-Ausgaben werden zu expliziten Projekt-Assets und Timeline-Clips.

ASR

Provider / Runtime

Ausführung

Beste Eignung

Hinweise

faster-whisper

Lokal

Ausgereifte allgemeine lokale ASR

Leichtgewichtige lokale Basislinie

Qwen3-ASR

Lokal

Chinesisch, mehrsprachig und lokale hochwertige Transkription

Verwendet Zeitstempel-Ausrichtung für bearbeitungssichere Ausgabe

OpenAI-Transkription

Gehostete API

BYOK-Cloud-Transkription

Unterstützt diarisierte Segmentmodus oder Whisper-Wort-Zeitstempel je nach Modell

WhisperX

Lokal, optionale Anreicherung

Ausrichtung / Diarisierung

Führt ausgerichtete Wörter und Sprecherintervalle zurück in das kanonische Transkript

TTS und Stimmidentität

Provider / Runtime

Ausführung

Fähigkeiten

Kokoro

Lokal

Leichtgewichtiges Preset-TTS

Qwen3-TTS

Lokal

TTS, Voice Design, autorisiertes Zero-Shot-Stimmklonen, sprachübergreifende Wiederverwendung

OpenAI-Sprache

Gehostete API

Gehostetes TTS / Provider-Stimmen

Stimmklonen ist niemals automatisch. Ein geklontes VoiceProfile erfordert explizite Autorisierungsnachweise, eine qualitätsgeprüfte Referenz und – wo der Provider dies unterstützt – einen exakten transkriptgestützten Referenzbereich. Mehrsprachige Medien werden nicht stillschweigend erraten.

Modellcode, Gewichte, Stimm-Assets und gehostete APIs können unterschiedliche Lizenzen oder kommerzielle Bedingungen haben. Siehe Sprachmodell-Forschung und Stimmidentität, bevor Sie eine Provider-Konfiguration ausliefern.

Agent & MCP

Alle öffentlichen Oberflächen sind dünne Adapter über derselben VideoAgentCore; sie führen keine separaten Projekt- oder Timelinemodelle.

Oberfläche

Einstiegspunkt

Anwendungsfall

CLI

video-agent

Lokale Entwicklung, Skripterstellung, Debugging und explizite Workflow-Steuerung

Projekt-MCP

video-agent-mcp

Vollständige projektspezifische Bearbeitungswerkzeug-Oberfläche für Claude Code, Codex und andere MCP-Clients

Sprach-MCP

video-agent-speech-mcp

Leichtgewichtige ASR → strukturierte LLM → TTS-Workflows ohne Aufbau des vollständigen Bearbeitungsgraphen

Agent-Fähigkeit

skills/video-editing/SKILL.md

Empfohlener Agent-Workflow, Überprüfungsregeln und Sicherheitsgrenzen

Control-API

docs/control-api.md

Schmale, bearer-authentifizierte lokale HTTP-Steuerungsoberfläche

Mobiler Host

docs/mobile/

Serverloser nativer Host-Prototyp mit denselben Domänen-/Runtime-Verträgen

Claude Code / Codex verbinden

Erstellen Sie das Repository und zeigen Sie dann einen MCP-fähigen Client auf den stdio-Server:

npm install
npm run build

mcp.example.json enthält eine minimale Konfigurationsform. Provider-Geheimnisse werden aus der Umgebung oder sicherem Host-Speicher gelesen und niemals in Projekt-JSON geschrieben.

Schnellstart

Anforderungen

  • Node.js 22+

  • FFmpeg / FFprobe für echtes Medien-Rendering

  • Optionale Python-Umgebung für lokale Sprachmodelle

Installieren und verifizieren

npm install
npm run typecheck
npm test
npm run build
npm run smoke:mcp
npm run demo

npm run demo erstellt synthetisches Quellmaterial lokal und treibt den echten Projekt-Workflow durch Transkript → Strategie → Versionen → Vorschauen → Feedback-Patch → Erzählung → endgültigen FFmpeg-Export.

Überprüfen Sie die aktuelle Maschine, ohne einen kostenpflichtigen Modellaufruf zu tätigen:

npm run cli -- doctor

Provider konfigurieren

Kopieren Sie die relevanten Werte aus .env.example in Ihre Umgebung.

# Workspace
VIDEO_AGENT_WORKSPACE=./video-projects

# Planner
VIDEO_AGENT_PLANNER=openai
OPENAI_MODEL=gpt-5.4-mini
OPENAI_API_KEY=...

# Local ASR example
VIDEO_AGENT_ASR=qwen3-asr
VIDEO_AGENT_ASR_MODEL=Qwen/Qwen3-ASR-0.6B

# Local TTS / voice example
VIDEO_AGENT_TTS=qwen3-tts
VIDEO_AGENT_TTS_MODEL=Qwen/Qwen3-TTS-12Hz-0.6B-Base
VIDEO_AGENT_PYTHON=python

Andere unterstützte Optionen sind direkt in .env.example dokumentiert.

Validierung mit echten Providern

Normale CI lädt absichtlich keine großen Sprachmodelle herunter und verwendet keine kostenpflichtigen Anmeldeinformationen. Echte Provider werden über eine explizite Abnahme-Harness verifiziert:

VIDEO_AGENT_REAL_ACCEPTANCE=true \
VIDEO_AGENT_ASR=qwen3-asr \
VIDEO_AGENT_PLANNER=openai \
VIDEO_AGENT_TTS=qwen3-tts \
OPENAI_API_KEY=... \
npm run eval:speech-real

Die Harness zeichnet echte Stufen-Latenz, ASR/TTS-Echtzeitfaktor, Provider-/Modell-Metadaten, Node-Controller-RSS und grobe GPU-Speichernutzung auf, wenn verfügbar. Autorisierte Stimmklon-Abnahme muss separat aktiviert werden und kann nicht stillschweigend gegen einen beliebigen Sprecher laufen.

Nach mehreren Läufen aggregieren Sie vergleichbare Ergebnisse mit:

npm run benchmark:speech-summary

Siehe Echte Sprach-Abnahme, Benchmarks und Sprachmodell-Forschung.

Mobiler Host

Das mobile Ziel ist um eine lokale, serverlose Architektur herum konzipiert:

Mobile App
  ├── VideoAgentCore
  ├── durable ProjectRepository
  ├── Workflow / Job Queue
  ├── Timeline / EditPatch / Version
  ├── native media adapters
  └── direct BYOK provider access when configured

Quellmedien bleiben standardmäßig auf dem Gerät; Remote-Provider erhalten nur den genehmigten ContextPack/Evidenz, der für die Inferenz erforderlich ist. API-Anmeldeinformationen werden über sicheren Host-Speicher referenziert, nicht über Projekt-JSON.

[!WARNING] Die aktuelle iOS/Android-Implementierung ist noch ein nativer Host-Prototyp auf Quellcode-Ebene. TypeScript/Mobile-Verträge werden in CI geprüft, aber native Xcode/Gradle-Builds, Medienkorrektheit auf physischen Geräten, thermisches Verhalten und Zuverlässigkeit des Hintergrund-Exports erfordern weiterhin den dokumentierten Gerätevalidierungsdurchlauf.

Beginnen Sie bei docs/mobile/README.md und Status des nativen Hosts.

Architektur

                 Agent / CLI / MCP / Mobile
                          │
                          ▼
                    VideoAgentCore
                          │
        ┌─────────────────┼──────────────────┐
        ▼                 ▼                  ▼
     Workflow          ProjectStore       Job Queue
        │                 │                  │
        └──────────┬──────┴──────────┬──────┘
                   ▼                 ▼
              Edit / Timeline    Provider contracts
                   │                 │
             Version / Diff     ASR / LLM / TTS
                   │                 │
                   └────────┬────────┘
                            ▼
                         Renderer
                            │
                         Preview
                            │
                      Review / Export

Die Hauptinvariante ist einfach: Die Runtime besitzt den Zustand; Modelle schlagen strukturierte Änderungen vor.

Für Paketgrenzen, Persistenzlayout und Wiederherstellungssemantik lesen Sie architecture.md.

Dokumentation & Entwicklung

Die README ist der Produkteinstiegspunkt. Technische Details finden Sie unter docs/.

Thema

Dokument

Architektur und dauerhafter Zustand

docs/architecture.md

Sicherheit und Geheimnisbehandlung

docs/security.md

Sprach-MCP

docs/speech-mcp.md

Sprachmodell-Landschaft

docs/speech-models-2026.md

Stimmidentität und Klonen

docs/voice-identity.md

Abnahme mit echten Providern

docs/real-speech-acceptance.md

Benchmarks

docs/benchmarks.md

Mobiler Host

docs/mobile/README.md

Vorarbeiten / Upstream-Forschung

docs/upstream-study.md

Versionshistorie

CHANGELOG.md

Projektstatus

Die Node-Runtime ist der verifizierte primäre Pfad: CLI, MCP, dauerhafter Projektzustand, FFmpeg-Rendering, Jobs, deterministische Evaluierung, Sprachprovider-Adapter und Abnahme-Tooling für echte Provider sind implementiert und durch CI abgedeckt, wo sie keine externen Modellgewichte oder kostenpflichtigen Anmeldeinformationen erfordern.

Die tatsächliche Qualität lokaler Modelle, Latenz, VRAM und das Verhalten gehosteter Modelle müssen weiterhin auf dem Zielgerät über das Opt-in-Abnahme-Framework gemessen werden; CI gibt nicht vor, dass diese Läufe stattgefunden haben.

Der mobile Host bleibt ein Prototyp auf Quellcode-Ebene, bis die native Kompilierung und die Validierung auf echten Geräten abgeschlossen sind.

Sicherheitsprinzipien

  • Agents erhalten niemals beliebige Shell-Ausführung über die Bearbeitungs-API.

  • Rohe FFmpeg-Zeichenfolgen sind kein maßgeblicher Bearbeitungszustand.

  • API-Schlüssel werden niemals in Projekt-JSON, ProviderCall-Datensätzen oder Benchmark-Berichten gespeichert.

  • Quellmedien bleiben lokal, sofern ein Workflow nicht ausdrücklich Remote-Nachweise autorisiert.

  • Sprachklonen erfordert ausdrückliche Autorisierung und Herkunftsnachweis.

  • Nicht unterstützte Renderer-/Provider-Funktionen schlagen explizit fehl, anstatt stillschweigend zu degradieren.

Siehe docs/security.md für die vollständige Abgrenzung.

Lizenz

MIT. Siehe LICENSE.

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • F
    license
    Not graded
    quality
    F
    maintenance
    Enables video editing operations such as trimming, merging, adding audio/text/effects, and exporting via MCP protocol, leveraging CapCut core functionalities.
    92
  • A
    license
    Not graded
    quality
    A
    maintenance
    Provides a headless video editing workflow using portable JSON projects and Kdenlive for review, enabling automated video rendering and project management.
    5
    Apache 2.0

View all related MCP servers

Related MCP Connectors

  • MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.

  • A real timeline video editor for AI agents: journaled edits, FFmpeg/MLT rendering, exports

  • MCP server for generating rough-draft project plans from natural-language prompts.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/YansIlinta/video-agent-runtime'

If you have feedback or need assistance with the MCP directory API, please join our Discord server