video-agent-mcp
Video Agent Runtime
Agent-native Videobearbeitung, aufgebaut auf dauerhaften Plänen, überprüfbaren Versionen und deterministischem Rendering.
Video als strukturierte Daten bearbeiten – nicht als undurchsichtige Shell-Befehle.
Schnellstart · Agent & MCP · Sprache & Stimme · Mobil · Dokumentation · Benchmarks
Was ist das?
Video Agent Runtime ist eine Headless-Bearbeitungs-Engine für Agenten wie Claude Code, Codex oder jeden MCP-fähigen Client.
Anstatt ein Modell direkt FFmpeg-Befehle erstellen zu lassen, wandelt es Medien in dauerhafte Projektdaten um:
Transkript → EditingStrategy → EditPlan / EditPatch → Timeline → Version → Vorschau → Freigabe → Export
Das Modell entscheidet, was sich ändern soll. Die Runtime validiert, ob diese Änderung zulässig ist, wendet sie transaktional an, rendert das Ergebnis und hält jede Mutation überprüfbar und umkehrbar.
Es ist in erster Linie für Talking-Head-Videos, Interviews, Podcasts, Vorlesungen, Bildschirmaufnahmen und Workflows von Langform zu Kurzform konzipiert.
[!NOTE] Dies ist kein Desktop-NLE und versucht nicht, Premiere oder CapCut zu reproduzieren. Die primäre Schnittstelle ist ein Agent, CLI, MCP-Client oder ein review-orientierter mobiler Host.
Related MCP server: video-editor
So funktioniert es
flowchart LR
A[Source video] --> B[ASR + visual evidence]
B --> C[Transcript / Timeline context]
C --> D[LLM proposes EditingStrategy]
D --> E{User approves?}
E -- no --> D
E -- yes --> F[Structured EditPlan]
F --> G[Validate + Diff + Apply]
G --> H[Immutable Version]
H --> I[Preview render]
I --> J{Review}
J -- feedback --> K[EditPatch or Replan]
K --> G
J -- approve --> L[Final export]Eine typische Interaktion sieht so aus:
Import interview.mp4
↓
"剪成一分钟,开头抓人,删掉废话"
↓
Agent proposes a hook-first strategy
↓
User approves
↓
Runtime validates and applies an EditPlan
↓
Preview
↓
"前 20 秒还是太慢"
↓
Minimal EditPatch → new Version → new preview
↓
Final approval → exportKernfunktionen
Bereich | Was implementiert ist |
Dauerhaftes Bearbeitungsmodell | Integer-Mikrosekunden-Timeline, erstklassiger EditPlan und EditPatch, unveränderliche Versionen, atomare Persistenz und projektspezifische Sperren |
Freigabe-Workflow | Strategievorschlag → Freigabe → Planvalidierung → Vorschau → Feedback → Diagnose/Neuplanung → endgültige Freigabe → Export |
Strukturierte Planung | JSON-Schema-beschränkte LLM-Ausgabe, unabhängige Zod-Validierung, Reparatur-Wiederholungen, Provider-Aufruf-Herkunft und Abbruch |
Transkript-zentrierte Bearbeitung | Zeitgestempelte Wörter/Segmente, Sprecher, Ausrichtungs-Herkunft, Transkriptsuche und LLM-lesbarer Timeline-Kontext |
Sprache & Stimme | Lokale und gehostete ASR/TTS, generierte Erzählung, Daueranpassung, autorisiertes VoiceProfile-Klonen/Design, Synchronisation und Herkunft |
Visuelle Beweise | On-Demand-Shot/Keyframe-Inspektion anstatt das gesamte Quellvideo an ein Modell hochzuladen |
Rendering | FFmpeg-Vorschau/End-Renderer hinter einem Fähigkeitsvertrag; keine vom Agenten verfassten Shell-Strings |
Dauerhafte Jobs | Begrenzte Parallelität, Fortschrittsereignisse, Wiederholungsklassifizierung, Abbruch, Idempotenz und Neustart-Wiederherstellung |
Evaluierung | Deterministische CI-Evaluierungen plus optionale echte Provider-ASR/LLM/TTS/Stimmklon-Abnahme und Benchmark-Aggregation |
Sprache & Stimme
Sprache ist ein erstklassiges Bearbeitungssubsystem, kein Untertitel-Add-on. ASR erzeugt die semantische Timeline, die der Editor verwendet; TTS- und VoiceProfile-Ausgaben werden zu expliziten Projekt-Assets und Timeline-Clips.
ASR
Provider / Runtime | Ausführung | Beste Eignung | Hinweise |
faster-whisper | Lokal | Ausgereifte allgemeine lokale ASR | Leichtgewichtige lokale Basislinie |
Qwen3-ASR | Lokal | Chinesisch, mehrsprachig und lokale hochwertige Transkription | Verwendet Zeitstempel-Ausrichtung für bearbeitungssichere Ausgabe |
OpenAI-Transkription | Gehostete API | BYOK-Cloud-Transkription | Unterstützt diarisierte Segmentmodus oder Whisper-Wort-Zeitstempel je nach Modell |
WhisperX | Lokal, optionale Anreicherung | Ausrichtung / Diarisierung | Führt ausgerichtete Wörter und Sprecherintervalle zurück in das kanonische Transkript |
TTS und Stimmidentität
Provider / Runtime | Ausführung | Fähigkeiten |
Kokoro | Lokal | Leichtgewichtiges Preset-TTS |
Qwen3-TTS | Lokal | TTS, Voice Design, autorisiertes Zero-Shot-Stimmklonen, sprachübergreifende Wiederverwendung |
OpenAI-Sprache | Gehostete API | Gehostetes TTS / Provider-Stimmen |
Stimmklonen ist niemals automatisch. Ein geklontes VoiceProfile erfordert explizite Autorisierungsnachweise, eine qualitätsgeprüfte Referenz und – wo der Provider dies unterstützt – einen exakten transkriptgestützten Referenzbereich. Mehrsprachige Medien werden nicht stillschweigend erraten.
Modellcode, Gewichte, Stimm-Assets und gehostete APIs können unterschiedliche Lizenzen oder kommerzielle Bedingungen haben. Siehe Sprachmodell-Forschung und Stimmidentität, bevor Sie eine Provider-Konfiguration ausliefern.
Agent & MCP
Alle öffentlichen Oberflächen sind dünne Adapter über derselben VideoAgentCore; sie führen keine separaten Projekt- oder Timelinemodelle.
Oberfläche | Einstiegspunkt | Anwendungsfall |
CLI |
| Lokale Entwicklung, Skripterstellung, Debugging und explizite Workflow-Steuerung |
Projekt-MCP |
| Vollständige projektspezifische Bearbeitungswerkzeug-Oberfläche für Claude Code, Codex und andere MCP-Clients |
Sprach-MCP |
| Leichtgewichtige ASR → strukturierte LLM → TTS-Workflows ohne Aufbau des vollständigen Bearbeitungsgraphen |
Agent-Fähigkeit | Empfohlener Agent-Workflow, Überprüfungsregeln und Sicherheitsgrenzen | |
Control-API | Schmale, bearer-authentifizierte lokale HTTP-Steuerungsoberfläche | |
Mobiler Host | Serverloser nativer Host-Prototyp mit denselben Domänen-/Runtime-Verträgen |
Claude Code / Codex verbinden
Erstellen Sie das Repository und zeigen Sie dann einen MCP-fähigen Client auf den stdio-Server:
npm install
npm run buildmcp.example.json enthält eine minimale Konfigurationsform. Provider-Geheimnisse werden aus der Umgebung oder sicherem Host-Speicher gelesen und niemals in Projekt-JSON geschrieben.
Schnellstart
Anforderungen
Node.js 22+
FFmpeg / FFprobe für echtes Medien-Rendering
Optionale Python-Umgebung für lokale Sprachmodelle
Installieren und verifizieren
npm install
npm run typecheck
npm test
npm run build
npm run smoke:mcp
npm run demonpm run demo erstellt synthetisches Quellmaterial lokal und treibt den echten Projekt-Workflow durch Transkript → Strategie → Versionen → Vorschauen → Feedback-Patch → Erzählung → endgültigen FFmpeg-Export.
Überprüfen Sie die aktuelle Maschine, ohne einen kostenpflichtigen Modellaufruf zu tätigen:
npm run cli -- doctorProvider konfigurieren
Kopieren Sie die relevanten Werte aus .env.example in Ihre Umgebung.
# Workspace
VIDEO_AGENT_WORKSPACE=./video-projects
# Planner
VIDEO_AGENT_PLANNER=openai
OPENAI_MODEL=gpt-5.4-mini
OPENAI_API_KEY=...
# Local ASR example
VIDEO_AGENT_ASR=qwen3-asr
VIDEO_AGENT_ASR_MODEL=Qwen/Qwen3-ASR-0.6B
# Local TTS / voice example
VIDEO_AGENT_TTS=qwen3-tts
VIDEO_AGENT_TTS_MODEL=Qwen/Qwen3-TTS-12Hz-0.6B-Base
VIDEO_AGENT_PYTHON=pythonAndere unterstützte Optionen sind direkt in .env.example dokumentiert.
Validierung mit echten Providern
Normale CI lädt absichtlich keine großen Sprachmodelle herunter und verwendet keine kostenpflichtigen Anmeldeinformationen. Echte Provider werden über eine explizite Abnahme-Harness verifiziert:
VIDEO_AGENT_REAL_ACCEPTANCE=true \
VIDEO_AGENT_ASR=qwen3-asr \
VIDEO_AGENT_PLANNER=openai \
VIDEO_AGENT_TTS=qwen3-tts \
OPENAI_API_KEY=... \
npm run eval:speech-realDie Harness zeichnet echte Stufen-Latenz, ASR/TTS-Echtzeitfaktor, Provider-/Modell-Metadaten, Node-Controller-RSS und grobe GPU-Speichernutzung auf, wenn verfügbar. Autorisierte Stimmklon-Abnahme muss separat aktiviert werden und kann nicht stillschweigend gegen einen beliebigen Sprecher laufen.
Nach mehreren Läufen aggregieren Sie vergleichbare Ergebnisse mit:
npm run benchmark:speech-summarySiehe Echte Sprach-Abnahme, Benchmarks und Sprachmodell-Forschung.
Mobiler Host
Das mobile Ziel ist um eine lokale, serverlose Architektur herum konzipiert:
Mobile App
├── VideoAgentCore
├── durable ProjectRepository
├── Workflow / Job Queue
├── Timeline / EditPatch / Version
├── native media adapters
└── direct BYOK provider access when configuredQuellmedien bleiben standardmäßig auf dem Gerät; Remote-Provider erhalten nur den genehmigten ContextPack/Evidenz, der für die Inferenz erforderlich ist. API-Anmeldeinformationen werden über sicheren Host-Speicher referenziert, nicht über Projekt-JSON.
[!WARNING] Die aktuelle iOS/Android-Implementierung ist noch ein nativer Host-Prototyp auf Quellcode-Ebene. TypeScript/Mobile-Verträge werden in CI geprüft, aber native Xcode/Gradle-Builds, Medienkorrektheit auf physischen Geräten, thermisches Verhalten und Zuverlässigkeit des Hintergrund-Exports erfordern weiterhin den dokumentierten Gerätevalidierungsdurchlauf.
Beginnen Sie bei docs/mobile/README.md und Status des nativen Hosts.
Architektur
Agent / CLI / MCP / Mobile
│
▼
VideoAgentCore
│
┌─────────────────┼──────────────────┐
▼ ▼ ▼
Workflow ProjectStore Job Queue
│ │ │
└──────────┬──────┴──────────┬──────┘
▼ ▼
Edit / Timeline Provider contracts
│ │
Version / Diff ASR / LLM / TTS
│ │
└────────┬────────┘
▼
Renderer
│
Preview
│
Review / ExportDie Hauptinvariante ist einfach: Die Runtime besitzt den Zustand; Modelle schlagen strukturierte Änderungen vor.
Für Paketgrenzen, Persistenzlayout und Wiederherstellungssemantik lesen Sie architecture.md.
Dokumentation & Entwicklung
Die README ist der Produkteinstiegspunkt. Technische Details finden Sie unter docs/.
Thema | Dokument |
Architektur und dauerhafter Zustand | |
Sicherheit und Geheimnisbehandlung | |
Sprach-MCP | |
Sprachmodell-Landschaft | |
Stimmidentität und Klonen | |
Abnahme mit echten Providern | |
Benchmarks | |
Mobiler Host | |
Vorarbeiten / Upstream-Forschung | |
Versionshistorie |
Projektstatus
Die Node-Runtime ist der verifizierte primäre Pfad: CLI, MCP, dauerhafter Projektzustand, FFmpeg-Rendering, Jobs, deterministische Evaluierung, Sprachprovider-Adapter und Abnahme-Tooling für echte Provider sind implementiert und durch CI abgedeckt, wo sie keine externen Modellgewichte oder kostenpflichtigen Anmeldeinformationen erfordern.
Die tatsächliche Qualität lokaler Modelle, Latenz, VRAM und das Verhalten gehosteter Modelle müssen weiterhin auf dem Zielgerät über das Opt-in-Abnahme-Framework gemessen werden; CI gibt nicht vor, dass diese Läufe stattgefunden haben.
Der mobile Host bleibt ein Prototyp auf Quellcode-Ebene, bis die native Kompilierung und die Validierung auf echten Geräten abgeschlossen sind.
Sicherheitsprinzipien
Agents erhalten niemals beliebige Shell-Ausführung über die Bearbeitungs-API.
Rohe FFmpeg-Zeichenfolgen sind kein maßgeblicher Bearbeitungszustand.
API-Schlüssel werden niemals in Projekt-JSON, ProviderCall-Datensätzen oder Benchmark-Berichten gespeichert.
Quellmedien bleiben lokal, sofern ein Workflow nicht ausdrücklich Remote-Nachweise autorisiert.
Sprachklonen erfordert ausdrückliche Autorisierung und Herkunftsnachweis.
Nicht unterstützte Renderer-/Provider-Funktionen schlagen explizit fehl, anstatt stillschweigend zu degradieren.
Siehe docs/security.md für die vollständige Abgrenzung.
Lizenz
MIT. Siehe LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityFmaintenanceEnables video editing operations such as trimming, merging, adding audio/text/effects, and exporting via MCP protocol, leveraging CapCut core functionalities.92
- AlicenseNot gradedqualityBmaintenanceAn MCP server for programmatic video editing using ffmpeg, enabling draft creation and refinement via natural language.5ISC
- AlicenseNot gradedqualityAmaintenanceProvides a headless video editing workflow using portable JSON projects and Kdenlive for review, enabling automated video rendering and project management.5Apache 2.0
- AlicenseNot gradedqualityBmaintenanceA real video editor for AI agents, served over MCP, enabling journaled timeline editing, rendering via FFmpeg/MLT, and deterministic CLI operation.MIT
Related MCP Connectors
MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.
A real timeline video editor for AI agents: journaled edits, FFmpeg/MLT rendering, exports
MCP server for generating rough-draft project plans from natural-language prompts.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/YansIlinta/video-agent-runtime'
If you have feedback or need assistance with the MCP directory API, please join our Discord server