Googles Video-Co-Regisseur plant Kontinuität über Minuten Filmmaterial
Google Research hat einen "KI-Video-Co-Regisseur" vorgestellt: ein Multi-Agenten-Framework, das auf den Modellen Gemini und Veo aufsetzt und zusammenhängende Videos von mehreren Minuten erzeugen soll. Der Beitrag vom 24. September nennt vier Arbeiten dahinter: Co-Director, vorgesehen für die COLM 2026; CANVAS, vorgesehen für die EMNLP 2026; sowie A²RD und VQQA.
Das Problem kennt jeder, der generierte Videoclips aneinanderreiht. Bestehende Pipelines prompten jede Einstellung einzeln, sodass Kleidung und Umgebung von Einstellung zu Einstellung wechseln, und ein früher Fehler - etwa ein fehlerhaftes Asset - verdirbt alles, was darauf aufbaut. Google beschreibt das als Problem der Zuordnung: Scheitert das fertige Video, lässt sich schwer sagen, welcher Prompt schuld war.
Die Antwort des Co-Regisseurs ist globale Planung statt Planung pro Einstellung. Ein Orchestrator-Agent wählt mit einem Multi-Armed-Bandit eine kreative Konfiguration entlang dreier Dimensionen - Strategie, Erzählform und Ästhetik - und gibt diese Wahl in die Prompts aller Unteragenten. Ein Vorproduktions-Agent macht daraus ein Storyboard; Produktions-Agenten erzeugen Keyframes, Video und Ton. Ein multimodales Modell bewertet den fertigen Schnitt nach denselben drei Dimensionen und gibt dem Bandit eine Belohnung zurück, damit der nächste Versuch besser wird. CANVAS ergänzt ein ausdrückliches Gedächtnis: strukturierte Einträge zu Figuren, Orten und Objektzuständen, aus denen visuelle Anker abgerufen werden, um eine Szene stimmig zu halten. Da das System nur Googles Modelle steuert, trägt seine Ausgabe laut Beitrag dasselbe SynthID-Wasserzeichen.

Was das bedeutet
Es geht weniger um ein neues Modell als um Softwarearchitektur rund um Modelle. Eine Geschichte stimmig zu halten, wird als Zustandsverwaltung behandelt - ein Verzeichnis dessen, was in der Welt existiert, fortgeschrieben mit der Handlung - plus eine Rückkopplung, die das Gesamtergebnis bewertet statt jedes Teilstück. Diese Ideen kann jedes Team übernehmen, das mehrstufige Generierungs-Pipelines baut, gleich in welchem Medium: Ausdrücklicher gemeinsamer Zustand schlägt die Hoffnung, das Modell werde sich erinnern, und ein Prüfer für das Endprodukt findet Fehler, die Prüfungen pro Schritt übersehen.
Die Grenzen sind die üblichen eines Forschungsbeitrags. Die "deutlichen Verbesserungen" stammen aus den eigenen Auswertungen der Autoren, und zwei der vier Arbeiten sind noch nicht erschienen. Ein automatischer Prüfer, der die Ausgabe des eigenen Systems bewertet, verdient ebenfalls Skepsis: Er ist ein nützliches Optimierungssignal, aber nicht dasselbe wie eine unabhängige Bewertung durch Menschen.