Přejít k hlavnímu obsahu

Google učí AI hlídat kontinuitu. Delší videa už nemusí vypadat jako slepenec

Ilustrační obrázek
Google Research představil víceagentní systém, který má řešit jeden z nejotravnějších problémů generativního videa: postava v jedné scéně vypadá jako člověk a o několik záběrů později jako jeho vzdálený příbuzný po třech hodinách spánku. Výzkumný „AI spolurežisér“ propojuje čtyři rámce pro plánování, vizuální paměť, tvorbu dlouhých sekvencí a automatickou kontrolu výsledku. Podle Googlu dokáže vytvářet souvislé příběhy v řádu minut, nejde ale o samostatný nástroj dostupný veřejnosti.

AI už nemá jen generovat záběry. Musí si také pamatovat film

Generativní video dnes umí vytvořit působivé krátké klipy. Potíž nastává ve chvíli, kdy z nich chcete složit delší scénu nebo celý příběh. Každý nový záběr může změnit tvář herce, barvu oblečení, rozmístění nábytku nebo tvar rekvizity. Technicky kvalitní obraz tak začne působit jako několik různých filmů slepených dohromady. Google tento problém označuje jako semantic drift, tedy postupný posun významu a vzhledu. Navazuje na něj také kaskádové šíření chyb: pokud se například v úvodní scéně špatně vytvoří klíčová rekvizita, další části příběhu na ni mohou nesprávně navázat. Chyba se pak nechová jako jeden rozbitý snímek, ale spíše jako špatně zadaná adresa v navigaci. Každý další krok vás zavede o něco dál od cíle. Výzkumný tým proto nepředstavil nový generátor videa v klasickém smyslu. AI video co-director funguje jako orchestrační vrstva nad generativními modely Gemini a Veo. Jeho úkolem je rozdělit tvůrčí práci mezi více agentů, hlídat kontinuitu a opakovaně opravovat výsledek. Google zároveň uvádí, že architektura je modelově agnostická, takže princip by teoreticky mohl fungovat i nad jinými základními modely. ([research.google](https://research.google/blog/coherent-long-form-video-generation/?utm_source=openai))

Čtyři části řeší čtyři různé problémy

Co-Director plánuje film jako celek

První část se jmenuje Co-Director. Namísto jednoduchého řetězce příkazů, kdy jeden agent předá výsledek druhému, hledá vhodnou kombinaci tvůrčí strategie, způsobu vyprávění a vizuálního stylu. Systém používá princip podobný vícekolovému testování různých variant. Orchestrátor vybere několik možných tvůrčích směrů, produkční část z nich připraví storyboard a další agenti vytvoří klíčové obrázky, pohyb i zvuk. Výsledný sestřih následně posoudí multimodální model a zpětná vazba se vrací do dalšího kola. Pro člověka to znamená hlavně méně ručního hlídání detailů. Nejde o to, že by AI sama převzala režii v kreativním smyslu. Spíše se snaží zajistit, aby její vlastní dílčí výstupy držely pohromadě.

CANVAS funguje jako vizuální paměť

Rámec CANVAS, jehož celý název odkazuje na vizuální agentní storyboardování, udržuje strukturovaný popis postav, lokací a objektů. Když se příběh po několika scénách vrátí do stejného prostředí, systém může znovu použít vizuální kotvy místo toho, aby místnost nebo postavu pokaždé vytvořil od nuly. To je důležitý rozdíl oproti běžnému promptování. Samotný textový popis typu „muž v modré bundě stojí v kuchyni“ nemusí stačit k tomu, aby model po deseti dalších záběrech zachoval stejnou tvář, geometrii prostoru i polohu rekvizit. CANVAS se snaží tyto informace držet jako stav světa, nikoli jako náhodně znovu interpretovaný odstavec. Výzkum Co-Director byl podle Googlu přijat na konferenci COLM 2026 a CANVAS na EMNLP 2026. V obou případech jde o výzkumné práce, nikoli o oznámení nové funkce v aplikaci Gemini. ([research.google](https://research.google/conferences-and-events/google-at-colm-2026/?utm_source=openai))

A²RD prodlužuje příběh po jednotlivých segmentech

Nejkonkrétnější ukázku dlouhého výstupu přináší rámec A²RD, tedy agentní autoregresivní difuze pro konzistentní dlouhá videa. Systém vytváří video segment po segmentu a používá multimodální video paměť. Jeho pracovní cyklus lze zjednodušit na čtyři kroky: vyhledat relevantní předchozí kontext, vytvořit nový segment, zkontrolovat jej a uložit aktualizovaný stav. Podle situace může systém zvolit extrapolaci, tedy pokračování příběhu novým dějem, nebo interpolaci, která pevněji naváže nový úsek na známé postavy a prostředí. Google demonstroval souvislé video o délce až 10 minut. To neznamená, že každý uživatel dnes zadá jeden prompt a obdrží hotký desetiminutový film v produkční kvalitě. Jde o výzkumnou ukázku schopnosti udržet postavy, objekty a geometrii prostředí v dlouhém časovém úseku. Samotná práce A²RD popisuje testy na jedno-, tří- a pětiminutových videích a srovnání s existujícími základními metodami. ([research.google](https://research.google/pubs/a2rd-agentic-autoregressive-diffusion-for-long-video-consistency/?utm_source=openai))

VQQA hledá chyby pomocí otázek

Poslední část, VQQA, používá otázky a odpovědi pro kontrolu videa. Systém si například může položit otázku, zda postava stále drží správný předmět nebo zda se během střihu nezměnilo její oblečení. Odpovědi pak převede na textovou zpětnou vazbu a pokusí se vytvořit lepší variantu. Je to trochu jako korektor, který neřekne jen „tohle je špatně“, ale přesněji popíše, co nesedí. V ukázkách VQQA opravuje například nesoulad mezi tvarem a materiálem objektu nebo záměnu nástrojů při hudebním vystoupení.

Čísla vypadají slibně, ale benchmark není hotový film

Pro hodnocení systému Google připravil benchmark GenAD-Bench. Obsahuje 400 scénářů napříč 200 fiktivními produkty a testuje, zda generované video dodrží konkrétní marketingové i vizuální požadavky. Fiktivní produkty mají omezit vliv existujících značek a známých tréninkových vzorů. AI video co-director v tomto hodnocení dosáhl skóre 81,4 bodu. Google zároveň uvádí zlepšení konzistence příběhu v benchmarku ViStoryBench. Další části architektury byly hodnoceny na testech zaměřených na prostorovou návaznost, dlouhodobou dynamiku a kvalitu textových i obrazových instrukcí. Tady je ale potřeba držet brzdu. Skóre 81,4 není univerzální známka kvality videa a neříká, že systém je automaticky lepší než každý konkurent. Benchmark měří konkrétní úlohy a výsledky nelze bez znalosti metodiky jednoduše převést na tvrzení, že AI umí natočit lepší film než člověk. Google v ukázkách porovnává některé výstupy s platformami AutoStudio a Gemini-3.1-Pro. Co-Director ovšem není přímý konkurent modelům typu GPT, Gemini nebo Claude. Je to řídicí a kontrolní vrstva, která má zlepšit práci s jedním či více generátory. To je podobný rozdíl jako mezi filmovou kamerou a produkčním systémem, který rozhoduje, kdy se má kamera použít, co má natočit a zda výsledek odpovídá scénáři.

Dostupnost v Česku zatím není otázkou předplatného

AI video co-director není podle dostupných informací veřejně nabízená služba ani samostatná funkce pro české uživatele. Google jej popisuje jako výzkumný projekt a uvádí, že jde o orchestrační vrstvu nad Gemini a Veo. Konkrétní cena, tarif, datum komerčního zpřístupnění ani česká lokalizace nebyly oznámeny. Pro firmy a vývojáře je přesto důležitý samotný směr. U dlouhého generovaného videa nemusí být hlavním problémem jen kvalita základního modelu. Stejně podstatné je plánování, práce s pamětí, kontrola chyb a schopnost vracet se k předchozím rozhodnutím. Google se snaží tyto části spojit do jednoho systému místo dalšího ručního lepení samostatných nástrojů. Bez veřejného rozhraní, dokumentace a cen ale zatím nelze říct, kolik by takové řešení stálo v běžné produkci. Výzkumný projekt ukazuje technickou možnost, ne hotový produkt připravený pro české studio nebo domácího tvůrce.

Největší posun je v kontrole, ne v samotném generování

Google Research tímto projektem míří na problém, který se často ztrácí za efektními krátkými ukázkami. Vygenerovat několik působivých sekund je jedna věc. Udržet v celém filmu stejnou postavu, prostředí, rekvizity a logiku příběhu je věc druhá. Čtyři propojené rámce — Co-Director, CANVAS, A²RD a VQQA — rozdělují tento problém na plánování, paměť, časovou návaznost a opravy. Právě tato kombinace může být pro další vývoj generativního videa důležitější než další samostatný model s o něco hezčími prvními sekundami. Zatím jde stále o výzkum. Pokud se ale podobná orchestrace dostane do praktických nástrojů, uživatel nebude muset AI pouze žádat o „další záběr“. Bude moci pracovat s příběhem jako s celkem a nechat systém, aby si hlídal, co se v něm už stalo. A to by byl konec jedné z nejviditelnějších slabin současného generativního videa — ne magie, jen konečně trochu lepší produkční kontrola.

Zdroje: oficiální oznámení Google Research, výzkumná práce A²RD, Google Research na COLM 2026, MarkTechPost.

FAQ

Je AI spolurežisér od Googlu dostupný jako aplikace pro veřejnost?

Ne. K 28. září 2026 je popisován jako výzkumná architektura a orchestrační vrstva nad modely Gemini a Veo. Google neoznámil samostatnou veřejnou aplikaci, cenu ani dostupnost pro český trh.

Nahrazuje tento systém modely Gemini nebo Veo?

Ne. Co-Director a související rámce modely nenahrazují, ale řídí jejich použití. Pomáhají s plánováním scén, vizuální pamětí, návazností segmentů a kontrolou chyb.

Obsahují videa vytvořená systémem ochranu SynthID?

Google uvádí, že architektura přirozeně přebírá bezpečnostní mechanismy základních modelů, včetně vodoznaku SynthID. Praktické podmínky použití pro veřejný produkt ale zatím oznámeny nebyly.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.