Od čekání na klip k obrazu, který vzniká před očima
Dnešní generování videa funguje trochu jako objednávka v restauraci s velmi pomalou kuchyní. Zadáte popis scény, model začne pracovat a po několika sekundách až minutách dostanete hotový výsledek. Pokud postava udělá něco jiného, než jste chtěli, nebo se kamera vydá špatným směrem, celý proces obvykle opakujete.
Runway chce tento model změnit. Uživatel by neměl čekat na dokončený klip, ale sledovat video, které se průběžně generuje a okamžitě reaguje na další pokyny. Místo série oddělených pokusů by tak vznikla nepřetržitá interakce mezi člověkem a modelem.
Podle informací serveru The Decoder se Runway soustředí především na zkrácení času do zobrazení prvního snímku. To je důležitý detail. Uživatel nepotřebuje nejprve čekat na celý desetisekundový klip, aby zjistil, že zadání pochopil špatně. Výsledek může začít opravovat prakticky okamžitě.
Jak funguje generování snímek po snímku
Základem popisovaného přístupu je světový model GWM-1, který vychází z architektury Gen-4.5. Nejde pouze o nástroj, který převádí text na předem uzavřený videoklip. Model má průběžně vytvářet další snímky a používat přitom jako kontext předchozí obraz.
Prakticky to znamená, že model neskládá každý snímek úplně od nuly. Sleduje, co už ve scéně vzniklo, a na to navazuje. Uživatel přitom může měnit směr kamery, zadávat textové instrukce, používat zvuk nebo posílat příkazy související s pohybem.
Tento způsob práce je blíže živému ovládání hry než klasickému renderování videa. Rozdíl je v tom, že prostředí nevytvořil grafik ani programátor předem. Scéna se generuje v průběhu používání a reaguje na pokyny člověka.
Má to ale i technický háček. Když každý nový snímek vychází z toho předchozího, může se malá chyba postupně zvětšovat. Z nepatrně zdeformované ruky se po několika sekundách může stát postava s úplně jinou anatomií. Textový model může změnit směr věty, ale video model si často nese chybu dál jako špatně založenou řadu dominových kostek.
Runway proto podle popisu výzkumu trénuje model také na vlastních nedokonalých výstupech. Cílem je naučit jej odchylky průběžně opravovat, nikoli je pouze kopírovat do dalších snímků.
Solaris ukazuje, že nejde jen o filmové klipy
Runway v září 2026 předvedla také výzkumný náhled systému Solaris. Ten využívá podobný princip pro tvorbu uživatelských rozhraní snímek po snímku. Rozhraní tedy není klasická aplikace napsaná pomocí HTML, CSS a JavaScriptu, ale obraz generovaný modelem v reálném čase.
Na kliknutí nebo hlasový pokyn má systém reagovat změnou obrazu. V principu jde o pokus vytvořit software, který se nechová jako sada předem naprogramovaných obrazovek, ale jako interaktivní vizuální prostředí.
V uživatelské studii se 250 účastníky preferovalo živě generované rozhraní Solaris 61 procent lidí při plnění pokynů a 71 procent z hlediska přirozenosti chování oproti kódovaným aplikacím. Jde o výsledek konkrétní studie, nikoli obecný důkaz, že generované rozhraní je vždy lepší. Přesto ukazuje, že lidem může připadat přirozenější prostředí, které se mění podle jejich záměru, než tradiční aplikace s pevně danou navigací.
Pro vývojáře by to znamenalo zásadní změnu v tom, kde se aplikace vlastně „staví“. Část práce by se přesunula z psaní jednotlivých obrazovek k návrhu pravidel, podle kterých má model prostředí vytvářet a upravovat. Současně by ale přibyly nové problémy: testování, stabilita, přesnost reakcí a bezpečnost.
Proč Runway mluví také o robotech
Živé generování obrazu dává smysl i mimo filmovou tvorbu. Runway uvádí jako jednu z oblastí využití robotiku a autonomní řízení. Robot nebo autonomní vůz potřebuje trénovat na situacích, které se nedají jednoduše nasbírat v běžném světě.
Světový model může vytvořit simulované prostředí, které reaguje na chování systému. Robot například změní směr a okolí se tomu přizpůsobí. Autonomní vozidlo může být vystaveno situaci, kterou na skutečné silnici zatím nezažilo. Nejde přitom jen o hezčí grafiku. Důležitá je rychlost reakce prostředí a možnost vytvářet mnoho variant stejného scénáře.
Podobný směr sledují i další firmy. The Decoder zmiňuje například model Waymo World Model pro simulaci silničního provozu a výzkumné systémy zaměřené na interaktivní virtuální světy. Runway v březnu představila také výzkumný model vyvíjený s Nvidií, u kterého cílila na zobrazení prvního snímku za méně než 100 milisekund. Ani tento systém však podle dostupných informací nemá oznámený termín veřejné dostupnosti.
Největší překážkou nebude jen kvalita obrazu
U běžného generování videa se většina výpočetní práce odehraje před tím, než výsledek uvidíte. U streamovaného modelu musí systém produkovat nové snímky dost rychle na to, aby udržel plynulé přehrávání. Výpočetní zátěž se tak přesouvá do samotného používání.
Runway tvrdí, že rychlejší modely mohou snížit náklady na GPU čas. Pokud musí infrastruktura vyrábět obraz průběžně a současně obsluhovat více relací, nestačí jen dobrá kvalita. Rozhoduje také latence, stabilita a cena každého dalšího snímku.
To je jeden z důvodů, proč zatím nedává smysl mluvit o hotové službě pro běžné uživatele. Runway zatím neoznámila veřejný harmonogram spuštění ani cenu. Funkce proto není potvrzená jako běžně dostupný nástroj v Česku nebo Evropské unii. Pro českého uživatele dnes znamená především to, že se mění směr vývoje video AI, nikoli že si může nový režim okamžitě zapnout.
Finanční zázemí firmy ale ukazuje, že nejde o okrajový experiment. Runway v investičním kole Series E získala 315 milionů dolarů při valuaci 5,3 miliardy dolarů. Peníze samy o sobě technologii nezaručí, ale umožňují financovat výzkum modelů, infrastruktury a výpočetně náročného trénování.
Co se mění pro tvůrce videa
Pokud se tento přístup podaří dostat do praktické služby, největší změnou nebude pouze kratší čekání. Změní se způsob práce. Tvůrce nebude nejprve psát dlouhý prompt, následně hodnotit hotový výsledek a potom zkoušet další variantu. Mohl by scénu směrovat podobně jako kameraman během natáčení.
To může být užitečné při hledání správného pohybu kamery, atmosféry nebo kompozice. Člověk by rychleji poznal, zda se scéna ubírá správným směrem. Na druhou stranu bude stále nutné řešit konzistenci postav, přesné objekty, autorská práva a kontrolu nad tím, co model vytvoří.
Runway tedy zatím nepředstavuje nový hotový produkt, který by nahrazoval klasické generátory videa. Představuje spíše jiný pracovní model: video jako živé prostředí, ne jako soubor, na který se čeká. Jestli se tento přístup prosadí, rozhodne nejen kvalita obrazu, ale hlavně schopnost modelu reagovat rychle, stabilně a bez postupného rozpadání scény.
FAQ
Je živé generování videa od Runway už dostupné veřejnosti?
Zatím ne. Runway technologii popisuje jako výzkumný směr a u představených systémů nebyl oznámen veřejný harmonogram spuštění ani cena. Nelze proto potvrdit běžnou dostupnost v Česku nebo Evropské unii.
Bude možné video ovládat pouze textem?
Ne nutně. Popisovaný systém GWM-1 má reagovat také na pohyby kamery, zvuk a další povely. Konkrétní podoba ovládání v případné veřejné službě zatím nebyla oznámena.
Proč je generování v reálném čase důležité pro robotiku?
Robotické a autonomní systémy potřebují trénovat v prostředích, která reagují na jejich chování. Interaktivní světový model může vytvářet různé situace a simulovat jejich vývoj rychleji než předem připravené statické scénáře.