Shrnutí v bodech
- Runway představil model Praxis-1, který označuje jako World Action Model (WAM).
- Model se na běžných videích učí fyzický pohyb robotů, což řeší chronický nedostatek tréninkových dat.
- Simulace uvnitř modelu světa vykazuje 95% shodu s chováním v reálném světě.
- Váhy modelu budou v následujících měsících volně dostupné v režimu open-weight pro výzkum i firmy.
Proč robotika dosud narážela na nedostatek dat
Když se v posledních letech učily velké jazykové modely mluvit a programovat, měly k dispozici téměř celý psaný internet. Vývojáři robotů takové štěstí neměli. Aby se robot naučil uchopit hrnek, uklidit stůl nebo navigovat v neznámém skladu, museli inženýři trávit tisíce hodin teleoperovaným ovládáním. Každý pohyb bylo nutné nahrát ručně přes speciální joysticky, rukavice nebo operátorské helmy.
Tento postup je astronomicky drahý a navíc pomalý. Pokud se robot setká se situací, kterou v tréninkových datech nemá (například odražené světlo, převrácená sklenice nebo nečekaná překážka), často zcela selže. Shromáždit dostatek reálných ukázek pro všechny myslitelné situace ve fyzickém světě je v lidských silách prakticky nemožné.
Od generování videa k pochopení fyziky
Tým z Runway Research se rozhodl využít úplně jiný zdroj: miliardy hodin videa, které lidé denně nahrávají na internet. Společnost, která stojí za známými video modely řady Gen i interaktivním systémem Solaris, obrátila svou technologii naruby.
Místo toho, aby model video pouze vytvářel pro diváky, učí se z něj předvídat, jak se svět chová. Model sleduje, jak lidské ruce manipulují s nástroji, jak padají předměty, jak funguje tření nebo jak se deformují měkké materiály. Z těchto vizuálních toků si model staví vnitřní reprezentaci fyzikálního světa, takzvaný World Action Model (WAM).
Simulace, která odpovídá realitě z 95 procent
Největší obava vývojářů v robotice obvykle spočívá v takzvaném rozdílu mezi simulací a realitou (sim-to-real gap): co funguje v počítačové simulaci, na skutečném hardwaru často havaruje. Runway však ve své výzkumné zprávě uvádí, že testování robotických strategií uvnitř modelu světa dosahuje korelace 0,95 se skutečnými testy v terénu.
To je přesnost, která výrazně překonává dosavadní nákladné metody založené na ruční 3D rekonstrukci prostředí. Robotický agent se tak může učit miliony pokusů v syntetickém světě generovaném modelem, aniž by přitom zničil drahé mechanické vybavení nebo ohrozil lidi kolem sebe.
Co to znamená pro evropský a český průmysl
Česká republika patří k zemím s nejvyšší hustotou průmyslových robotů ve střední Evropě, zejména díky silnému automobilovému a strojírenskému sektoru. Drtivá většina těchto strojů však stále funguje na principu přesně naprogramovaných trajektorií. Jakákoli odchylka výrobku na pásu vyžaduje zastavení linky a zásah seřizovače.
Pokud modely typu Praxis-1 skutečně přenesou obecnou prostorovou inteligenci do cenově dostupného open-weight formátu, otevře se prostor pro adaptivní automatizaci i v menších výrobních provozech. Místo nákladného vývoje řídicího softwaru na zakázku bude stačit robotu ukázat videozáznam požadovaného úkonu a model světa dopočítá potřebné motorické povely sám.
Hardware nerozhoduje: model funguje pro různé konstrukce
Důležitou vlastností modelu Praxis-1 je hardwarová nezávislost. Tradiční řídicí software bývá pevně svázaný s konkrétním typem robotického ramene, chapadla nebo podvozku. Praxis-1 naproti tomu nabízí obecnou řídicí strategii, kterou lze napojit na různé konstrukce robotů.
Model v současnosti prochází uzavřeným testováním u vybraných průmyslových partnerů. Runway potvrdil, že v následujících měsících veřejně zpřístupní váhy modelu Praxis-1 v režimu open-weight. Pro nezávislé vývojáře i menší robotické laboratoře to znamená příležitost stavět pokročilou autonomii bez nutnosti budovat vlastní masivní sběr tréninkových dat.
Kdy bude model Praxis-1 dostupný ke stažení?
Runway plánuje uvolnění vah v režimu open-weight během následujících měsíců po ukončení pilotního testování s partnery.
Jaký je rozdíl mezi jazykovým modelem a modelem světa?
Zatímco jazykový model předpovídá další textový token, model světa (World Model) modeluje prostor, čas a příčinné vztahy mezi akcemi a jejich vizuálními důsledky.