Od dvaceti dolarů k miliardovému startupu
Příběh Fei-Fei Li se snadno vypráví, ale těžko opakuje. V patnácti dorazila z Číny do Spojených států, kde se musela od nuly probojovat jazykem i systémem. Nakonec z ní vyrostla jedna z nejcitovanějších postav počítačového vidění — právě ona stála u projektu ImageNet, obřího souboru označených obrázků, který pomohl nastartovat dnešní vlnu hlubokého učení.
Teď vede World Labs, startup zaměřený na takzvanou prostorovou inteligenci. Zjednodušeně jde o to, aby stroje nerozuměly světu jen jako plochým obrázkům, ale jako prostoru s hloubkou, vzdálenostmi a fyzikou. Zájem investorů mluví jasně: podle dostupných informací vyrostla valuace startupu během pouhých tří měsíců zhruba na hranici jedné miliardy dolarů.
Jak Atlas funguje
Zásadní rozdíl je v tom, co model vlastně vytváří. Dnešní generátory videa pracují jako animovaná pohlednice: vygenerují jednu sekvenci záběrů a vy se na ni jen díváte. Když chcete změnit úhel, nemáte šanci — scéna je pevně daná a hotová.
Atlas pracuje jinak. Z jediného 2D obrázku, videa nebo textového zadání odhadne, jak by scéna vypadala ve třech rozměrech: kde končí zeď, co je za rohem, jak daleko je strop. Výsledkem je interaktivní prostor, ve kterém můžete volně pohybovat kamerou, otáčet se a nahlížet i do míst, která na původním snímku vůbec nebyla vidět. A scéna zůstává konzistentní — když se otočíte zpátky, vidíte pořád totéž. Přesně takhle se chová prostředí ve videohře, ne pohlednice.
Co model umí a kde má limity
Podle dostupných informací generuje Atlas video v rozlišení 1440p, maximálně zhruba minutu dlouhé. To zní skromně, ale je třeba si uvědomit, že nejde o obyčejný klip: každý snímek je plnohodnotný 3D prostor, do kterého lze vstoupit. I tak jsou limity zřejmé. Minuta je na celovečerní scénu málo a kvalita rekonstrukce u složitých záběrů — třeba odrazů v zrcadlech nebo jemných textur — zůstává otevřenou otázkou. Tohle je zatím nástroj na prototypování, ne na finální produkci.
Kde se to reálně použije
Tři oblasti jsou nejviditelnější. Ve filmu a u videoher může Atlas zkrátit první fázi tvorby: místo ručního modelování prostředí stačí dodat referenční obrázek a tvůrce dostane prostor, kterým si může rovnou procházet a hledat nejlepší úhel záběru. Ještě dál to ale může dojít v robotice. Robot se dnes učí především fyzicky v reálném světě, což je drahé a pomalé. Věrné 3D prostředí mu umožní trénovat v simulaci — levně, bezpečně a v tisících variantách najednou.
Proč to mění směr celého oboru
Pozoruhodné je, kam se těžiště výzkumu posouvá. Ještě nedávno se mluvilo hlavně o textu a pak o 2D obrázcích. Atlas je součástí širšího trendu, kdy se výzkumníci snaží naučit modely chápat hloubku, vzdálenost a fyzikální vztahy — tedy věci, které textový model jednoduše nevidí. Svět není jen popis slov, a modely to začínají dohánět.
Kontext doplňuje i dění kolem velkých hráčů. Google se vrací do hry s novou generací modelu Gemini a vlastními čipy Ironwood, jak nedávno popsal CzechCrunch. Obor se tak dnes nesoustředí jen na to, kdo napsal nejchytřejší text — ale i na to, kdo postaví nejvýkonnější hardware a kdo naučí AI rozumět skutečnému trojrozměrnému světu.
Co to znamená pro Česko
Tuzemská herní scéna je silná — studia jako Warhorse, Bohemia Interactive nebo SCS Software vyvážejí hry do celého světa. Nástroj, který z referenční fotky vygeneruje prozkoumatelný 3D prostor, by mohl zrychlit prototypování prostředí i hledání záběrů. Zatím jde o potenciál, ne o hotový produkt, ale směr je jasný: čím dřív studio převede nápad do podoby, kterou si může projít, tím levněji ověří, jestli vůbec funguje.
Platí tu i evropská pravidla. AI Act vyžaduje, aby byl syntetický obsah rozpoznatelný. U 3D prostředí, která se dál upravují v nástrojích jako Blender nebo Unreal, to ale nebude tak jednoduché jako označit jednu vygenerovanou fotku — hranice mezi tím, co vytvořil model a co dotvořil člověk, se rychle stírá.
Je Atlas volně dostupný?
World Labs zatím model nezpřístupnil široké veřejnosti jako běžnou službu. Firma komunikuje především technologii a ukázky; konkrétní ceník ani otevřený přístup pro běžné uživatele zatím nezveřejnila.
Jaký je rozdíl mezi Atlasem a generátory videa?
Generátory videa vytvářejí plochou sekvenci záběrů, kterou jen sledujete. Atlas generuje trojrozměrný prostor, ve kterém můžete kamerou pohybovat a měnit úhel pohledu — scéna zůstává konzistentní i po otočení.
Nahradí takový nástroj 3D modeláře?
Spíš jim změní práci, než že by ji vzal. Atlas urychlí prototypování a hledání záběrů, ale finální detailní modelování, optimalizace a umělecká rozhodnutí zůstávají na lidech — model generuje hrubý prostor, ne hotový produkt.