Přejít k hlavnímu obsahu

Jedna fotka stačí. Model Atlas postaví 3D svět, kterým můžete volně procházet

Ilustrační obrázek
V patnácti přicestovala z Číny do USA s dvaceti dolary v kapse. Dnes Fei-Fei Li, profesorka ze Stanfordu, stojí za modelem Atlas, který z jediné fotky postaví kompletní trojrozměrný svět. Ne video, které jen přehrajete — prostor, kterým se dá volně procházet. A jeho dopad může sahat od filmu přes hry až po trénink robotů.

Od dvaceti dolarů k miliardovému startupu

Příběh Fei-Fei Li se snadno vypráví, ale těžko opakuje. V patnácti dorazila z Číny do Spojených států, kde se musela od nuly probojovat jazykem i systémem. Nakonec z ní vyrostla jedna z nejcitovanějších postav počítačového vidění — právě ona stála u projektu ImageNet, obřího souboru označených obrázků, který pomohl nastartovat dnešní vlnu hlubokého učení.

Teď vede World Labs, startup zaměřený na takzvanou prostorovou inteligenci. Zjednodušeně jde o to, aby stroje nerozuměly světu jen jako plochým obrázkům, ale jako prostoru s hloubkou, vzdálenostmi a fyzikou. Zájem investorů mluví jasně: podle dostupných informací vyrostla valuace startupu během pouhých tří měsíců zhruba na hranici jedné miliardy dolarů.

Jak Atlas funguje

Zásadní rozdíl je v tom, co model vlastně vytváří. Dnešní generátory videa pracují jako animovaná pohlednice: vygenerují jednu sekvenci záběrů a vy se na ni jen díváte. Když chcete změnit úhel, nemáte šanci — scéna je pevně daná a hotová.

Atlas pracuje jinak. Z jediného 2D obrázku, videa nebo textového zadání odhadne, jak by scéna vypadala ve třech rozměrech: kde končí zeď, co je za rohem, jak daleko je strop. Výsledkem je interaktivní prostor, ve kterém můžete volně pohybovat kamerou, otáčet se a nahlížet i do míst, která na původním snímku vůbec nebyla vidět. A scéna zůstává konzistentní — když se otočíte zpátky, vidíte pořád totéž. Přesně takhle se chová prostředí ve videohře, ne pohlednice.

Co model umí a kde má limity

Podle dostupných informací generuje Atlas video v rozlišení 1440p, maximálně zhruba minutu dlouhé. To zní skromně, ale je třeba si uvědomit, že nejde o obyčejný klip: každý snímek je plnohodnotný 3D prostor, do kterého lze vstoupit. I tak jsou limity zřejmé. Minuta je na celovečerní scénu málo a kvalita rekonstrukce u složitých záběrů — třeba odrazů v zrcadlech nebo jemných textur — zůstává otevřenou otázkou. Tohle je zatím nástroj na prototypování, ne na finální produkci.

Kde se to reálně použije

Tři oblasti jsou nejviditelnější. Ve filmu a u videoher může Atlas zkrátit první fázi tvorby: místo ručního modelování prostředí stačí dodat referenční obrázek a tvůrce dostane prostor, kterým si může rovnou procházet a hledat nejlepší úhel záběru. Ještě dál to ale může dojít v robotice. Robot se dnes učí především fyzicky v reálném světě, což je drahé a pomalé. Věrné 3D prostředí mu umožní trénovat v simulaci — levně, bezpečně a v tisících variantách najednou.

Proč to mění směr celého oboru

Pozoruhodné je, kam se těžiště výzkumu posouvá. Ještě nedávno se mluvilo hlavně o textu a pak o 2D obrázcích. Atlas je součástí širšího trendu, kdy se výzkumníci snaží naučit modely chápat hloubku, vzdálenost a fyzikální vztahy — tedy věci, které textový model jednoduše nevidí. Svět není jen popis slov, a modely to začínají dohánět.

Kontext doplňuje i dění kolem velkých hráčů. Google se vrací do hry s novou generací modelu Gemini a vlastními čipy Ironwood, jak nedávno popsal CzechCrunch. Obor se tak dnes nesoustředí jen na to, kdo napsal nejchytřejší text — ale i na to, kdo postaví nejvýkonnější hardware a kdo naučí AI rozumět skutečnému trojrozměrnému světu.

Co to znamená pro Česko

Tuzemská herní scéna je silná — studia jako Warhorse, Bohemia Interactive nebo SCS Software vyvážejí hry do celého světa. Nástroj, který z referenční fotky vygeneruje prozkoumatelný 3D prostor, by mohl zrychlit prototypování prostředí i hledání záběrů. Zatím jde o potenciál, ne o hotový produkt, ale směr je jasný: čím dřív studio převede nápad do podoby, kterou si může projít, tím levněji ověří, jestli vůbec funguje.

Platí tu i evropská pravidla. AI Act vyžaduje, aby byl syntetický obsah rozpoznatelný. U 3D prostředí, která se dál upravují v nástrojích jako Blender nebo Unreal, to ale nebude tak jednoduché jako označit jednu vygenerovanou fotku — hranice mezi tím, co vytvořil model a co dotvořil člověk, se rychle stírá.

Je Atlas volně dostupný?

World Labs zatím model nezpřístupnil široké veřejnosti jako běžnou službu. Firma komunikuje především technologii a ukázky; konkrétní ceník ani otevřený přístup pro běžné uživatele zatím nezveřejnila.

Jaký je rozdíl mezi Atlasem a generátory videa?

Generátory videa vytvářejí plochou sekvenci záběrů, kterou jen sledujete. Atlas generuje trojrozměrný prostor, ve kterém můžete kamerou pohybovat a měnit úhel pohledu — scéna zůstává konzistentní i po otočení.

Nahradí takový nástroj 3D modeláře?

Spíš jim změní práci, než že by ji vzal. Atlas urychlí prototypování a hledání záběrů, ale finální detailní modelování, optimalizace a umělecká rozhodnutí zůstávají na lidech — model generuje hrubý prostor, ne hotový produkt.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.