Jedna ukázka místo dlouhého tréninku
U běžného robotického systému je nový úkol často začátkem menšího projektu. Vývojář musí připravit data, upravit řídicí logiku, robot se musí naučit konkrétní trajektorii a následně se testuje, zda se nezhroutí při trochu jiném úhlu, předmětu nebo rychlosti pohybu.
GEN-1.5 se snaží tento postup zkrátit. Člověk robotu ukáže úkol v krátkém videu dlouhém přibližně 3 až 12 sekund. Model demonstraci vloží do svého kontextového okna jako „physical prompt“, tedy fyzický prompt. V praxi si lze kontextové okno představit jako krátkodobou paměť: robot si ukázku neuloží jako nové trvalé pravidlo, ale použije ji jako návod pro právě prováděnou činnost.
Podstatný rozdíl je v tom, že po ukázce nedochází k úpravě vah modelu. Robot se tedy z pohledu klasického strojového učení znovu nepřeučuje. Model pouze využije dostupný kontext a pokusí se z něj odvodit další akce.
Podle informací serveru The Decoder Generalist AI testovala například otevírání sklenice nebo vytahování peněz z peněženky. V deseti úkolech dosáhl model při učení z jediné ukázky průměrné úspěšnosti 59 procent. Když dostal pět minut dat a deset tréninkových kroků, úspěšnost vzrostla na 83 procent. To je důležitý detail: nejde o tvrzení, že robot po jednom videu zvládne všechno. Jde o demonstraci toho, že jediná ukázka může být použitelným startem.
Robot nesleduje jen obraz
GEN-1.5 není obyčejný systém, který se dívá na video a snaží se ho přehrát po jednotlivých snímcích. Podle dostupných informací zpracovává více typů vstupů současně: video, senzorická data, jazykové instrukce a propriocepci.
Propriocepce je v robotice obdoba tělesného pocitu člověka. Když zavřete oči, stále přibližně víte, kde máte ruku, jak moc ohýbáte prsty a zda na něco tlačíte. Robot k tomu používá údaje ze senzorů v kloubech, motorech a koncovém efektoru.
Model z těchto vstupů generuje akční trajektorie, tedy posloupnost pohybů, které má robot provést. Nejde pouze o otázku „co je na stole“, ale také „jak se toho dotknout, jakou silou, v jakém pořadí a co udělat, když předmět trochu ujede“.
Právě zde se robotika liší od běžných jazykových modelů. GPT, Gemini nebo Claude mohou popsat postup otevření sklenice, navrhnout plán nebo analyzovat video. Samy o sobě ale nemají robotickou ruku, která by musela řešit tření, váhu, pružnost víčka a nečekané uklouznutí. Jejich výsledky proto nelze přímo porovnávat s úspěšností GEN-1.5. Robotický model není chatbot s motorem přišroubovaným na bok.
Od napodobení pohybu k improvizaci
Generalist AI uvádí, že GEN-1.5 zvládá také řetězit dvě ukázky za sebou. Robot tak může provést delší sekvenci místo jediné krátké akce. To je praktické, protože skutečné úkoly málokdy vypadají jako izolované tlačítko „vezmi předmět“. Častěji je potřeba něco uchopit, přemístit, upravit polohu a potom pokračovat dalším krokem.
Model má podle společnosti zvládat také přenos ukázek ze simulace do reality. Simulace je pro robotiku levnější a bezpečnější než skutečný provoz, ale mezi virtuálním a reálným světem existuje rozdíl. V počítači se předmět nechová vždy stejně jako na skutečném stole a fyzika bývá až nepříjemně důsledná.
Zajímavá je rovněž schopnost improvizovaně použít nástroj. Pokud robot například dostane úkol uklidit drobné nečistoty, nemusí být odkázán výhradně na smetáček, který viděl během tréninku. Generalist AI uvádí příklady, kdy dokáže využít lopatku jako alternativu. Neznamená to lidské chápání nástrojů v plném smyslu, ale model zjevně pracuje s širší vazbou mezi tvarem předmětu, pohybem a požadovaným výsledkem.
Část schopností se podle Generalist AI objevila během více než osmi měsíců předtrénování na datech z reálných fyzických interakcí. Společnost tvrdí, že některé dovednosti nebyly do modelu vloženy jako samostatně naprogramované funkce. Vznikly jako vedlejší efekt rozsáhlého tréninku na tom, jak roboti v různých situacích vnímají svět a reagují na něj.
Širší kontext: méně univerzální ruka, více nástrojů
Generalist AI v červnu 2026 oznámila investici 400 milionů dolarů, která má pomoci zvýšit výpočetní kapacitu a pokračovat ve vývoji modelů pro fyzickou AI. Firma tehdy uvedla, že celkem získala více než půl miliardy dolarů. Peníze samy o sobě robotům šikovnější prsty nepřidají, umožní ale sbírat a zpracovávat větší objemy interakčních dat.
V červenci pak Generalist představila práci Towards Machines with a Thousand Hands. V ní popisuje, jak model GEN-1 pracuje s různými koncovými efektory: od pětiprstých rukou přes kleště až po specializované nástroje. Společnost uvádí dataset s více než půl milionem hodin reálných interakcí a přibližně 9 000 variantami koncových efektorů. To je důležitý směr celého oboru: robot nemusí mít jednu univerzální lidskou ruku, pokud dokáže rozumět různým nástrojům.
Pro výrobní firmy by takový přístup mohl být zajímavější než robot naprogramovaný na jednu neměnnou pozici. Pokud se změní produkt, pracovní plocha nebo použitý nástroj, teoreticky by nemuselo být nutné celé pracoviště přeprogramovat od začátku. Zatím ale hovoříme o směru vývoje, nikoli o hotovém řešení, které si česká firma objedná přes běžný e-shop.
Největší problém je stále spolehlivost
Průměrná úspěšnost 59 procent při učení z jediné ukázky je působivá jako výzkumný výsledek, ale pro bezpečný provoz nestačí. Ve skladu, laboratoři nebo domácnosti je rozdíl mezi „většinou to vyjde“ a „můžeme tomu svěřit práci“ zásadní.
Navíc jde o výsledky prezentované samotnou společností. The Decoder upozorňuje, že testované úkoly byly krátké a jednoduché a že výsledky zatím nebyly nezávisle ověřeny. To je přesně důvod, proč je vhodné dívat se na videodemonstrace robotů s určitou rezervou. Video ukazuje nejlepší okamžik. Neukazuje automaticky počet neúspěšných pokusů, zásahy operátora ani to, jak systém reaguje na deset podobných, ale ne totožných situací.
Dalším limitem je dostupnost. GEN-1.5 není podle dostupných informací veřejná služba s tarifem pro české uživatele, nemá běžně nabízený bezplatný plán ani zveřejněnou cenu v dolarech, eurech nebo korunách. Nejde tedy o nástroj, který by si dnes mohl český vývojář otevřít v prohlížeči a vyzkoušet podobně jako chatbot. Model je určen především pro výzkum a průmyslové nasazení robotiky.
Co z toho plyne pro český trh
Pro české firmy je nejzajímavější především princip. Průmyslová automatizace v Česku stojí na robotech, kteří excelují v opakování přesně definovaných úkolů. Problém nastává ve chvíli, kdy se mění sortiment, velikost dílů nebo podmínky na pracovišti. Schopnost naučit robota nový postup z krátké ukázky by mohla snížit množství ručního programování.
To však neznamená, že se zítra objeví robot, který po jediném videu zvládne celou směnu ve výrobě. Neověřené výsledky, omezený počet úkolů a chybovost zatím ukazují spíše na výzkumný milník než na hotového pracovníka. Význam GEN-1.5 je v tom, že posouvá otázku od „dokáže robot zopakovat naprogramovaný pohyb?“ k praktičtější otázce: „dokáže pochopit nový fyzický úkol z krátké ukázky a přizpůsobit se mu?“
Odpověď zatím zní: v omezeném rozsahu ano, ale s výraznými podmínkami. A právě tyto podmínky rozhodnou, zda se podobné modely dostanou z laboratorních videí do továren, skladů a dalších provozů.
FAQ
Je GEN-1.5 dostupný v češtině?
Podle dostupných informací nejde o veřejně dostupný nástroj s českým rozhraním ani běžnou službu pro uživatele v Česku. Model je prezentován jako robotický výzkumný systém a jeho cena ani podmínky komerčního přístupu nejsou veřejně uvedeny.
Potřebuje robot po každé nové ukázce další trénink?
Ne nutně. GEN-1.5 používá ukázku jako fyzický prompt v kontextu a podle popisu dokáže úkol provést bez úpravy vah modelu. Dodatečné tréninkové kroky ale mohou podle zveřejněných testů zvýšit úspěšnost z 59 na 83 procent.
Lze výsledky GEN-1.5 porovnat s GPT, Gemini nebo Claude?
Přímé srovnání není férové. GEN-1.5 generuje akční trajektorie pro roboty a pracuje se senzory a propriocepcí, zatímco běžné jazykové modely vytvářejí text nebo analyzují multimodální vstupy. Pro GEN-1.5 navíc nejsou v dostupných materiálech uvedeny standardizované benchmarky porovnávající jej s těmito modely.
Zdroje: The Decoder, Generalist AI – Accelerating the Next Phase of Physical AI, Generalist AI – Towards Machines with a Thousand Hands.