Přejít k hlavnímu obsahu

Dyna-2 učí roboty z milionu hodin lidského videa. Proč je to důležitější než další chatbot

Ilustrační obrázek
Robot se nemusí učit pouze z robotických pohybů. Dyna Robotics tvrdí, že nový model Dyna-2 dokáže využít více než 1 000 000 hodin lidského videa natočeného z pohledu první osoby. Výsledkem má být lepší přenos dovedností na různá robotická těla – od průmyslových ramen přes pětiprsté ruce až po humanoidní prototypy.

Robot se učí sledováním člověka, ne jen opakováním pohybu

Robotika má jeden nepříjemný problém: robotům chybí data. Ne v podobném smyslu jako jazykovým modelům, kterým můžete naservírovat obrovské množství textu z internetu. U robotů musí data popisovat také fyzický kontakt se světem – jak se předmět pohne, když se ho dotkne ruka, kolik síly je potřeba k uchopení nebo co se stane, když víčko nejde otevřít napoprvé.

Taková data se tradičně získávají teleoperací. Člověk ovládá robotické rameno nebo humanoidní ruce a systém zaznamenává každý pohyb. Je to přesné, ale drahé a pomalé. Každá další hodina znamená člověka, robotické zařízení a kontrolované prostředí. Natočit milion hodin robotické teleoperace by nebyl datový projekt, ale logistický trest.

Dyna Robotics proto zvolila jiný přístup. Dyna-2, označovaný jako World-Action Model, je předtrénovaný na více než milionu hodin egocentrického videa. Kamera se přitom dívá na svět podobně jako člověk – vidí ruce, pracovní plochu, nástroje i předměty, se kterými člověk manipuluje. Společnost uvádí, že jde přibližně o ekvivalent 170 let bdělého života. Číslo zní jako název zvlášť ambiciózní televizní reality show, ale dobře ukazuje měřítko dat.

Podle technického reportu Dyna Robotics model nepracuje pouze s akcemi, které má robot provést. Současně se učí předvídat, jak se bude vyvíjet obraz budoucího světa. Jednoduše řečeno: nesnaží se jen říct „pohni rukou doprava“, ale také odhadnout, co se po tomto pohybu stane.

Co je World-Action Model a v čem se liší od VLA

Dosavadní modely pro robotiku často používají architekturu VLA, tedy Vision-Language-Action. Model dostane obraz, instrukci a následně vygeneruje akci. V praxi je to podobné jako navigace, která se podívá na mapu a ihned řekne, kam zatočit.

Dyna-2 přidává další vrstvu. Vedle budoucí akce predikuje také budoucí video. Model tak vytváří interní představu o tom, jak by se měla změnit scéna. Dyna Robotics používá video-difuzní základ a trénink pomocí takzvaného flow matching. Pro běžného uživatele není nutné znát matematické detaily: důležité je, že model se učí z vývoje situace, nikoli pouze z izolovaných povelů.

Akční část modelu přitom při samotném provozu nemusí generovat celé budoucí video. Predikce světa slouží především k vytvoření lepší reprezentace prostředí během učení. To má být důležité pro přenos dovedností mezi různými typy robotů. Člověk má jiné tělo než robotické rameno, ale principy fyzického světa – gravitace, kontakt, odpor nebo pohyb předmětu – zůstávají stejné.

Více videa znamená lepší přenos na roboty

Nejzajímavější částí oznámení není samotné číslo milionu hodin. Dyna Robotics testovala několik datových úrovní: 1 000, 10 000, 100 000 a 1 000 000 hodin lidského videa. Modely potom porovnávala nejen na lidských záznamech, ale také na robotických úlohách, které během předtrénování neviděly.

Výsledky podle firmy ukazují předvídatelný růst výkonu s množstvím lidských dat. Na sadě 39 robotických úloh se zlepšoval zero-shot výkon, tedy výsledek bez dodatečného učení na konkrétním robotovi. Dyna Robotics uvádí také bod zlomu mezi 10 000 a 100 000 hodinami, kdy se přenos schopností začal projevovat výrazněji.

V navazujícím testu na 14 úlohách rostlo průměrné normalizované skóre z 20 přes 28 a 45 až na 53 procent maxima. Model trénovaný na největší sadě byl nejlepší v devíti ze 14 úloh. U otáčení klíčem v uzamykatelné schránce se výkon až do hranice 100 000 hodin prakticky neprojevil, ale při milionu hodin dosáhl 90procentní úspěšnosti.

Důležitý je také experiment s videem bez akčních popisků. Při pevném množství akčních dat přidání dalšího lidského videa zlepšovalo zobecnění na robotická data. To naznačuje, že robot nemusí ke každému záběru znát přesnou trajektorii lidské ruky. Stačí, když se učí, jak svět reaguje na lidské činnosti.

Oproti předchozí generaci má být rozdíl vidět v provozu

Dyna Robotics porovnala ranou verzi Dyna-2 s předchozím systémem Dyna-1 založeným na přístupu VLA. Ve srovnání na sedmi úlohách dosáhl Dyna-2 podle firmy 1,55násobné úspěšnosti a 1,12násobného skóre. V přímých soubojích vyhrál Dyna-2 v 65 procentech případů, zatímco Dyna-1 ve 29 procentech. Autoři současně upozorňují, že šlo o ranou variantu Dyna-2 a testovací podmínky byly v některých ohledech nastavené ve prospěch původního VLA modelu.

Na zákaznických pracovištích uvádí Dyna Robotics úspěšnost 87 procent oproti 46 procentům u Dyna-1. Jde o výsledek, který je pro nasazení důležitější než laboratorní skóre. Robot může v interním testu působit dokonale, ale skutečný provoz přidá jiné osvětlení, méně uklizené prostředí, odlišné předměty nebo pracovní plochu, která zjevně neměla respekt k vývojářům.

Výrazně se zlepšila také přesnost u výrobních úloh. Podle dostupných údajů vzrostla úspěšnost z přibližně 20 procent na 80 až 90 procent. Nový model se navíc dokázal adaptovat na úkol, jako je odšroubování víčka lahve pětiprstou robotickou rukou, přibližně po 13 minutách lokálních dat.

Jednokroková destilace řeší problém s rychlostí

Video-difuzní modely mají jednu přirozenou nevýhodu: generování výsledku obvykle vyžaduje více kroků. Pro robota, který musí reagovat v reálném čase, není ideální čekat, až se výpočetní proces pomalu dopracuje k pohybu. Dyna Robotics proto představila jednokrokovou destilační pipeline.

Podle technického reportu se čas vzorkování videa snížil z 10 203 milisekund na 110 milisekund na jednom akcelerátoru H100. Jde přibližně o stonásobné zrychlení. To neznamená, že celý robotický systém automaticky reaguje za 110 milisekund – do výsledné latence vstupují kamery, řízení motorů, bezpečnostní kontroly i komunikace. Je to ale důležitý krok, protože samotné generování už nemusí být hlavní brzdou.

Dyna-2 není model ke stažení ani robot pro domácnost

Praktická dostupnost má k otevřenému AI modelu poměrně daleko. Dyna-2 nemá veřejně dostupné váhy, API ani zveřejněný ceník. Nasazení probíhá jako komerční řešení na klíč, tedy nákupem robotické buňky přímo od Dyna Robotics. Zájemce si proto nemůže model stáhnout, pustit lokálně nebo napojit do vlastního experimentu podobně jako běžný jazykový model.

To také znamená, že není potvrzena samostatná dostupnost modelu v češtině. Dyna-2 není chatbot a jeho hlavním úkolem není vést konverzaci. U jedné z testovaných úloh model pracoval s textovou instrukcí pro vyhledání konkrétního nápoje v lednici, ale veřejně dostupné informace nepotvrzují české rozhraní ani podporu českých hlasových povelů.

Pro české firmy je tedy novinka relevantní především jako ukázka směru, kterým se ubírá průmyslová a servisní robotika. Technologie může být zajímavá pro gastronomii, komerční prádelny, lehkou výrobu, kompletaci nebo úklid. Nejde však o produkt, který by si dnes pořídila běžná domácnost nebo menší vývojářský tým v Česku.

Největší hodnota je v datech, ne v marketingovém názvu

Dyna-2 ukazuje změnu v uvažování o učení robotů. Dříve bylo přirozené říkat, že robot potřebuje hlavně data z robotů. Tento výzkum tvrdí něco odvážnějšího: velká část fyzického porozumění může vzniknout z lidského videa a následně se přenést na odlišné robotické tělo.

To ale neznamená, že lidské video vyřešilo robotiku. Model stále potřebuje post-training na konkrétních úlohách, robotické platformě a provozním prostředí. Bezpečnostní limity, práce s neznámými předměty a spolehlivost při dlouhých sériích úkonů zůstávají praktickými otázkami.

Za důležitý považuji hlavně důkaz, že video může fungovat jako samostatná škálovací osa. Nejde jen o to přidávat další ručně označené pohyby. Dyna-2 se snaží využít obrovský objem přirozeného lidského chování, podobně jako jazykové modely využívají velké množství běžně dostupného textu. Rozdíl je v tom, že robot musí nakonec z obrazovky přejít k motoru. A motor se na rozdíl od textu umí skutečně opřít do stolu.

FAQ

Lze si Dyna-2 stáhnout a vyzkoušet doma?

Ne. Dyna Robotics nezveřejnila váhy ani veřejné API. Podle dostupných informací se Dyna-2 nasazuje jako součást komerční robotické buňky dodávané firmou.

Potřebuje Dyna-2 pro každý nový úkol hodiny robotických dat?

Ne vždy. U úkolu odšroubování víčka lahve pětiprstou rukou stačilo podle technického reportu přibližně 10 až 13 minut lokálních demonstračních dat. Konkrétní náročnost ale závisí na robotickém těle a úloze.

Je Dyna-2 dostupný v češtině?

Veřejně není potvrzena česká lokalizace ani české hlasové ovládání. Dyna-2 je především model pro robotickou manipulaci, nikoli samostatný chatbot pro běžné uživatele.

Zdroje: technický report Dyna Robotics a souhrn oznámení na MarkTechPost.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.