Jeden model místo několika částí
Většina multimodálních systémů dnes skládá několik specializovaných částí. Jedna rozpozná obraz, další pracuje s textem, jiná vytváří video a robotický systém nakonec převede výsledek na pohyb. Rho-1 se vydává opačným směrem. Text, obraz, video i motorické povely převádí do společného stavu, se kterým pracuje jedna síť.
Pro uživatele to znamená hlavně méně přepínání mezi nástroji. Ve zveřejněné ukázce model nejprve vytvoří scénu, potom ji rozpohybuje, upraví podle nového zadání a odpoví na otázku, co se ve videu změnilo. Reakce navazují na předchozí obsah. Model nemusí každý nový úkol řešit od začátku.
Reka tento přístup popisuje jako spojení porozumění, simulace a jednání. Obraz není pouze vstupem pro popis. Model z něj může odhadnout, co se stane dál, a výsledek použít při tvorbě dalšího obrazu nebo při návrhu akce.
Technicky jde o práci s různými druhy tokenů. Text a symbolické příkazy jsou zastoupené diskrétními tokeny. Obraz, video, motorické povely a údaje o poloze robota používají spojité reprezentace. Všechny se ukládají do společného kontextu a sdílejí stejnou KV cache, tedy pracovní paměť modelu pro předchozí části relace.
Oficiální popis Rho-1 uvádí, že model při těchto přechodech nepotřebuje volat externí nástroj ani předávat úkol jinému modelu. To je rozdíl proti agentním systémům, které často plánují úkol přes několik samostatných komponent.
Video a ovládání robota ve stejném stavu
Rho-1 má 19 miliard parametrů. Reka ho trénovala od nuly přibližně tři měsíce na 320 GPU NVIDIA H100. Základní varianta podle interního měření firmy generuje video mediánovou rychlostí 0,79násobku reálného času. Při přehrávání tedy za jednu sekundu vytvoří zhruba 0,79 sekundy výsledného videa.
Firma zveřejnila také destilovanou variantu. Ta zkracuje proces odšumování z 99 kroků na 8 kroků a podle Reka AI vytvoří klip dlouhý 5,3 sekundy přibližně za jednu sekundu. Jde o údaj z interního testování, nikoli o nezávislé srovnání.
Stejné váhy, které předpovídají další snímky kamery, mají podle návrhu modelu pomáhat také s pohyby robota. Rho-1 může přijmout obraz z kamery, instrukci v textu a údaje o poloze zařízení. Výstupem pak není pouze slovní odpověď, ale také trajektorie nebo sada motorických akcí.
V praxi může takový systém například sledovat uchopení předmětu, odhadovat další polohu ruky a průběžně upravovat pohyb. Zveřejněné ukázky se týkají také robotických ramen, vozíků, roverů a dalších scén s fyzickým pohybem. Nejde ale o veřejný produkt, který by bylo možné připojit k domácímu robotu.
Rho-1 podle firmy dokáže přijmout novou instrukci i během generování videa. Nový pokyn tedy nemusí znamenat úplný restart celé relace. To je důležité u simulací a robotiky, kde se podmínky mění průběžně a systém musí reagovat na aktuální obraz.
Data pro roboty z běžných videí
Robotické modely mají jeden praktický problém. Kvalitních záznamů s přesnými motorickými povely je málo. Internet je plný videí, ale většinou neobsahují informaci o tom, jaký kloub se pohnul, jakou rychlostí nebo jaký povel řídicí jednotka v daný okamžik obdržela.
Reka proto 2. října 2026 zveřejnila model RIDM, tedy Reka Inverse Dynamics Model. Ten z krátkého videa odhaduje nízkoúrovňové povely, které mohly vést ke změně mezi jednotlivými snímky. Může například určit pohyb vpřed, do strany, otočení nebo náklon kamery.
Podle popisu RIDM od Reka AI byl model trénovaný na videohrách. Záznamy ze hry obsahovaly obraz, stisknuté klávesy a údaje o pohybu kamery. RIDM se následně použil na videa z reálného světa, kde žádné akční štítky k dispozici nebyly.
Tento postup může z obyčejných videí vytvořit trénovací data pro takzvané světové modely. Ty se snaží simulovat prostředí a předpovědět, jak se změní po určité akci. Rho-1 pak může obrazovou předpověď a motorický povel zpracovávat společně.
Výsledek je zajímavý hlavně pro výzkum robotiky a simulací. RIDM však automaticky nezaručuje, že odhadnutý povel odpovídá skutečnému pohybu konkrétního robota. Internetové video může mít nejasnou perspektivu, střih, skryté pohyby nebo jinou fyziku. Reka proto hovoří o výzkumném využití, nikoli o hotovém univerzálním řídicím systému.
Součást širšího směru Reka AI
Rho-1 nepřišel izolovaně. Reka AI v posledních týdnech zveřejnila také EdgeQ, technologii pro lokální běh multimodálního modelu na zařízení s procesorem Qualcomm Snapdragon 8 Elite. Na telefonu Samsung S25 firma naměřila u EdgeQ první odpověď za 0,73 sekundy při práci s jedním obrázkem a za 2,4 sekundy u videa se šesti snímky.
Výsledky EdgeQ pocházejí z testů společnosti Reka AI a porovnávají její implementaci s modelem Gemma 4 E4B. EdgeQ v těchto měřeních používá NPU telefonu, zatímco srovnávaná varianta Gemma běžela na GPU. Tato čísla proto nelze přímo přenést na Rho-1. Ukazují ale, že Reka současně řeší výzkum velkých modelů i jejich provoz na menších zařízeních.
Směr vývoje zapadá do širšího zájmu o takzvané world models, tedy modely schopné udržovat představu o prostředí a odhadovat jeho další stav. Textové modely odpovídají na instrukce. Vizuální modely popisují obrázky nebo generují video. Rho-1 se snaží tyto schopnosti spojit s akcí, která může změnit sledované prostředí.
Dostupnost, cena a srovnání
Rho-1 je k 6. říjnu 2026 dostupný pouze jako research preview. Reka AI nezveřejnila jeho váhy, veřejné API ani komerční ceník. Oficiální oznámení vyzývá zájemce z oblasti robotiky, simulací a uzavřených obrazově-akčních systémů ke kontaktu s firmou.
Pro české uživatele to znamená, že model zatím nelze běžně vyzkoušet v českém rozhraní ani zakoupit jako předplatné. Reka neuvedla podporu češtiny ani podmínky dostupnosti pro EU. Veřejné API dokumentace aktuálně popisují jiné modely Reka, například Reka Edge a Reka Flash, nikoli Rho-1.
Ve srovnání s běžnými jazykovými modely je proto důležitější architektura než skóre v testech. Reka pro Rho-1 v oznámení neuvedla benchmarky, které by umožnily férové srovnání s modely GPT, Gemini nebo Claude. Není tedy doloženo, že by byl lepší v textových odpovědích, rozpoznávání obrazu nebo generování videa. Zveřejněné výsledky se týkají rychlosti a ukázek fungování.
Omezení je podstatné. Rho-1 zatím nemá veřejné váhy ani standardní způsob nasazení. Ukázky pocházejí od autora modelu a popsané rychlosti jsou interní měření. K dispozici také není nezávislý test přesnosti robotických akcí v běžných podmínkách. Nejstřízlivější závěr proto zní, že Reka zveřejnila zajímavý výzkumný směr, nikoli hotový nástroj pro domácnosti nebo firmy.
FAQ
Lze Rho-1 vyzkoušet zdarma?
Ne. K 6. říjnu 2026 je Rho-1 pouze ve fázi research preview. Reka AI nezveřejnila veřejné váhy, běžné API ani ceník. Zájemci o spolupráci mají kontaktovat přímo firmu.
Podporuje Rho-1 češtinu?
Reka AI v oznámení neuvedla konkrétní podporované jazyky ani české rozhraní. Dostupnost modelu v češtině proto není veřejně potvrzená.
Je RIDM samostatný robotický ovladač?
Ne. RIDM odhaduje nízkoúrovňové pohyby z videa a vytváří tak akční štítky pro trénování světových modelů. Samotný model není popsaný jako univerzální ovladač fyzického robota.