Přejít k hlavnímu obsahu

Nvidia změřila, co AI agentům skutečně pomáhá: skills zvedly správnost o 41 bodů

Ilustrační obrázek
Nvidia tentokrát nepřišla s novou grafickou kartou, ale s hromadou nástrojů pro vývojáře — a s pár čísly, která stojí za pozornost. Ukázala světový model, který se vejde přímo na robota, konečně změřila, jestli takzvané „skills“ u AI agentů opravdu fungují, a výrazně zrychlila doporučovací systémy, na kterých denně běží i české e-shopy. Ne všechno je hotový produkt pro každého, ale dvě věci jsou překvapivě konkrétní.

Světový model, který se vešel do robota

Největší technická novinka se jmenuje Cosmos 3 Edge — model se 4 miliardami parametrů, který nemá běžet v cloudu, ale přímo na hardwaru robota, konkrétně na platformě Jetson Thor. Dosud platilo, že „mozek“ robota často běžel na výkonném počítači někde vedle nebo v datacentru. Tady se model vejde do paměti, kterou má robot fyzicky u sebe.

Co je vlastně světový model? Představte si ho jako vnitřní simulátor. Místo toho, aby robot slepě reagoval na každý snímek kamery, model mu předpovídá, co se stane dál, když udělá určitý pohyb. Je to podobné, jako když zkušený řidič „vidí“ dopředu, jak se auto zachová, ještě než otočí volantem. Model je navíc doplněný o menší „reasoner“ na bázi Nemotronu se 2 miliardami parametrů, který má pomáhat s uvažováním.

Čísla jsou konkrétní. Váhy zabírají zhruba 9 GB ve formátu BF16, takže se do Jetson Thor vejdou. Akční politika DROID vygeneruje jeden „chunk“ pohybu za přibližně 1,53 sekundy při rozlišení 640×540 a 15 snímcích za sekundu — přičemž jeden chunk pokryje zhruba 2,13 sekundy pohybu paže. Protože je další krok připravený dřív, než ten aktuální skončí, robotická ruka se pohybuje plynule bez trhání.

Ale pozor, tady je třeba zůstat střízlivý. V uzavřeném testu RoboLab dosahuje Edge politika úspěšnosti 22,9 %, zatímco větší Cosmos 3 Nano 36,8 %. To není chyba — je to záměrný kompromis mezi velikostí modelu a tím, co umí. Trénink je navíc drahý: validovaný běh spotřeboval 64 uzlů po čtyřech GB200, 60 000 iterací a zhruba 68 hodin výpočtu. Světový model na palubě robota je zatím spíš příslib než výrobní nástroj.

Skills pro AI agenty: konečně to někdo změřil

Pro běžného vývojáře je nejzajímavější jiná věc. Nvidia vydala open-source nástroj SkillEvaluator, který měří, jestli takzvané „skills“ — tedy balíčky instrukcí a návodů, které se agentovi přidají do kontextu — skutečně zlepšují jeho výkon. A poprvé k tomu máme pořádná data, ne jen pocit z dema.

Jak to funguje? Evaluace probíhá ve třech úrovních: statická kontrola bezpečnosti a struktury, analýza odlišnosti jednotlivých skills a nakonec živý test, kdy agent běží dvakrát ve vlastním sandboxu — jednou se skill, jednou bez něj — a všechny ostatní proměnné zůstávají stejné. Jednoduše řečeno, je to A/B test pro návody k agentům.

Výsledky na více než 300 ověřených skillech napříč 30 produkty Nvidie jsou jednoznačné. Správnost odpovědí vzrostla v průměru ze 46 na 87 bodů ze 100, tedy o 41 bodů. Efektivita stoupla z 39 na 78 a „objevitelnost“ — jestli agent vůbec najde a načte správný skill — z 42 na 82. Bezpečnost zůstala na 97, takže skills nepřinášejí regrese. Měřeno bylo na dvou harnessech, Claude Code a OpenAI Codex.

Ne všechno je ale růžové. Úspora tokenů není automatická. Skill jetson-optimize-memory srazil spotřebu z 617 306 na 142 540 tokenů (o 76,9 %) a čas z 474,9 na 220 sekund. Naopak skill cuopt-install tokenů přidal — z 25 227 na 55 582 — a čas prodloužil. To je vlastně ta nejcennější část: SkillEvaluator umí odhalit, kdy vám skill spíš škodí. Pluginy Nvidia nabízí pro Claude Code, Codex i Cursor.

Doporučovací systémy: z 7,65 % na 31,40 %

Třetí balík cílí na generativní doporučovací systémy — tedy to, co vám v e-shopu nabízí „mohlo by se vám líbit“. Nvidia zveřejnila repozitář recsys-examples s optimalizovanými implementacemi dvou architektur: HSTU od Mety a Semantic ID, které vzniklo v Googlu. Obě přeformulují doporučování na sekvenční úlohu — místo hledání podobných vektorů model předpovídá pravděpodobnost další položky, podobně jako jazykový model předpovídá další slovo.

Zajímavá je tu součástka DynamicEmb. Klasické embedding tabulky jsou statické, ale tady se řádky alokují jen pro ID, která model skutečně potká, a tabulka může přetéct z paměti GPU do hostitelské RAM. Nvidia uvádí, že efektivita výpočtu (Model FLOP Utilisation) vzrostla z 7,65 % na 31,40 % na dvou uzlech DGX H100, a inference s backendem AOTInductor a KV cache je 2,20–2,38× rychlejší než čistě Pythonové řešení. Společně s knihovnou nv-embedding-cache dosáhly na benchmarku DLRM v3 propustnosti 99 997 dotazů za sekundu.

Proč na tom záleží českému čtenáři? Protože doporučování je tichý tahoun internetového obchodu — od velkých tržišť po menší e-shopy. Vyžaduje ale Nvidia GPU, takže je to investice pro firmy, které už doporučovače ve velkém provozují, ne pro každého.

AI agent, který postavil edge aplikaci za 40 minut

Nvidia také zdokumentovala, jak nechat coding agenta stavět real-time aplikace na platformě Holoscan pro zpracování obrazu a signálů na okraji sítě. Tým použil Codex s GPT-5.6 v režimu maximálního přemýšlení a místo jednoho velkého promptu rozložil práci na malé ověřitelné iterace. První funkční verze — endoskopická aplikace se segmentací v reálném čase — vznikla za 40 minut a spotřebovala 11 milionů tokenů.

Optimalizovaná verze pak dosáhla 306,9 snímků za sekundu, tedy o 50,5 % víc než základ, a průměrnou latenci stáhla o 33,6 % na 3,247 ms. Ablační studie je poučná: bez skills stejný úkol trval 65 minut a spotřeboval 20 milionů tokenů, protože agent víc zkoušel metodou pokus–omyl. Bez nápovědy k CLI se agent nakonec k nástroji sám prokousal, ale vyprodukoval verzi 2,6× pomalejší. Závěr zní povědomě: lepší kontext = méně plýtvání.

Šedé poruchy v datacentru, které nikdo nehlásí

Poslední publikace se týká pozorovatelnosti AI infrastruktury a pojmu grey failures — situací, kdy je hardware degradovaný, ale systém ho nehlásí jako vypnutý. Nvidia uvádí příklad: distribuovaný trénink běží šest hodin s nižší propustností, než tým zjistí, že na vině je jediný link InfiniBand se zvýšenou chybovostí bitů. Protože trénink funguje synchronně, jeden pomalý uzel zdrží celý cluster.

Doporučení je jednoduché a přenositelné i mimo Nvidii: nesledovat, kolik máte dashboardů, ale jestli signál dokáže pojmenovat vadnou součást a říct, co dělat dál — než spálíte drahý výpočetní čas. Pro české provozovatele datacenter je to užitečná připomínka, že víc exporterů automaticky neznamená lepší monitoring.

Můžu si nástroje od Nvidie vyzkoušet i jako český vývojář?

Ano. Repozitáře recsys-examples, nv-embedding-cache i SkillEvaluator jsou volně dostupné na GitHubu. SkillEvaluator a pluginy pro Claude Code, Codex a Cursor nevyžadují vlastní Nvidia hardware. Doporučovací systémy a Cosmos 3 Edge ale ano — běží na GPU Nvidia, respektive na platformě Jetson Thor.

Co přesně je „skill“ u AI agenta a jak si ho nainstaluju?

Skill je balíček instrukcí, příkladů a postupů, který se agentovi přidá do kontextu, aby konkrétní úkol řešil správně. Instaluje se přes pluginy pro Claude Code, Codex nebo Cursor, případně z katalogů jako Skills.sh. SkillEvaluator vám pak pomůže ověřit, jestli daný skill agentovi skutečně pomáhá, nebo mu jen zvyšuje spotřebu tokenů.

Proč má menší Cosmos 3 Edge nižší úspěšnost než větší Nano?

Je to záměrný kompromis. Menší model se vejde do paměti robota a běží přímo na Jetson Thor, ale za cenu nižší přesnosti — v testu RoboLab 22,9 % oproti 36,8 % u Nano. Větší model je schopnější, ale vyžaduje výkonnější hardware, který se do robota fyzicky nevejde.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.