Problém není jen v modelu, ale také v infrastruktuře
AI agent, který umí pracovat s počítačem, musí zvládnout něco podstatně složitějšího než běžný chatbot. Nestačí mu vygenerovat textovou odpověď. Musí pochopit obrazovku, kliknout na správné místo, napsat text, otevřít nabídku, počkat na reakci aplikace a případně opravit chybu.
Každý takový krok je potřeba trénovat a měřit v kontrolovaném prostředí. Právě zde podle autorů CUA-Lite dosud vznikal zbytečný chaos. Agenti, testovací prostředí, datové sady a nástroje pro vyhodnocování často existovaly v oddělených repozitářích a používaly nekompatibilní rozhraní.
CUA-Lite se snaží tuto skládačku sjednotit. Nabízí společné akční rozhraní, jednotný datový formát a jeden způsob spouštění úloh napříč desktopem, webem i mobilem. Vývojář tak nemusí pokaždé stavět vlastní převodník mezi konkrétním modelem, benchmarkem a sandboxem.
Platforma je dostupná globálně přes projektovou stránku CUA-Lite, GitHub a Hugging Face. Nejde o službu s českým uživatelským rozhraním ani o nástroj určený pro běžné domácí použití. Pro české vývojáře je ale dostupný stejně jako pro zbytek světa, protože jde o veřejný open-source projekt a datasety.
Lite.OSWorld nahrazuje virtuální stroj Dockerem
Nejkonkrétnější částí projektu je Lite.OSWorld. Benchmark OSWorld slouží k měření schopností agentů v desktopovém prostředí Ubuntu. Agent v něm například pracuje s kancelářskými aplikacemi, soubory nebo systémovými nástroji.
Klasické OSWorld používá pro každou úlohu plnohodnotný QEMU/KVM virtuální stroj. Ten nabízí vysokou míru izolace, ale zároveň vyžaduje podporu nested virtualizace a přístup k zařízení /dev/kvm. To může být problém v cloudu, v CI pipeline nebo při spouštění dalších kontejnerů uvnitř hostovaného prostředí.
CUA-Lite stejnou sadu úloh a stejné vyhodnocování přesouvá do GNOME desktopu běžícího v běžném Docker kontejneru. Podle zveřejněného srovnání má Lite.OSWorld následující parametry:
- 0,9 GB RAM na úlohu oproti 4,1 GB u standardního OSWorld,
- studený start za 23,8 sekundy oproti 29,9 sekundy,
- přibližně 4,6krát vyšší paralelismus na stejném hardwaru,
- stejnou sadu úloh a kompatibilní evaluátory.
Úspora paměti není jen hezké číslo do tabulky. Pokud firma nebo výzkumný tým spouští stovky desktopových úloh současně, každý gigabajt se násobí. Docker zde funguje podobně jako menší a rychleji startující pracovní boxy místo celých samostatných počítačů.
Nejdůležitější otázkou samozřejmě je, zda je výsledek z kontejneru stejně důvěryhodný jako výsledek z virtuálního stroje. Autoři uvádějí, že při testování na 13 AI modelech odpovídaly výsledky Lite.OSWorld měřením ze standardního OSWorld. To znamená, že trénovací signál získaný v odlehčeném prostředí by měl být přenositelný do původního benchmarku.
Jednotný formát dat má odstranit další část práce
Druhou hlavní součástí CUA-Lite je formát LiteSample. Ten sjednocuje data z různých prostředí a typů úloh do jedné struktury. V praxi jde o screenshoty spojené s akcemi, které má agent provést. Data jsou publikována jako Parquet soubory a obrázky.
Výhodou je, že vývojář nemusí každou datovou sadu ručně převádět do formátu konkrétního modelu. CUA-Lite používá adaptéry, které jednotná data připraví pro různé modelové rodiny. Součástí je také takzvané history collapsing, tedy způsob, jak sloučit více kroků historie do efektivnějšího zpracování.
Na Hugging Face jsou podle autorů připravené více než dvě desítky datasetů a přes deset již zpracovaných kolekcí pro supervizované dolaďování. Patří mezi ně například Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey nebo Multimodal-Mind2Web. K dispozici jsou také nové rollout datasety vytvořené průchodem učitelského modelu prostředím sandboxu.
To otevírá cestu k distilaci. Velký model může úlohy vyřešit a menší model se následně učí z jeho akcí. Neznamená to automaticky, že menší agent bude stejně schopný. Zkracuje se ale cesta od nasbíraných trajektorií k trénovatelným datům.
Od benchmarku přes SFT až po posilované učení
CUA-Lite není pouze kolekce testů. Platforma propojuje vyhodnocování, supervizované dolaďování neboli SFT a posilované učení. V praxi to znamená, že stejný typ prostředí lze použít nejprve pro měření agenta a poté pro jeho další trénink.
Projekt podporuje více než deset agentů a přes patnáct benchmarků. Zahrnuje desktopové úlohy v OSWorld a jeho variantách, webové prostředí WebArena nebo WebVoyager i mobilní testy AndroidWorld a MobileWorld. Mezi podporovanými modelovými rodinami jsou podle dokumentace například GPT, Claude, Gemini, Qwen, UI-TARS nebo MAI-UI.
Vývojář přitom mění hlavně identifikátor modelu a prostředí v příkazovém řádku. Právě tato jednoduchost je důležitější než další efektní demo. U agentů totiž bývá problémem nejen samotná schopnost modelu, ale také to, kolik ruční práce je potřeba k jeho férovému otestování.
Autoři zveřejňují také příklad SFT tréninku modelu Qwen3-VL-2B-Instruct na desktopových trajektoriích. Na 332 úlohách evaluačního rozdělení se průměrná návratnost zvýšila z 0,138 na 0,237. Jde o výsledek jedné popsané konfigurace na dvou GPU, nikoli o nezávisle zopakované měření. Číslo proto ukazuje potenciál pipeline, ale nelze ho číst jako univerzální zlepšení každého agenta.
Kolik CUA-Lite stojí a kde jsou limity
Samotná platforma ani publikované datasety nejsou prezentovány jako placená cloudová služba. Náklady se přesouvají na hardware, cloudové instance, modelové API a případné trénování. Pokud vývojář používá komerční model přes API, jeho cena se řídí ceníkem daného poskytovatele, nikoli CUA-Lite.
Důležitou brzdou pro firmy je licencování. V době zveřejnění repozitář podle dostupných informací neobsahuje explicitní komerční licenci. To je rozdíl mezi „kód si můžete stáhnout“ a „kód můžete bez obav použít v komerčním produktu“. Před nasazením ve firmě je proto nutné ověřit aktuální podmínky repozitáře, jednotlivých datasetů i použitých modelů.
Dalším limitem je technická náročnost. Instalace je podle dokumentace založena na Pythonu 3.12 a příkazu uv sync --all-extras. Pro člověka, který chce jen vyzkoušet AI agenta na notebooku, to není konkurence chatbotu v prohlížeči. CUA-Lite míří na vývojáře, výzkumníky a týmy, které potřebují opakovatelně trénovat a měřit počítačové agenty.
Proč na platformě záleží i mimo akademii
Počítačoví agenti se postupně přesouvají od odpovídání k provádění úkolů. Místo doporučení, kam kliknout, mají sami otevřít aplikaci, vyplnit formulář nebo upravit dokument. Jakmile se ale takové systémy používají v praxi, roste význam spolehlivého testování.
CUA-Lite tento problém neřeší lepším modelem, ale lepší dílnou. Díky jednotným sandboxům, datasetům a benchmarkům může být jednodušší porovnat, zda agent opravdu zvládá pracovní úkol, nebo jen dobře vypadá v krátké ukázce.
Pro české vývojáře je podstatné, že platforma je otevřená a dostupná bez regionálního omezení. Čeština však není v dostupných materiálech uváděna jako samostatná lokalizace ani jako speciální podporovaná funkce. CUA-Lite je především infrastruktura: poskytne prostředí a měření, ale kvalita práce v českých aplikacích bude záviset na konkrétním modelu, datech a úlohách.
Nejzajímavější na projektu tedy není samotný počet benchmarků. Je to snaha udělat z testování AI agentů běžnější technický proces. Pokud se podaří udržet kompatibilitu prostředí a výsledků, může méně času padnout na skládání experimentu a více na samotné zlepšování agenta. Což je u výzkumu příjemná změna. Počítače konečně mohou dělat část práce, kvůli které jsme je původně postavili.
FAQ
Je CUA-Lite určená i pro běžné uživatele bez programování?
Ne přímo. CUA-Lite je vývojářská a výzkumná platforma, která vyžaduje práci s Pythonem, Dockerem a příkazovou řádkou. Běžný uživatel z ní zatím nezíská hotového osobního asistenta pro ovládání počítače.
Lze CUA-Lite použít v komerčním projektu?
Technicky lze platformu provozovat na Docker hostu, ale před komerčním použitím je nutné ověřit licenci repozitáře, datasetů i jednotlivých modelů. V době zveřejnění nebyla u hlavního repozitáře uvedena explicitní komerční licence.
Podporuje CUA-Lite české aplikace a české prostředí?
Platforma podporuje desktopová, webová a mobilní prostředí, ale dostupné materiály neuvádějí speciální českou lokalizaci. Použití v českých aplikacích bude záviset hlavně na konkrétním agentovi, modelu a připravených úlohách.