Přejít k hlavnímu obsahu

AI agent nejdřív vybere nejlepší experiment. Meta tak šetří GPU hodiny i drahý výzkum

Ilustrační obrázek
Nejdražší část některých AI experimentů není napsat kód, ale několik hodin čekat, než se vůbec ukáže, zda měl nápad smysl. Meta FAIR proto představila AI Research Preference Models, zkráceně RPM. Tyto modely neodhadují přesné skóre budoucího experimentu. Místo toho porovnají několik návrhů mezi sebou a vyberou ten, který má podle dostupných informací největší šanci uspět.

Je to poměrně praktický nápad. AI agent může během několika minut navrhnout patnáct variant úpravy modelu, dat nebo trénovacího postupu. Každou z nich ale není možné okamžitě spustit. Výpočetní kapacita GPU je omezená, experimenty mohou běžet hodiny a některé pokusy skončí jen drahou připomínkou, že elegantní hypotéza ještě není dobrý výzkumný plán.

Výzkumníci z Meta FAIR ve spolupráci s University of Oxford a University College London se pokusili tento problém řešit vrstvou, která stojí mezi generováním nápadu a jeho skutečným spuštěním. Výsledkem jsou RPM, jejichž princip popisuje výzkumná práce na arXivu publikovaná v srpnu 2026.

AI agent už nemusí spouštět každý nápad

Současné výzkumné agenty lze přirovnat k týmu programátorů, kteří bez přestávky navrhují nové experimenty. Jeden agent připraví změnu architektury, druhý upraví trénovací postup a třetí zkusí jiná data. Problém nastává ve chvíli, kdy je potřeba každý návrh reálně otestovat.

RPM funguje jako předběžný výběrový výbor. Neříká: „Tento experiment dosáhne skóre 84,2.“ Takto přesná předpověď by byla u nových výzkumných nápadů často spíše věštěním než měřením. Model místo toho dostane několik kandidátů a rozhoduje, který z nich je pravděpodobně lepší než ostatní.

V praxi tedy agent vygeneruje 15 kandidátních experimentů paralelně. RPM je následně porovná v turnaji typu knockout. Do plného běhu na GPU postoupí pouze vítězný návrh. Ostatní se nemusí vůbec spouštět. GPU tak netráví noc testováním čtrnácti slepých uliček, což je ve výzkumu poměrně rozumný způsob, jak neutrácet elektřinu za kreativitu bez výsledku.

Dvě varianty: rychlý odhad a krátký pilot

Meta popisuje dvě varianty RPM. První se označuje jako inference-only RPM. Ta pracuje pouze s dostupným kontextem: analyzuje plán experimentu, jeho kód a historii předchozích pokusů. Nepouští žádný nový test, takže její rozhodnutí je rychlé a levné.

Druhá varianta se jmenuje agentic RPM. Ta si před konečným výběrem dovolí provést malé pilotní experimenty. Celkový rozpočet pro tuto fázi je přibližně pět minut. Nejde tedy o plnohodnotné trénování, ale o rychlou kontrolu, zda návrh například nepadá na chybějícím importu, nesmyslném nastavení nebo očividně špatně zvoleném směru.

Rozdíl připomíná výběr automobilu. Inference-only varianta se rozhoduje podle technických údajů, fotografií a historie vozu. Agentic varianta si před koupí dovolí krátkou zkušební jízdu. Ani jedna možnost nezaručí, že auto bude bez problémů dalších deset let, ale druhá dokáže odhalit některé potíže dříve.

Nejde o nový trénovaný model

Jedním z důležitých detailů je, že RPM nejsou postavené jako další samostatný odměňovací model, který by Meta musela dlouze trénovat na obrovském množství lidských hodnocení. Výzkumníci používají zmrazený předtrénovaný jazykový model, například Qwen3.6-27B, a jeho parametry během této úlohy nemění.

Model tedy funguje spíše jako analytik nebo rozhodčí. Dostane kandidátní plány, kód a kontext z již prozkoumaných větví. Následně vysvětluje, který návrh považuje za perspektivnější. V hodnoticím procesu se počítá s tím, že některé chyby jsou opravitelné, zatímco duplicita nebo slepé opakování již vyzkoušeného směru mají být penalizovány.

Meta k nastavení hodnoticích kritérií použila také optimalizaci promptu pomocí systému MIPROv2. Přesnost offline výběru se tím podle výsledků zvýšila z 57,7 na 59,0 procenta. Není to magické číslo, které by z modelu dělalo neomylného vědce. Je to ale důležitý signál: i malé zlepšení výběru může mít velký dopad, pokud se rozhoduje o stovkách nebo tisících GPU běhů.

Výsledky na 20 úlohách AIRS-Bench

RPM byly zapojeny do systému AIRA-dojo, který slouží k autonomnímu hledání a testování návrhů pro strojové učení. Výzkumníci je hodnotili na benchmarku AIRS-Bench, jenž obsahuje 20 úloh zaměřených na schopnosti AI agentů při ML výzkumu. Benchmark a související nástroje jsou dostupné jako open source v repozitáři AIRS-Bench.

Náhodný výběr, respektive základní baseline, dosáhl průměrného skóre 0,684. Inference-only RPM zvýšil výsledek na 0,711. Agentic RPM s krátkými pilotními testy se dostal na 0,729.

Ještě zajímavější je časový údaj. Obě varianty RPM podle autorů dosáhly přibližně stejného výsledku jako neřízený agent po 24 hodinách už za zhruba 15 hodin. To odpovídá úspoře přibližně 37,5 procenta času při zachování srovnatelného výkonu.

Výsledek samozřejmě neznamená, že každý AI výzkumný agent bude automaticky o třetinu levnější. Záleží na typu úlohy, ceně infrastruktury, délce experimentů a kvalitě generovaných kandidátů. Ukazuje ale, kde může vzniknout praktická úspora: nikoli nutně ve schopnosti napsat více kódu, ale ve schopnosti rozhodnout, který kód má vůbec cenu spouštět.

Kontext je důležitější než sebevědomí modelu

Výzkum také sledoval, jak se mění přesnost hodnocení podle množství kontextu. Bez kontextu dosáhla přesnost přibližně 60,7 procenta. Při práci se 100 kontextovými uzly vzrostla na 65,0 procenta.

Kontextové uzly si lze představit jako záznamy předchozích experimentů v průzkumném stromu. Každý obsahuje návrh, provedené změny a dosažený výsledek. RPM tak nehodnotí kandidáta izolovaně, ale vidí, kudy už se agent vydal a které směry selhaly nebo naopak přinesly slibné výsledky.

To je důležité i z praktického hlediska. Jazykový model může být velmi dobrý v popisu experimentu, ale bez historie neví, zda podobný nápad někdo před chvílí nevyzkoušel. Výzkumná paměť zde funguje podobně jako mapa. Bez ní může agent působit aktivně, ale stále chodit v kruhu.

Co to znamená pro české vývojáře

RPM nejsou spotřebitelská aplikace, kterou si český uživatel stáhne do telefonu. Nejde ani o novou funkci běžného chatbota s českým rozhraním. Výzkum míří především na týmy, které provozují vlastní ML experimenty, mají přístup ke GPU infrastruktuře a dokážou pracovat s open-source agentními frameworky.

Pro české a evropské vývojáře je nicméně podstatné, že AIRA-dojo i AIRS-Bench jsou dostupné veřejně. Technicky orientované týmy si tak mohou princip vyzkoušet bez čekání na komerční cloudovou službu. Praktická dostupnost v češtině ale potvrzena není a celý workflow předpokládá znalost Pythonu, strojového učení, práce s GPU a experimentální metodiky.

Cena se proto nepočítá jako měsíční předplatné. Hlavním nákladem je výpočetní čas, infrastruktura a práce lidí, kteří musí připravit úlohy, data a bezpečné prostředí pro spouštění kódu. RPM mohou tento účet snížit tím, že omezí počet plných běhů, ale neodstraní potřebu kvalitního experimentálního návrhu ani kontroly výsledků.

Největší limit: dobrý nápad nemusí vypadat dobře předem

Ranking je užitečný, ale pořád jde o predikci. Model vybírá z informací, které dostane. Pokud je kandidát neobvyklý, ale skutečně průlomový, může ho RPM označit za méně slibný, protože se nepodobá známým vzorcům. Stejně tak může dobře napsaný návrh působit přesvědčivěji než nápad, který je syrový, ale potenciálně zajímavý.

Výzkumníci proto RPM nepředstavují jako náhradu za plné experimentování. Spíše jde o filtr, který pomáhá lépe rozdělit omezený rozpočet. Vědecký proces stále potřebuje náhodné zkoušení, slepé uličky i lidský úsudek. Jinak by systém mohl začít vybírat jen bezpečné varianty a přehlížet směry, které nemají okamžitě přesvědčivý popis.

Nejzajímavější na práci Meta FAIR tak není samotná zkratka RPM, ale změna v uvažování o AI agentech. Agent už nemusí být jen stroj na generování dalšího návrhu. Může také rozhodovat, které návrhy vůbec stojí za utracení výpočetního času. A právě tam se u autonomního výzkumu může skrývat rozdíl mezi rychlým generováním nápadů a skutečně efektivním hledáním.

FAQ

Je možné RPM používat jako běžný chatbot v češtině?

Ne. RPM jsou výzkumná komponenta pro AI agenty, kteří navrhují a spouštějí ML experimenty. Ve zdrojích není uvedeno české uživatelské rozhraní ani samostatná spotřebitelská aplikace.

Nahrazují AI Research Preference Models lidského výzkumníka?

Nenahrazují. RPM pouze porovnávají kandidátní experimenty a pomáhají rozhodnout, který z nich spustit. Stále potřebují kvalitní zadání, experimentální infrastrukturu a kontrolu výsledků člověkem.

Kolik stojí používání RPM?

Výzkum neuvádí cenu ve formě předplatného ani komerčního API. Náklady vznikají především provozem GPU, pilotními testy a další infrastrukturou potřebnou ke spuštění AI výzkumného agenta.

Zdroje: odborná práce AI Research Preference Models, AIRS-Bench na GitHubu, AIRA-dojo na GitHubu, MarkTechPost.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.