Přejít k hlavnímu obsahu

Meta naučila AI, co zkoumat dál. V důkazech zvládla všech 30 úloh

Ilustrační obrázek
Autonomní výzkumní agenti umějí spouštět experimenty, číst výsledky a psát další kód. Narazí ale na problém, který zná každý doktorand: jak se rozhodnout, co zkoumat dál, když je nápadů víc než času a rozpočtu. Tým z Meta AI navrhuje architekturu MIRA, která plánování výzkumu odděluje od jeho provádění. Na sadě matematických důkazů IMOProofBench agent vyřešil všech 30 úloh, zatímco přímý postup dosáhl 67,1 procenta.

Problém: řídká rozhodnutí, opožděné výsledky

Výzkum není jen řetězec experimentů. Je to taky sled rozhodnutí: kterou hypotézu testovat, který výsledek ověřit, kdy směr opustit a kdy skončit. Jenže tato rozhodnutí jsou v dlouhých záznamech řídká a jejich následky se projeví až o několik kroků později. Nepovedený experiment může vyvrátit špatnou hypotézu a otevřít cestu dál, zatímco slibný směr může skončit ve slepé uličce.

Autoři práce Learning What to Investigate Next proto tvrdí, že na kvalitě výzkumu se podílí méně samotné provedení jednotlivého experimentu a víc volba, co zkoumat dál. Druhý problém je technický: důkazy z mnoha pokusů rychle přerostou kontextové okno modelu, takže si agent nemůže nosit celou historii v hlavě.

Jak MIRA funguje

MIRA, celým názvem Meta-reasoning for Iterative Research Agents, stojí na hierarchii tří vrstev. Trvalou pamětí je gitový repozitář, který přežije celý výzkumný běh: drží aktuální artefakt, předchozí experimenty, analýzy i předávací poznámky. Na něj navazuje vnější smyčka (meta-reasoner), která z trvalého záznamu vybere podstatné souvislosti a napíše „pracovní příkaz" pro další zkoumání, případně rozhodne o ukončení. Samotnou práci pak odvede čerstvá vnitřní smyčka (executor), která každý příkaz spustí přes Codex harness od OpenAI a výsledky zapíše zpět do repozitáře.

Přirovnal bych to k výzkumnému manažerovi a juniorovi. Manažer přečte stav projektu, rozhodne, co delegovat, a napíše zadání. Junior úkol provede, ať trvá deset minut nebo tři dny. Manažer nehlídá každý juniorův řádek, hodnotí jen výsledek zadání. U MIRY je klíčové, že jeden příkaz se počítá jako jeden krok rozhodovacího procesu, bez ohledu na délku provádění.

Bez trénování: ze 67 na 100 procent

První výsledek je u MIRY vidět i bez jakéhokoli učení. V dokazování vět na benchmarku IMOProofBench zvedla průměrné normalizované skóre z 67,1 procenta u přímé inference na 100 procent a vyřešila všech 30 úloh, a to v každém ze tří opakování. To je relativně zlepšení zhruba o 49 procent, čistě díky jiné organizaci práce.

Autoři totéž ukázali v otevřeném výzkumu neuronových architektur. MIRA tam vybírala per-buňkové brány zápisu pro Residual Matrix Transformery a podepsanou pozornost s postupnou rekurentní aktualizací pro Loop Transformery. Tedy žádné trénování politiky, jen struktura, která rozděluje „co zkoumat" a „jak to provést".

Kritik odhaduje zbývající hodnotu

Samotné rozdělení nestačí. Okamžitý výsledek experimentu nemusí odpovídat jeho skutečnému přínosu. Autoři proto na každé rozhodovací hranici trénují generativního kritika, který odhaduje očekávaný zbývající přínos z částečného stavu výzkumu. Podle práce tento přístup předčí varianty, které hodnotí na úrovni tokenů.

Zajímavý je trik s předtrénováním napříč prostředími. Kritik se nejdřív naučí odhadovat hodnotu na ostatních úlohách a až pak se doladí na cílové. Tím vzniká přenositelný „prior", jak ocenit částečný pokrok, a předpovědi i adaptace se podle autorů zlepší.

MIRA-AC se učí, co zkoumat dál

Na kritikovi staví MIRA-AC, generativní herec-kritik v jednom modelu. Jeden jazykový model hraje obě role, takže odpadá samostatný kritický model. Trénování se soustředí výhradně na meta-rozhodnutí, ne na dlouhé prováděcí stopy. Autoři uvádějí, že kompletní rozhodovací odpovědi tvoří 25,8 procenta započítaných tokenů a jsou jediné, které dostávají učební signál. Jinými slovy: místo optimalizace každého tokenu v dlouhém běhu se ladí jen ta čtvrtina, která skutečně rozhoduje.

Výsledek se projevil ve čtyřech prostředích: symbolické regresi (SRBench), objevování fyzikálních zákonů, bayesovském objevování příčinných struktur (BNLearn) a výzkumu CPU architektur (HillClimbBench-CPU). Trénink na vlastních „proxy" signálech zlepšil výsledky v gold evaluaci napříč všemi čtyřmi. V párovém srovnání MIRA-AC zvítězil ve 203 z 334 jasných přisouzení, tedy v 60,8 procenta.

Změnilo se i chování. Podíl trajektorií, které testují něco, co rozliší dvě soupeřící hypotézy, vzrostl z 16,8 na 28,0 procenta. Podíl trajektorií, které opakovaně zkouší drobné variace nefunkčního nápadu, klesl z 33,5 na 18,8 procenta.

Limity a praktický dopad

Jde o vědeckou práci z 1. října 2026 na arXiv, nikoli o produkt. V textu nenajdeme oznámení o zveřejnění kódu ani modelu, takže český vývojář si MIRU dnes do projektu nezačlení. Stojí za ní pět autorů: Ankur Samanta (Meta AI a Columbia University), Yonathan Efroni (Tel Aviv University), Paul Sajda (Columbia University) a Kaveh Hassani s Anirudhem Goyalem z Meta AI.

Pro lidi, kteří staví vlastní agenty, má ale práce praktické poselství. Když oddělíte rozhodování o dalším kroku od provádění, můžete učení soustředit na malou část tokenů, které skutečně určují směr. Zbytek nemusíte optimalizovat. A odhad zbývající hodnoty z částečného stavu je dovednost, která se dá natrénovat na jiných úlohách a pak přenést.

Je MIRA dostupná jako open source?

Práce neoznamuje zveřejnění kódu ani modelu. K dispozici je text na arXiv, ale praktické nasazení zatím není pro vývojáře otevřené.

V čem se MIRA liší od běžných agentů, kteří jen spouštějí nástroje?

Běžní agenti míchají rozhodování a provádění do jednoho dlouhého běhu. MIRA obojí odděluje: vnější smyčka rozhoduje, co zkoumat dál, a čerstvý executor úkol provede. Jeden příkaz se tak počítá jako jeden krok bez ohledu na délku provádění.

Co znamená proxy a gold evaluace?

Proxy je levný průběžný signál, který agent vidí během výzkumu. Gold je finální hodnocení, ke kterému agent přístup nemá. Autoři ukazují, že trénink na proxy signálu z vlastních trajektorií zlepšuje i výsledky gold hodnocení.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.