Jedna chyba může pokazit celý postup
Výzkum se zaměřuje na vícekrokové AI agenty. Tedy systémy, které nedostanou jeden dotaz a nevrátí jednu odpověď, ale postupně provádějí řadu akcí. Mohou hledat informace na webu, pracovat s nákupním rozhraním nebo upravovat zdrojový kód.
U takového agenta má chyba jinou váhu než u běžného chatbotu. Když model špatně vybere produkt nebo použije nesprávný příkaz, změní tím stav celého úkolu. Další akce už probíhají v prostředí, které se od původního plánu odchýlilo. Agent pak může několik dalších kroků pokračovat nesprávným směrem, aniž by dokázal najít cestu zpět.
Autoři práce PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents označují takový krok jako pivotal mistake, tedy zásadní chybu. Jde o akci, která prodlouží nejkratší cestu k dokončení úkolu, případně úkol úplně znemožní.
Analýza modelů Qwen3 s velikostí od 8B do 235B ukázala, že jedna taková chyba se objevila u 59 % neúspěšných běhů, konkrétně ve 155 z 262 případů. První problematický krok přicházel obvykle mezi osmým a dvanáctým tahem z celkových třiceti. Agent potom promarnil dalších 18 až 21 kroků bez úspěšného návratu.
Proč běžné učení zotavení nezvládá
Standardní on-policy distillation, zkráceně OPD, učí model z jeho vlastních trajektorií. Učitel přitom poskytuje dohled nad odpověďmi, které student skutečně generoval. Tento přístup může snížit počet běžných selhání, jenže u zásadních chyb naráží na problém s pravděpodobností.
Správná opravná akce se v kritickém okamžiku objevovala s pravděpodobností menší než jedno procento. Pokud trénink používá jen několik náhodných běhů, správný návrat se téměř nikdy nevygeneruje. Model tak nedostane dostatečný příklad, ze kterého by se mohl naučit.
Podle měření v prostředí ALFWorld snížila standardní OPD celkovou míru selhání ze 79 % na 56 %. Selhání po zásadní chybě však kleslo pouze z 51 % na 49 %. To je důležitý rozdíl. Model se může zlepšovat v běžných krocích, ale stále nemusí umět napravit situaci, kterou sám pokazil.
Podobný limit má i zpětnovazební učení založené pouze na výsledku. Když všechny pokusy skončí neúspěchem, není mezi nimi dostatečný rozdíl, podle kterého by se model dozvěděl, co měl udělat jinak.
PivotOPD kombinuje prevenci a opravu
PivotOPD není nový jazykový model. Jde o trénovací postup, který se přidává k učení agenta. Metoda pracuje se třemi částmi a všechny zapojuje do jedné aktualizace PPO.
Vyhledání zásadního kroku
Větší učitelský model zpětně projde celou trajektorii agenta a její výsledek. U každého podezřelého místa navrhne správnou akci. Pokud se akce studenta od této doporučené akce liší a chyba ovlivnila další průběh, označí ji systém jako pivotní.
Na ALFWorld se takto určený krok nacházel do jednoho tahu od kroku označeného symbolickým orákulem v průměru u 77,8 % neúspěšných běhů. Metoda tedy nepracuje s dokonalým věštěním. Dokáže však kritická místa identifikovat dost přesně pro další trénink.
Prevence pomocí reverse KL
První část učení má model od chybného kroku odradit. Zmrazená kopie studenta dostane nápovědu se správnou akcí a znovu ohodnotí původní odpověď. Výsledkem je tréninkový signál, který snižuje pravděpodobnost opakování stejné chyby.
Technický pojem reverse KL není pro běžné použití podstatný. Prakticky jde o to, že model dostává informaci, kterému rozhodnutí se má vyhnout.
Oprava pomocí forward KL
Druhá část řeší situaci, kdy už chyba nastala. Učitel navrhne opravnou akci pro několik následujících tahů. Student se pak učí, jak pokračovat ze stavu, který vznikl po chybném rozhodnutí.
Autoři metody použili nejčastěji dva následující kroky. To stačilo k tomu, aby se agent v přehrávaných situacích znovu napojil na správný postup. Oprava tedy neznamená návrat na úplný začátek. Model se učí pracovat s novou situací, kterou si sám vytvořil.
Výsledky na úkolech pro agenty
PivotOPD porazila 13 srovnávaných metod na všech osmi průměrných výsledcích benchmarků ALFWorld, WebShop a Search-based QA. Testy probíhaly se studenty Qwen3-1.7B a Qwen3-8B a zahrnovaly tři náhodná semena.
U modelu Qwen3-1.7B dosáhla metoda v ALFWorld průměru 73,7 %. To bylo o 5,5 procentního bodu více než u nejsilnějšího srovnávaného přístupu. V Search-based QA dosáhla 44,5 %, což znamenalo náskok 5,9 bodu.
U WebShopu byl rozdíl zajímavější než samotné skóre. PivotOPD překonala metodu RLSD o 1,2 bodu v celkovém skóre, ale o 14,1 bodu v míře skutečně dokončených úloh. Celkový úspěch zde dosáhl 76,6 %.
Větší student Qwen3-8B dosáhl 93,0 % v ALFWorld, 47,4 % v Search-based QA a 81,9 % úspěšnosti ve WebShopu. Rozdíly proti konkurenci byly menší, nejméně 1,8 bodu. To odpovídá běžnému trendu, kdy větší modely už část problémů zvládají samy a prostor pro zlepšení se zmenšuje.
Metoda fungovala také v režimu, kdy byl učitel stejný model jako student. Qwen3-8B v této konfiguraci dosáhl průměrného zlepšení 3,9 %. PivotOPD tedy nutně nepotřebuje větší učitelský model, i když přesnost jeho doporučení může ovlivnit výsledek.
Na benchmarku SWE-Bench Verified vzrostla míra vyřešených úloh u studenta Nemotron-3.5-SFT z 62,8 % na 66,0 %. Standardní OPD dosáhla 63,0 %, zatímco učitelský model měl výsledek 73,0 %. Zlepšení se tak přeneslo i mimo prostředí domácích úkolů a webového vyhledávání, přestože student se na úroveň učitele nedostal.
Zotavení je hlavní přínos metody
Nejpřímější test se zaměřil na 72 přehrávaných zásadních chyb. Agent trénovaný pomocí PivotOPD dokázal úkol dokončit v 72,7 % případů. Základní model se zotavil v 8,3 % případů a standardní OPD v 20,3 %.
Samotná preventivní část dosáhla 45,8 %. To ukazuje, že naučit model chybě předcházet je jednodušší než ho naučit pokračovat po chybě. Současně je vidět, proč autoři oddělili prevenci a obnovu do dvou různých trénovacích signálů.
Úspěšná oprava trvala v průměru 9,7 tahu. Optimální postup by vyžadoval 6,2 tahu. Agent tedy dokázal úkol zachránit, ale ne vždy nejkratší cestou.
Trénink něco stojí, používání ne
PivotOPD nepřidává žádnou dodatečnou výpočetní zátěž při inferenci. Jakmile je student natrénovaný, běží stejně jako jeho původní verze. Uživatel tedy neplatí zvláštní poplatek za opravné mechanismy a nepotřebuje další model během každého běžného úkolu.
Náročnější je samotný trénink. Testy využívaly uzly s akcelerátory NVIDIA H100. U modelu Qwen3-1.7B v ALFWorld byl při jednom kroku obnovy trénink o 12,4 % náročnější než GRPO. Při dvou krocích vzrostla režie na 94,2 %, protože systém musel přehrávat další části prostředí.
To je praktické omezení. Metoda je vhodná hlavně pro prostředí, která lze opakovaně simulovat a vracet do předchozího stavu. U běžné práce s webem, firemními systémy nebo fyzickými zařízeními nemusí být takové přehrávání vždy dostupné.
Dostupnost pro české uživatele
PivotOPD není aplikace, předplatné ani veřejně dostupný chatbot. Čeští uživatelé ji proto nemohou jednoduše zapnout v běžné službě. Projektová stránka NVIDIA uvádí, že kód je teprve připravován, takže zatím není k dispozici jako balíček pro vlastní nasazení.
Výzkum sám neuvádí českou lokalizaci ani podporu konkrétního českého trhu. Metoda se týká trénování agentů obecně a neobsahuje samostatný ceník. Pokud se kód později objeví, náklady budou záviset hlavně na použitém modelu, prostředí a výpočetním výkonu. Současné výsledky proto není možné přímo převést na českého kancelářského asistenta nebo zákaznického bota.
Podrobnosti jsou v projektové stránce NVIDIA a v původní technické práci. Report výsledky uvádí na benchmarku, nikoli v běžném provozu české firmy. To je důležité omezení při jejich interpretaci.
FAQ
Je PivotOPD nový AI model?
Ne. PivotOPD je trénovací metoda pro vícekrokové AI agenty. Používá existující studentský model a učí ho předcházet zásadním chybám i pokračovat po jejich vzniku.
Přidává PivotOPD náklady při každém použití agenta?
Podle zveřejněných výsledků ne. Metoda mění trénink, nikoli běžné spuštění modelu, takže po dokončení tréninku nepřidává žádné dodatečné náklady při inferenci.
Je PivotOPD dostupná jako nástroj pro české uživatele?
Zatím ne. Projektová stránka uvádí kód jako připravovaný a neexistuje samostatná česká aplikace, předplatné ani oznámená lokalizace.