Přejít k hlavnímu obsahu

Google naučil AI agenty pamatovat si vlastní chyby. Systém WikiSkill posouvá výkon i menších modelů

Ilustrační obrázek
Běžní AI agenti trpí jedním nepříjemným zlozvykem: jakmile dojde k aktualizaci jejich instrukcí nebo k přepsání souboru dovedností, okamžitě zapomenou, na čem se minule spálili. Výzkumníci z Google Research a Virginia Tech proto představili architekturu WikiSkill. Ta dává autonomním systémům trvalou paměť ve stylu firemní wikipedie, do které si zapisují nejen úspěšné postupy, ale především konkrétní vzorce selhání a neúspěšné pokusy.

Jak vyřešit chronickou ztrátu paměti u autonomních agentů

Pokud v dnešní době pracujete s autonomními AI agenty, pravděpodobně jste narazili na jejich největší architektonickou slabinu. Moderní systémy už dávno nespoléhají na jednoduché jednoprůchodové generování textu (tzv. single-pass LLM). Namísto toho využívají uvažující modely, agentní RAG (Agentic RAG) nebo GraphRAG a snaží se řešit komplexní úkoly v iterativních smyčkách. Jenže když takový agent při řešení kódovacího úkolu nebo datové analýzy narazí na slepou uličku, opraví svůj postup a starý chybový protokol zahodí.

Jakmile se podobný úkol objeví znova, agent má tendenci spadnout do úplně stejné pasti. Je to, jako byste v vývojářském týmu měli kolegu s brilantní logikou, který si ale odmítá psát záznamy z post-mortem analýz. Každý týden sice vyřeší stejný chybový stav, ale pokaždé si musí celým procesem pokusu a omylu projít úplně od nuly.

Tradiční metody evoluce dovedností dosud fungovaly tak, že neustále přepisovaly aktivní soubor instrukcí. Jakmile se verze promptu aktualizovala, historie neúspěšných pokusů byla nenávratně ztracena. Právě tento strukturální neduh řeší nová výzkumná studie publikovaná týmem z Google Research a Virginia Tech na serveru arXiv, o níž podrobněji informoval například technologický magazín The Decoder.

Třívrstvá architektura: Jak WikiSkill udržuje vědomosti v čistotě

Princip fungování systému WikiSkill lze přirovnat k dobře organizované znalostní bázi v prostředí Notion nebo Confluence, kterou sdílí celý vývojový tým. Namísto míchání všeho do jednoho nepřehledného textového okna (kontextu) rozděluje WikiSkill paměťový systém agenta do tří přísně oddělených vrstev:

  • Nepramenné záznamy spuštění (Execution Traces): Surové provozní logy, které zaznamenávají každý krok, příkaz, reakci prostředí a výjimku. Tyto logy slouží jako primární studijní materiál.
  • Trvalá wiki znalostí (Persistent Wiki): Strukturovaná mezipaměťová vrstva, kam si agent ukládá zobecněná pravidla, vzorce selhání a historii zamítnutých úprav dovedností. Důvody předchozích nezdarů tak zůstávají zachovány i v momentě, kdy se mění samotný spustitelný kód.
  • Spustitelné dovednosti (Skills): Samotné finální skripty, prompty a šablony, které agent aktivně volá při plnění konkrétního úkolu.

Klíčovým vtipem celého řešení je správa informací. Agent nečte při každém úkolu celý archiv od pravěku. V rámci jedné iterace správy wiki systém vybírá maximálně 8 položek z protokolů — přesněji nejvýše 5 selhání a 3 úspěchy. Aby se zabránilo zahlcení kontextového okna (které dnes i u modelů jako Gemini 3.7 Flash nebo Claude Opus 5 tvoří podstatnou část provozních nákladů), platí striktní limit 15 000 znaků na jeden záznam.

Pokud agent navrhne úpravu své dovednosti, ale tato úprava v testovací fázi selže, systém ji nezahodí. Zaznamená ji do wiki jako „nefunkční přístup“ společně s přesným důvodem, proč k selhání došlo. Když se agent v budoucnu pokusí o podobný krok, mezipaměťová vrstva ho varuje: „Tudy ne, tento přístup před třemi dny selhal na přetypování proměnné.“

Výsledky z praxe: Když menší 9B model předběhne 27B obra

V technologické praxi nás málokdy zajímá teoretická elegance, pokud za ní nestojí hmatatelná čísla a úspora výpočetního výkonu. Výzkumníci podrobili WikiSkill přísnému testování na pěti náročných benchmarkových sadách zaměřených na řešení úkolů a automatizaci.

Při použití na modelu Gemini-1.5-Flash dosáhl systém vybavený rozhraním WikiSkill průměrného skóre 68,1 %. Pro srovnání: nejlepší dosavadní konkurenční metoda zaměřená na evoluci dovedností dosáhla pouze na 56,1 % a základní model fungující bez jakýchkoliv uložených dovedností propadl se skóre 49,5 %.

Srovnání úspěšnosti na benchmarcích (model Gemini-1.5-Flash)

  • Základní model (bez dovedností): 49,5 %
  • Nejlepší předchozí metoda (zaznamenávání úspěchů): 56,1 %
  • Architektura WikiSkill (paměť na chyby i úspěchy): 68,1 %

Při praktickém nasazení je však ještě zajímavější druhý zjištěný efekt: skálování napříč velikostmi modelů. Menší model s pouze 9 miliardami parametrů (9B) vybavený dynamicky doplňovanou bází WikiSkill v testech překonal výrazně větší model se 27 miliardami parametrů (27B), který fungoval bez této strukturované paměti.

V praxi to znamená obrovský posun v ekonomice provozu AI agentů. Místo toho, aby vývojáři platili drahé API tokeny za nejvýkonnější uzavřené modely na trhu, mohou nasadit menší open-weights model — jako je například Llama 4 Scout od Mety nebo DeepSeek-V4-Flash — a doplnit ho o trvalou paměť na chyby. Výsledný systém má nižší latenci, zlomkové provozní náklady a stabilnější výsledky.

Přenositelnost dovedností: Vytvořte znalosti jednou, používejte všude

Dalším zásadním zjištěním výzkumu je přenositelnost vyvinutých dovedností mezi různými modely a modelovými rodinami. V praxi se často stává, že firma investuje nemalé prostředky do kontextového inženýrství a ladění promptů pro konkrétní model. Když pak poskytovatel vydá novou generaci — ať už jde o přechod na GPT-5.6 Sol nebo Grok 4.6 — celý proces optimalizace se musí opakovat od zvyku.

U WikiSkill je tomu jinak. Jelikož jsou vzorce selhání a konsolidované dovednosti zapsány ve strukturovaném formátu nezávislém na konkrétní architektuře neuronové sítě, lze kompletní znalostní bázi vzít a přenést na zcela jiný model. Agent vyškolený na architektuře od Googlu tak může okamžitě převzít znalostní bázi a pokračovat v práci pod modelem od Anthropicu nebo Mety, aniž by musel znovu opakovat stejné začátečnické chyby.

Dopad na české vývojáře a dostupnost technologií

Architektura WikiSkill představuje metodický výzkumný rámec, nikoliv uzavřený placený produkt. To je vynikající zpráva pro českou AI scénu i vývojáře, kteří budují autonomní agenty pro zákaznickou podporu, automatizaci back-office procesů nebo analýzu finančních dat.

Jelikož je princip popsán ve výzkumném dokumentu, je plně použitelný v jakémkoliv jazykovém prostředí včetně češtiny. České firmy tak nemusejí čekat na to, až Google nebo jiný technologický gigant zabalí tuto funkčnost do předplatitelské služby. Mechanismus třech vrstev a ukládání negativní zpětné vazby lze poměrně snadno implementovat do stávajících agentních rámců využívajících běžné databáze a strukturované JSON schéma.

Z pohledu efektivity se dostáváme do fáze, kdy samotný hrubý výkon jazykového modelu ustupuje do pozadí a klíčovou výhodou se stává architektonické uspořádání paměti agenta. Ukazuje se, že schopnost uplatnit poučení z minulých nezdarů dává systémům větší výhodu než pouhé navyšování počtu parametrů v neuronové síti.

Je architektura WikiSkill vázána výhradně na modely od Googlu?

Není. Přestože výzkum publikoval tým z Google Research, vyvinuté dovednosti a znalostní báze jsou přenositelné mezi různými modely i celými modelovými rodinami. Můžete je uplatnit jak u komerčních API, tak u otevřených open-weights modelů.

Jak WikiSkill brání tomu, aby se paměť agenta nezahltila zbytečnými daty?

Systém využívá přísnou konsolidaci logů. Při každé aktualizaci wiki vybírá maximálně 8 položek z historických záznamů (nejvýše 5 neúspěchů a 3 úspěšné pokusy) s tvrdým limitem 15 000 znaků na záznam, čímž drží objem kontextu pod kontrolou.

Funguje tento systém i pro úkoly a komunikaci v českém jazyce?

Ano, systém WikiSkill je konceptuální rámec správy paměti a logování. Není závislý na angličtině a funguje s jakýmkoliv jazykem, který podporuje podkladový LLM model pracující v agentním režimu.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.