Přejít k hlavnímu obsahu

Agent hlásil hotovo, databáze ukázala chybu. Nový test to odhalil

Ilustrační obrázek
AI agent může správně zavolat několik nástrojů, přesvědčivě popsat výsledek a přesto zanechat databázi ve špatném stavu. Microsoft a Hugging Face proto zveřejnily ThinkingBox, testovací prostředí, které kontroluje skutečné změny v backendu a stejný úkol opakuje 20krát.

Odpověď agenta nestačí

Ukázkový scénář z ThinkingBoxu se týká zákaznice, které se zpozdila zásilka kuchyňského spotřebiče za 745 dolarů. Agent načte objednávku, ověří sledování zásilky, projde zákaznický profil, zkontroluje podmínky pro kompenzaci a založí servisní požadavek.

Na první pohled postupuje pečlivě. Pak ale tiket uzavře jako vyřešený, přestože stav zásilky vyžaduje ponechání požadavku v režimu čekání. Zákaznici navíc neodpoví na původní otázku.

Kontrola textu by takového agenta mohla vyhodnotit jako úspěšného. Kontrola databáze ukáže jiný výsledek. Právě tento rozdíl ThinkingBox měří.

Microsoft a Hugging Face popsaly benchmark ThinkingBox v článku zveřejněném 3. října 2026. Součástí vydání je prostředí ThinkingBox, dataset ThinkingBox-Bench a napojení na OpenEnv.

Co benchmark kontroluje

ThinkingBox simuluje firemní workflow, ve kterém AI agent pracuje s databází a sadou nástrojů. Každý úkol má počáteční stav, zadání uživatele, dostupná rozhraní a přesně popsaný cílový stav.

Agent může například změnit stav reklamace, upravit rezervaci, založit pojistný požadavek nebo zapsat poznámku do zákaznického profilu. Hodnotitel pak nekontroluje pouze to, zda agent nástroj zavolal správným způsobem. Dívá se na to, jaké hodnoty skutečně zůstaly v databázi a jaké vedlejší změny během běhu vznikly.

Test obsahuje 507 úkolů z pěti oblastí. Jde o retail, auto pojištění, cestování, neobankovnictví a konzultační služby. Úkoly běží v izolovaných relacích MCP, takže jednotlivé pokusy nesdílejí databázové řádky ani stav nástrojů.

Každý úkol se spouští 20krát z identického počátečního stavu. To je podstatný rozdíl proti běžnému testu, který se často spokojí s jedním pokusem.

Jednorázový úspěch není spolehlivost

Autoři rozlišují tři metriky. Pass@1 říká, jak často agent uspěje v jednom pokusu. Pass@20 sleduje, zda se úkol podařilo zvládnout alespoň jednou během 20 běhů. Třetí hodnota, označená jako observed 20/20, počítá pouze úkoly, které agent zvládl správně ve všech 20 zaznamenaných pokusech.

Rozdíl mezi těmito čísly je prakticky důležitější než samotné pořadí modelů. Agent, který jednou správně zpracuje refundaci a další čtyři pokusy ji pokazí, není pro automatické zpracování refundací spolehlivý.

V testu ThinkingBox-Bench měl mezi uvedenými proprietárními modely nejvyšší celkové pass@1 Claude Opus 5.5 s hodnotou 67,16 %. Následovaly Claude Opus 5 s 66,50 % a GPT-5.4 s 65,36 %. GPT-5.6 Sol dosáhl 61,91 % a GPT-6 Astra 58,31 %.

Čísla ale neříkají, že jeden model je obecně nejlepší pro každou práci. Výsledek se měnil podle oblasti. Claude Opus 4.6 měl v retailových úkolech pass@1 68,62 %, u auto pojištění však jen 8,30 %. Průměr za retail napříč uvedenými modely činil 59,52 %, u auto pojištění 33,83 %.

Model může mít široký záběr a slabou stabilitu

Dobře je to vidět u modelu Kimi-K3. Ten zvládl alespoň jednou 476 z 507 úkolů, tedy 93,89 % benchmarku. V retailu dokonce dosáhl nejvyššího pass@1 mezi testovanými modely s hodnotou 82,24 %.

Při požadavku na 20 správných opakování už výsledek vypadal jinak. Kimi-K3 prošel bez chyby pouze 68 úkolů, což odpovídá 13,41 % benchmarku.

Claude Opus 5 byl v tomto pohledu stabilnější. Všech 20 pokusů zvládl u 241 úkolů, tedy u 47,53 % benchmarku. Claude Opus 5.5 dosáhl stejného počtu úkolů se stoprocentně úspěšným opakováním, přestože měl o něco vyšší pass@1.

To je dobrá připomínka pro firemní nasazení. Vyšší průměrná úspěšnost nemusí automaticky znamenat více předvídatelných běhů.

Chyba často vzniká při práci s nástroji

V ablační studii autoři analyzovali 121 680 platných pokusů na 12 modelech. Celkem 79 853 pokusů neprošlo kontrolou cílového stavu. U 67,24 % z těchto neúspěšných běhů přitom agent skončil bez chyby nástroje, provedl změnu a uživateli oznámil dokončení.

Kontrola databáze u chybných pokusů odhalila nesprávné hodnoty v polích v 77,61 % případů. Nechtěné vedlejší účinky se objevily u 43,30 % a požadovaná změna chyběla u 25,36 % neúspěšných běhů. Kategorie se mohou překrývat.

Samostatná klasifikace selhání ukázala, že 79,9 % chyb souviselo s používáním nástrojů. Nesprávné aktualizace stavu tvořily 10,3 %, neúplné vyřešení požadavku 7,0 % a absence změny stavu 2,9 %.

Podle autorů tak u sledovaných workflow často nejde pouze o schopnost modelu uvažovat. Problém nastává při práci s chybami nástrojů, neúplnými podmínkami nebo prázdnými výsledky. Agent pokračuje dál, i když předchozí krok nevedl k očekávané změně.

Kolik stojí spolehlivý výsledek

Benchmark porovnává také odhadované náklady. Autoři použili zaznamenanou spotřebu tokenů a ceníky endpointů v OpenRouteru, přičemž uvádějí snapshot z 20. září 2026. Nejde o účet za konkrétní produkční provoz, ale o srovnávací výpočet pro 507 úkolů.

GPT-5.6 Sol měl nejnižší odhadovanou cenu za jeden úspěšný pokus, 0,127 dolaru. GPT-5.4 dosáhl 0,131 dolaru a Claude Opus 5.5 0,276 dolaru.

Při počítání spolehlivých úkolů, které prošly všech 20 opakování, se pořadí změnilo. GPT-5.4 vyšel na 6,80 dolaru za jeden spolehlivý úkol, GPT-6 Astra na 7,45 dolaru a Claude Opus 5.5 na 7,80 dolaru. Autoři výslovně upozorňují, že jde o odhadovaný srovnávací ukazatel, nikoli o pevný ceník provozu.

Pro české firmy je důležitá ještě jedna věc. ThinkingBox není hotová služba, do které by běžný uživatel nahrál svůj chatbot a dostal univerzální známku. Je to vývojářské a výzkumné prostředí. Vydané prostředí, dataset i OpenEnv jsou dostupné přes Hugging Face a GitHub, ale běh vyžaduje Linux nebo WSL, Python 3.11+, Docker a vlastní modelové endpointy.

Česká lokalizace benchmarku v oznámení uvedena není. Úkoly jsou syntetické rekonstrukce firemních procesů, nikoli skutečné zákaznické případy. Metodika proto může posloužit jako vzor pro vlastní testy, ale výsledek nelze bez další práce přenést na konkrétní český helpdesk, banku nebo e-shop.

Databáze jako důkaz dokončení

Nejzajímavější část ThinkingBoxu nespočívá v samotné tabulce modelů. Důležitější je změna otázky. Místo „zavolal agent správný nástroj?“ se test ptá „zůstal systém po jeho práci ve správném stavu?“

Pro agentní systémy napojené na objednávky, pojištění nebo finance je to přesnější kontrola. Odpověď modelu může být přesvědčivá, zatímco databáze obsahuje špatný stav, chybějící záznam nebo nadbytečnou změnu.

ThinkingBox je dostupný jako open-source projekt. Kód ThinkingBoxu je pod licencí MIT, benchmarková data pod CDLA-Permissive-2.0 a prostředí OpenEnv pod BSD-3-Clause. Výzkumné podklady jsou zveřejněné také v práci One Success Isn't Reliability.

Benchmark tedy neříká, že všechny AI agenty čeká stejný typ chyby. Ukazuje, že kontrola finálního stavu databáze zachytí problémy, které z textu odpovědi ani z logu nástrojů nemusí být vidět.

FAQ

Je ThinkingBox určený pro běžné uživatele?

Ne přímo. Jde o prostředí pro vývojáře, výzkumníky a týmy, které testují AI agenty napojené na nástroje a databáze. Ke spuštění jsou potřeba vlastní modelové endpointy, Docker a další technické komponenty.

Testuje ThinkingBox skutečná zákaznická data?

Ne. Úkoly v publikovaném benchmarku jsou syntetické rekonstrukce firemních workflow. Napodobují reálné typy procesů, ale zákazníci a jejich záznamy nejsou skuteční.

Proč nestačí kontrolovat odpověď AI agenta?

Protože agent může napsat správně znějící shrnutí a přitom zapsat špatnou hodnotu, změnit nesprávný záznam nebo vynechat požadovanou akci. ThinkingBox proto kontroluje konečný stav databáze a vedlejší účinky.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.