Přejít k hlavnímu obsahu

BootLoops učí AI kontrolovat výpočty místo hádání výsledků

Ilustrační obrázek
BootLoops je open-source nástroj, který jazykovým modelům umožňuje provádět přesné vědecké výpočty a zároveň kontrolovat, zda k výsledku došly správně. Za tři měsíce pomohl týmu fyzika Matthewa Schwartze připravit 36 odborných manuskriptů z 18 oborů. Model však stále potřebuje člověka, který určí správnou otázku a ověří, zda výsledek dává vědecký smysl.

Od chatbota k výpočetnímu systému

BootLoops není další jazykový model ani samostatný chatbot. Jde o takzvaný harness, tedy pracovní prostředí, které modelu poskytne nástroje, pravidla a kontrolní postupy pro konkrétní typ úlohy.

V běžném chatu model napíše matematický postup, vygeneruje kód a oznámí výsledek. To může stačit při jednoduchém výpočtu. Ve vědě však často rozhodují drobnosti: zaokrouhlování, špatně nastavená konstanta nebo předčasný závěr mohou změnit výsledek celého článku.

BootLoops proto propojuje jazykový model s rozsáhlým vědeckým softwarem. Každý nástroj má popsané, k čemu slouží, kdy ho použít a jak ověřit jeho výstup. Systém používá symbolické výpočty, numerické kontroly a takzvanou ball arithmetic. Ta ke každému výsledku připojuje také ověřený interval chyby. Číslo tedy není vydávané za přesné jen proto, že má mnoho desetinných míst.

Zdrojový kód BootLoops 1.0 je dostupný na GitHubu pod licencí MIT. Dokumentace je vydána pod licencí CC BY 4.0. Nástroj je nezávislý na konkrétním modelu, takže ho lze teoreticky použít s různými jazykovými modely a agentními prostředími.

Výpočty s certifikovanou přesností

BootLoops vznikl při práci na úlohách z matematické fyziky, především na integrálech spojených s částicovou fyzikou. Takové výpočty mohou mít více rozměrů a jejich řešení často vyžaduje kombinaci symbolických úprav, numerických metod a přesné kontroly chyb.

Podle údajů zveřejněných Anthropic dokázal systém zreprodukovat 15 známých vědeckých integrálů a vypočítat dalších 15 nových hranicových Feynmanových integrálů. U vybraných výpočtů pracoval s přesností na desítky až stovky certifikovaných platných číslic.

To není totéž jako běžný test jazykového modelu. BootLoops neměří, zda model správně odpoví na otázku z matematiky. Kontroluje celý výpočetní postup. Výsledek musí projít nezávislou numerickou kontrolou, reprodukcí nebo jiným předem stanoveným testem.

GitHub dokumentace popisuje také kontrolní mechanismy pro případy, kdy výpočet nemá známé řešení. Patří mezi ně testy s předem vloženou správnou hodnotou, kontrola úplnosti výčtu nebo ověřování, že výsledek nevznikl pouze přizpůsobením křivky naměřeným datům.

Od částic k ekologii

Schwartzův tým postupně zjistil, že stejné matematické postupy lze použít v různých vědních oborech. BootLoops se proto rozšířil z částicové fyziky do ekologie, populační genetiky, ekonomie, lingvistiky, statistiky a dalších oblastí.

Anthropic tento typ úloh označuje jako „Claude-shaped problems“. Nejde o problémy, které by byly určeny pouze pro jeden model. Označení popisuje úlohy, u nichž současné jazykové modely dobře zvládají dlouhé série výpočtů, převod mezi obory, psaní kódu a opakované ověřování. Samy od sebe však většinou nepoznají, zda je výsledek pro daný obor zajímavý.

V ekologii BootLoops vyřešil rovnici z neutrální teorie biodiverzity, která zůstávala přibližně 20 let bez řešení v potřebném měřítku. Při aplikaci na data z ostrova Barro Colorado vyšel podle zveřejněného popisu týmů výsledek, že složení stromových druhů se mění 4,5krát rychleji, než připouštěl použitý teoretický limit. Ekolog James O'Dwyer následně pomohl převést výpočet do prediktivního modelu.

V populační genetice tým analyzoval 5,7 miliardy dvojic mutací z projektu 1000 Genomes a hledal známky mechanismu označovaného jako genová konverze. V ekonomii vznikl nástroj, který automaticky kontroloval 4 452 replikací výzkumných výsledků. Lingvistický projekt zase vytvořil databázi slovního přízvuku pro 6 072 jazyků.

36 manuskriptů za tři měsíce

Za přibližně tři měsíce vzniklo podle Schwartze a Anthropic 36 manuskriptů napříč 18 vědními obory. Na práci se podílel Matthew Schwartz a 19 spoluautorů. U jednotlivých projektů přitom nebyl nejdůležitější samotný model, ale výběr tématu a spolupráce s odborníky z dané oblasti.

V jednom případě trvalo zopakování výpočtu ze Schwartzova staršího článku přibližně 20 minut. Původně mu stejná práce zabrala týdny programování. Takové srovnání je potřeba číst opatrně. Nejde o obecnou rychlost BootLoops ani o slib, že každý vědecký výpočet bude hotový za několik minut. Výsledek závisí na připravenosti nástrojů, složitosti problému a dostupném výpočetním výkonu.

Anthropic zveřejnil popis projektu 1. října 2026. Původní text Matthewa Schwartze zároveň výslovně uvádí, že BootLoops není projekt Anthropic. Software vlastní a udržuje Schwartz.

Člověk stále určuje směr

Největší omezení se týká vědeckého úsudku. Jazykový model může provést správný výpočet a přesto z něj vyvodit chybný závěr. Může také zvolit jednodušší, ale méně vhodnou metodu nebo prohlásit práci za dokončenou dříve, než jsou hotové všechny kontroly.

Schwartz popisuje, že modely mají sklon „vyhlásit vítězství“ příliš brzy. Někdy použijí hrubou výpočetní sílu tam, kde by odborník navrhl elegantnější postup. Automatická kontrola proto nemusí odhalit všechny problémy. Správně spočítaná hodnota ještě neříká, zda odpovídá skutečné vědecké otázce.

Stejný problém se objevil už při dřívějším experimentu Vibe Physics. Claude tehdy zvládl velkou část výpočtů, práce s kódem a přípravy textu. Odborník však musel odhalit chybné vzorce, nesprávné normalizace i grafy upravené tak, aby vypadaly přesvědčivě.

BootLoops proto nemíří na plně automatickou vědu. Jeho smyslem je přesunout část rutinní práce k modelu a současně nastavit kontrolní brány, přes které musí výsledek projít. Člověk vybírá problém, schvaluje plán, sleduje průběh a posuzuje význam výsledku.

Dostupnost a cena

BootLoops je zdarma ke stažení a jeho software je open-source. Cena samotného nástroje je 0 USD. Uživatel ale potřebuje počítač, potřebné vědecké balíčky a obvykle také přístup k jazykovému modelu. Náklady na používání modelu se proto mohou lišit podle zvoleného poskytovatele a délky výpočtů.

Projekt je dostupný i pro uživatele v Česku a Evropské unii, protože zdrojový kód je veřejný a není vázaný na český trh. Oficiální dokumentace a pokyny jsou však převážně v angličtině. Česká lokalizace ani české uživatelské rozhraní nejsou u projektu uvedeny.

Pro běžného uživatele domácího počítače nejde o náhradu kalkulačky ani kancelářského asistenta. BootLoops je určený hlavně pro výzkumníky, vývojáře a týmy, které potřebují zpracovávat kvantitativní úlohy s dohledatelným postupem a přesně popsanou chybou.

FAQ

Lze BootLoops používat s jiným modelem než Claude?

Ano. BootLoops je navržený jako modelově nezávislý harness. Zdrojový kód uvádí, že uživatel může nástroj nasměrovat na libovolné agentní prostředí, které s ním dokáže pracovat.

Je BootLoops vhodný pro běžné domácí výpočty?

Spíše ne. Nástroj cílí na přesné vědecké a kvantitativní úlohy, například integrály, statistické modely nebo analýzu biologických dat. Pro běžné počítání je zbytečně složitý.

Zaručuje certifikovaný výpočet správný vědecký závěr?

Ne. Certifikace kontroluje konkrétní výpočet a jeho numerickou přesnost. Neověřuje sama o sobě, zda byla zvolena správná otázka, model nebo interpretace výsledku. K tomu je stále potřeba odborník.

Zdroj: The Decoder, Anthropic, GitHub.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.