Přejít k hlavnímu obsahu

ChatGPT se sám nezlepšuje. Pravda o sebevylepšování AI

Ilustrační obrázek
Když se řekne „AI se zlepšuje sama“, většina lidí si představí stroj, který si v noci přepíše vlastní kód a ráno je o generaci chytřejší. Realita je nudnější — a právě proto o ní stojí za to psát. ChatGPT dnes umí kontrolovat vlastní odpovědi, vylepšovat prompty a pomáhat trénovat budoucí modely. Ale svoje neuronové váhy si při vašem chatu nepřepíše. Rozdíl mezi těmito dvěma scénáři rozhoduje o tom, jestli se necháte nachytat marketingem, nebo pochopíte, co se v oboru skutečně děje.

Co vlastně znamená sebevylepšování

Pojem rekurzivní sebevylepšování (anglicky recursive self-improvement, zkratka RSI) pochází z roku 1965. Matematik I. J. Good tehdy popsal „explozi inteligence“: stroj dost chytrý na to, aby navrhl ještě chytřejší stroj, by mohl rozjet lavinu, kterou už nikdo nedohoní. Je to pěkná myšlenka a od té doby se pravidelně vrací v debatách o bezpečnosti AI.

Moderní výzkum ale RSI používá opatrněji. Důležitější otázka než „umí se model zlepšit sám?“ je: která část systému se mění, jak se to měří a kdo změnu schválí? U dnešních velkých jazykových modelů se totiž vylepšování odehrává spíš okolo modelu než uvnitř něj.

Co ChatGPT umí už dnes

Běžný model typu ChatGPT dokáže v úzkém slova smyslu vylepšit hned několik věcí. Umí přepsat prompt, aby odpověď vyšla lépe. Umí zkritizovat a přepsat vlastní odpověď. Umí generovat trénovací data — příklady, štítky, vysvětlení nebo hodnoticí kritéria. Umí sestavovat agentní workflow a budovat hodnoticí systémy. Žádná z těchto činností ale neznamená, že by si nasazený model při konverzaci upravoval své parametry.

Nejužitečnější je sebekritika při odpovídání. Požádáte o návrh, pak model požádáte, aby v něm našel faktické mezery nebo zkrátil text podle zadání. Často chybějící krok opravdu najde. Váhy modelu se ale nezmění — zlepšení žije jen v aktuálním kontextovém okně a zmizí, dokud si ho neuložíte do datasetu nebo knihovny promptů.

Druhá rovina je zpětná vazba od AI, známá jako RLAIF (reinforcement learning from AI feedback). Model hodnotí vlastní odpovědi a zásobuje trénink signálem, čímž se snižuje závislost na drahých lidských anotacích. Funguje to, ale má to háček: když je hodnoticí kritérium vágní, model se naučí obcházet pravidla rychleji, než si compliance tým přeje.

Úroveň po úrovni: od kontroly domácího úkolu k přepsání učebnice

Na RSI se dá dívat jako na žebřík. Dole model zkontroluje jednu vlastní odpověď. Výš agenti spouštějí experimenty a generují nové trénovací signály. Úplně nahoře stojí otevřené sebevylepšování, kdy systém samostatně mění vlastní architekturu, trénink i strategii dalšího zlepšování.

Dnešní modely operují hlavně na spodních příčkách. To není kritika — vázané sebezdokonalování je v produkci užitečné, když je navázané na testy, metriky a lidskou kontrolu. Otevřené RSI zůstává spekulací, protože vyžaduje spolehlivé ověřování, dostatek výpočetního výkonu a obranu proti sebeposilujícím chybám.

Konkrétně: smyčka „vygeneruj odpověď, pochval odpověď, trénuj na pochválené odpovědi“ není exploze inteligence. Je to recept na přetrénování, pokud se dá skórovací signál snadno ošidit. Výzkum tento jev popisuje jako model collapse — když se model učí na vlastních výstupech bez čerstvých lidských dat, jeho odpovědi se postupně stávají sebevědomějšími a zároveň méně přesnými.

Kde to dnes reálně běží: agentní smyčky

Nejpraktičtější podoba RSI není osamělý chatbot, který se probouzí. Je to agentní workflow, který vylepšuje systém okolo modelu. Typická smyčka vypadá takto: agent splní úkol (napíše kód nebo zatřídí lístky), hodnotitel zkontroluje výsledek proti testům, agent navrhne změnu promptu, nástroje nebo testu, systém úlohu spustí znovu a porovná výsledky — a teprve pak změnu schválí člověk nebo automatická brána.

Tento vzorec přináší měřitelné zisky. Frameworky, které se takto samy vyvíjejí, hlásí lepší výsledky na benchmarku LiveCodeBench, než má samotný podkladový model. LiveCodeBench je přitom zajímavý právě tím, že testuje generování kódu realističtěji než hračkářské příklady. Zisk ale pochází z vylepšení workflow, ne z toho, že by se tajně přepsal základní model.

Co ChatGPT neumí — a proč je to dobře

ChatGPT nedokáže za běhu měnit nasazené váhy, nemůže se rozhodnout přetrénovat sám sebe na vašem chatu a vydat nový model, ani si sám nezmění architekturu, nezvolí nový optimalizátor a neprojde bezpečnostním přezkumem. Tyhle kroky žijí v externích pipelinech, které řídí inženýři, výzkumníci, bezpečnostní týmy a produktová governance.

A to je dobře. Nekontrolovaná sebeúprava může degradovat výkon, otevřít bezpečnostní díry, porušit pravidla nakládání s daty nebo optimalizovat špatnou metriku. Klasický příklad: podpůrný bot, který se učí na vlastních neověřených odpovědích, začne považovat vyhalucinované detaily firemní politiky za pravdu. Po dvou třech kolech zpětné vazby zní sebevědoměji a je méně přesný.

Chybějícím dílem je introspekce. Trvalé sebevylepšování by vyžadovalo, aby model rozuměl vlastním selháním, předvídal vedlejší efekty a uměl ověřit, že změna zlepšuje obecné schopnosti, ne jen jeden benchmark. Dnešní modely mají jen částečné znalosti o vlastním chování — řeknou vám, že můžou halucinovat citace, ale nemají k mechanismům svých vah přístup tak, jako má překladač přístup ke zdrojovému kódu.

Evropský úhel: regulace na to už myslí

Téma sebevylepšování není jen akademická hra — dotýká se i evropské regulace. Akt o umělé inteligenci (EU AI Act), první komplexní regulace AI na světě, vstoupil v platnost v srpnu 2024. Povinnosti pro poskytovatele takzvaných univerzálních modelů AI (general-purpose AI, GPAI) se začaly uplatňovat od srpna 2025.

Modely se „systémovým rizikem“ — mimo jiné ty trénované s kumulativním výpočetním výkonem nad 10 na 25 FLOPs — mají navíc povinnost procházet hodnocením modelu, adversariálním testováním (red-teaming) a hlášením závažných incidentů. Pro běžného českého uživatele to znamená jednu konkrétní věc: největší modely, u kterých by případné autonomní sebevylepšování hrozilo nejvíc, nesmí v EU fungovat jako černá skříňka. Jejich schopnosti — včetně těch, které by jednou mohly vést k RSI — podléhají povinnému dohledu AI Office Evropské komise.

Pět otázek, které oddělí realitu od marketingu

Až příště uslyšíte, že nějaký nástroj „zlepšuje sám sebe“, zeptejte se pěti věcí: Co se mění — prompt, nástroj, dataset, workflow, nebo váhy modelu? Kdy se to mění — při generování, po dávkové úloze, nebo při offline přetrénování? Kdo to schvaluje — člověk, automatická brána, nebo nikdo? Jak se to měří — benchmark, hodnocení uživatelů, cena, latence, bezpečnostní skóre? A dá se metrika ošidit? Pokud ano, systém si ke zkratce dřív nebo později cestu najde.

Shrnutí je vlastně jednoduché. ChatGPT umí pomáhat zlepšovat systémy, které produkují budoucí modely — zpřesňuje odpovědi, generuje zpětnou vazbu a podporuje agentní workflow, která se časem zlepšují. Ale plně autonomní rekurzivní sebevylepšování, kdy by si sám přepisoval jádro a znovu se nasazoval, dnešní systémy nedělají. OpenAI to sama říká rovně: plně autonomní RSI se dnes neděje a nemělo by se o něj usilovat, dokud ho nelze provést bezpečně.

Učí se ChatGPT z každé konverzace, kterou s ním vedu?

Ne okamžitě. Konverzace se můžou využít k pozdějšímu tréninku a vylepšení modelu, pokud uživatel nezakáže jejich použití, ale model se po vašem chatu hned nepřetrénuje. Je to součást širšího řízeného procesu, ne živé učení při konverzaci.

Co je „model collapse“ a proč je u sebevylepšování nebezpečný?

Když se model učí převážně na vlastních vygenerovaných datech místo čerstvých lidských, jeho výstupy postupně ztrácejí rozmanitost a přesnost — odpovědi působí sebevědomě, ale realitě se vzdalují. Proto smyčka „generuj a trénuj na sobě“ bez silné vnější kontroly selhává.

Vztahuje se regulace EU AI Act i na ChatGPT?

Ano. ChatGPT je postavený na univerzálním modelu AI (GPAI), na který se od srpna 2025 vztahují povinnosti podle aktu o AI. Nejsilnější modely označené za systémové riziko navíc procházejí povinným hodnocením, adversariálním testováním a hlášením incidentů.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.