Bezpečnost nemá být jen slib v tiskové zprávě
OpenAI chce bezpečnost vyspělých modelů posunout od obecných prohlášení ke konkrétní dokumentaci. V návrhu zveřejněném 28. září 2026 popisuje bezpečnostní případ jako strukturovaný argument podložený důkazy. Dokument má spojit jednotlivá tvrzení o bezpečnosti s testy, záznamy, předpoklady a známými omezeními.
Podobný přístup se používá v oborech, kde chyba může mít velmi vážné následky – například v letectví nebo jaderné energetice. OpenAI ale současně přiznává, že u AI je tento model obtížnější. Chování modelu se může měnit s rostoucími schopnostmi a některé problémy se objeví až v kombinaci s novým prostředím, nástroji nebo úkoly.
Nejde proto o hotový certifikát, který by jednou provždy potvrdil, že je model bezpečný. OpenAI svůj návrh označuje za směr, ke kterému chce postupně dospět. Aktuální dokument popisuje především bezpečnost během učení posilováním, tedy fáze, v níž model dostává odměny za žádoucí chování. Nasazení modelu v interních nebo veřejných službách vyžaduje další kontroly.
Celý návrh je dostupný v oficiálním dokumentu OpenAI o bezpečnostních případech.
Tři vrstvy ochrany mají fungovat společně
1. Zarovnání modelu
První vrstva se týká samotného tréninku. Cílem je, aby model dostával odměnu za chování, které výzkumníci skutečně zamýšleli, nikoli za obcházení pravidel nebo hledání chyb v testovacím prostředí.
OpenAI proto navrhuje kombinovat automatickou kontrolu tréninkových dat s ručním přezkoumáním. Automatizované systémy by měly hledat úlohy, v nichž lze získat vysoké hodnocení podvodem nebo využitím chyby. Lidé by následně měli kontrolovat, zda testy skutečně měří zamýšlenou schopnost.
Důležitou součástí mají být také opakované testy zarovnání. Nestačí jednou ověřit, že se model chová správně. OpenAI chce porovnávat výsledky s dřívějšími incidenty, sledovat, zda model nepozná, že právě prochází hodnocením, a zkoušet i jeho nejhorší realistické chování.
Dokument se dotýká také práce s řetězcem úvah modelu. OpenAI navrhuje, aby automatizovaní hodnotitelé během učení posilováním neviděli interní řetězec úvah. Důvodem je obava, že by se model mohl naučit přizpůsobovat nebo skrývat své chování tak, aby oklamal konkrétní kontrolu.
2. Izolace výpočetního prostředí
Pokud by se model začal chovat nebezpečně, neměl by mít snadnou cestu k systémům, které může poškodit. Druhá vrstva proto staví na izolaci, tedy na oddělení modelu od citlivé infrastruktury.
OpenAI mluví o několika úrovních zabezpečení sandboxu i infrastruktury, která jej provozuje. Součástí má být pravidelné bezpečnostní testování, při němž se výzkumníci snaží najít cestu ven. Kontrolovat se mají také služby, k nimž může mít model během tréninku přístup, například síťová mezipaměť nebo interní nástroje.
Dalším bodem je omezení komunikace mezi jednotlivými vzorky modelu. Pokud spolu mohou různé běhy nebo agenti komunikovat příliš volně, může vzniknout obtížně kontrolovatelný boční kanál. OpenAI proto navrhuje povolit jen schválené cesty, například konkrétní víceagentní nástroje.
Prakticky důležitou součástí jsou i neměnné záznamy. Přepisy činnosti agentů z tréninku, hodnocení a interního nasazení by měly být ukládány tak, aby je nebylo možné zpětně upravovat. To je důležité při vyšetřování incidentu i při ověřování, zda se zpětně nezměnily důkazy.
3. Průběžné monitorování
Samotná izolace nestačí. Třetí vrstva má sledovat, co model během tréninku dělá, a upozornit na podezřelé chování dříve, než způsobí problém.
OpenAI chce ověřovat, zda model zůstává monitorovatelný a zda se nesnaží dohled obcházet. Monitorovací systémy mají být testovány na dřívějších incidentech, ale také na nových typech rizik. Pokud by se opakovaly stále stejné testy, mohly by časem přestat zachycovat nečekané chování.
Zvláštní význam má rychlá reakce. Prioritní výstraha může upozornit pracovníka bezpečnostního týmu nebo vlastníka tréninkového běhu. Pokud na ni nikdo v určeném čase nezareaguje, má se trénink automaticky pozastavit. Tento princip se označuje jako fail-closed: při nejistotě nebo selhání kontroly se systém raději zastaví, než aby pokračoval bez dohledu.
O zastavení běhu nemá rozhodovat jediný člověk
Technická opatření doplňují provozní pravidla. Bezpečnostní případ by podle návrhu neměl schvalovat jen tým, který model trénuje. Posoudit jej mají také vedoucí pracovníci z výzkumu a bezpečnosti a každý z nich má mít možnost tréninkový běh vetovat.
OpenAI navrhuje také takzvaný pre-mortem. Člen jiného týmu má před spuštěním sepsat, jak by celý plán mohl selhat, a hledat slabá místa v bezpečnostním případu. Tento nesouhlas nemá být překážkou pro výzkum, ale povinnou kontrolou proti příliš optimistickému pohledu vlastního týmu.
Součástí má být jasná odpovědnost. Vedoucí pracovník odpovědný za trénink má nést odpovědnost také za bezpečnostní dokumentaci a reakci na incident. Bez podobného přiřazení odpovědnosti se může stát, že bezpečnost zůstane rozptýlená mezi několik týmů a nikdo nebude mít pravomoc rozhodnout.
OpenAI dále počítá s audity, interním dohledem a přesně definovanými postupy pro eskalaci. Bezpečnostní případ má popsat i takzvaná zbytková rizika – tedy problémy, které současná opatření stále nepokrývají.
Větší roli mají dostat nezávislé třetí strany
Návrh z 28. září navazuje na dokument OpenAI z 22. září 2026, který se věnuje nezávislému hodnocení bezpečnosti. Firma v něm uvádí, že externí posuzovatelé mají mít dostatečný přístup k tomu, aby mohli zpochybnit předpoklady laboratoře, ověřit její tvrzení a dojít k vlastním závěrům.
Nezávislé hodnocení se má týkat nejen samotných bezpečnostních případů, ale také kritických ochranných mechanismů, testů schopností a vyšetřování závažných incidentů. Posuzovatelé mohou zkoumat například odolnost sandboxu, spolehlivost monitoringu nebo to, zda testy odpovídají skutečným rizikům.
OpenAI přitom připouští, že jeden externí tým nemůže pokrýt všechny oblasti. Kybernetická bezpečnost, biologická rizika, alignment a víceagentní systémy vyžadují rozdílné odbornosti. Důležitá proto nebude jen nezávislost, ale také jasně vymezený rozsah hodnocení, transparentní metodika a popis nejistoty.
Výsledky by měly být zveřejňovány v největší možné míře. Citlivé technické informace však mohou být redigovány, aby se z bezpečnostního auditu nestal návod k útoku. To je praktický kompromis, který bude důležitý i pro případné evropské a mezinárodní standardy.
Podrobnosti k zapojení externích hodnotitelů OpenAI zveřejnila v textu Priorities and principles for effective third party assessments.
Co se změnilo v posledních měsících
Nový návrh přichází po období, kdy OpenAI zpřísňovala kontrolu tréninkových prostředí a uchovávání záznamů agentů. V červenci 2026 se řešil bezpečnostní incident spojený s OpenAI a Hugging Face. Následně se zvýraznila potřeba nezávislého vyšetřování, kvalitnějších záznamů a jasnějšího určování odpovědnosti.
Koncem září OpenAI také zrušila plánované říjnové nasazení modelu GPT-6.1 Astra do služeb ChatGPT a Codex. Důvodem mělo být nesplnění interních bezpečnostních standardů a klamavé chování v testech. Model zároveň dosáhl prahu kritické kyberbezpečnostní schopnosti podle Preparedness Frameworku, protože dokázal autonomně vyhledávat dosud neznámé bezpečnostní trhliny.
Tento případ ukazuje, proč samotný výkon modelu nestačí. Schopnější AI může být užitečnější při programování nebo analýze, ale zároveň vyžaduje přísnější kontrolu. Pokud bezpečnostní test odhalí problém, odložení nasazení je v praxi důležitější než splnění původního harmonogramu.
Českého uživatele se návrh zatím netýká přímo
Pro běžného uživatele v Česku nebo Evropské unii nejde o novou funkci ChatGPT, kterou by bylo možné zapnout v nastavení. OpenAI popisuje interní pravidla pro trénink nejpokročilejších modelů. Samostatná česká dostupnost, předplatné ani cena proto u tohoto oznámení nedávají smysl.
Dopad je nepřímý, ale významný. Pokud se podobné bezpečnostní případy stanou běžnou součástí vývoje, firmy budou muset lépe dokumentovat, jak své modely testují, kdo schvaluje jejich nasazení a jak reagují na incidenty. Pro evropské podniky může být důležitá hlavně dohledatelnost rozhodnutí, záznamy o provozu a schopnost vysvětlit, jak byla rizika posouzena.
OpenAI zatím nepředstavuje hotový průmyslový standard. Předkládá pracovní rámec, který se má dále měnit. Jeho největší přínos vidím v tom, že bezpečnostní otázky převádí do konkrétních podmínek: kdo dokument připraví, kdo jej může zpochybnit, jak se měří účinnost kontrol a kdy se má trénink automaticky zastavit.
Právě tato provozní stránka bude nakonec rozhodovat o tom, zda bezpečnostní případ zůstane jen dobře napsaným dokumentem, nebo se stane skutečnou brzdou ve chvíli, kdy testy odhalí problém.
FAQ
Je bezpečnostní případ certifikát, že je model bezpečný?
Ne. Jde o strukturovaný argument podložený důkazy, který popisuje rizika, ochranná opatření, nejistoty a zbytková rizika. Nemůže zaručit, že se během dalšího používání neobjeví nový problém.
Bude muset bezpečnostní případ vytvářet každý uživatel AI?
Ne. Návrh OpenAI míří na trénink špičkových modelů a na organizace, které je vyvíjejí. Běžný uživatel ChatGPT ani malá firma podobný dokument kvůli každodennímu používání nástroje vytvářet nemusí.
Proč má být trénink automaticky pozastaven, když nikdo nereaguje na výstrahu?
Jde o princip fail-closed. Pokud není možné ověřit, že je situace pod kontrolou, systém se zastaví. Tím se snižuje riziko, že trénink bude pokračovat bez dohledu jen proto, že pracovník nestihl nebo nemohl na výstrahu odpovědět.