Co OpenAI zjistila
OpenAI popsala událost jako adversarial distillation, tedy nepovolené získávání výstupů jednoho modelu za účelem trénování, napodobení nebo zlepšení jiného modelu. Princip je podobný situaci, kdy student systematicky opisuje nejen hotové odpovědi, ale také postup, kterým k nim někdo zkušenější došel.
U moderních reasoning modelů se tento postup týká takzvaného chráněného uvažování. Jde o interní záznam pracovních kroků, který model používá při řešení úlohy, ale běžně ho uživateli neukazuje v plné podobě. Na obrazovku se dostane hlavně výsledná odpověď.
Pokud někdo takové interní postupy získá ve velkém objemu, může je použít jako trénovací data pro jiný systém. Nemusí pak kopírovat zdrojový model přímo. Stačí mu sbírat jeho reakce, vytvářet z nich příklady a učit vlastní model podobnému chování.
OpenAI uvádí, že první zaznamenaná aktivita začala 1. července 2026. Zpočátku probíhala v malém objemu, 24. a 25. července však firma zachytila špičku 16 000 požadavků s použitím relevantního vzorce dotazů. Tyto pokusy pocházely od více než 4 000 uživatelů.
Další analýza odhalila související aktivitu v síti čítající přes 15 000 uživatelských účtů. OpenAI tvrdí, že propojenou síť do 28. července vyřadila z provozu. Čísla se týkají pokusů o extrakci, nikoli potvrzených úspěšných stažení chráněného uvažování.
Útok nevedl přes databázi
Nejdůležitější upřesnění se týká způsobu provedení. Podle OpenAI útočníci neprolomili šifrování, nenapadli databáze a nezískali přímý přístup k uloženým konverzacím uživatelů. Zneužili způsob, jakým některé systémy předávají interní pracovní data mezi požadavky.
OpenAI popsala například postup, při kterém někdo zkopíroval zašifrovaný blok uvažování z jedné konverzace a v jiné konverzaci požádal model o jeho dešifrování a přepis. Pro běžného uživatele může takový text vypadat jako nesmyslný řetězec znaků. Model, který rozumí vlastnímu formátu těchto dat, s ním však může zacházet jinak.
Tento detail mění pohled na celou událost. Nešlo o klasický útok typu „někdo se dostal do serveru a stáhl soubory“. Operátoři využili vlastnosti rozhraní a přiměli modely, aby informace reprodukovaly ve formě viditelné pro zadavatele. Ve velkém měřítku se z jednotlivých dotazů stal organizovaný sběr dat.
Nezávislý výzkumný tým popsal podobné techniky ve studii Stealing Reasoning Traces from Proprietary LLM APIs, zveřejněné 10. srpna 2026. Výzkumníci uvádějí, že zašifrované bloky mohou být v určitých implementacích použitelné napříč relacemi, uživateli nebo modely jednoho poskytovatele. OpenAI uvedla, že jejich zjištění prověřila a potvrdila popsané útočné cesty.
Moonshot AI je zmíněna u části aktivity
OpenAI nepřipsala celou kampaň jednomu aktérovi. Výslovně uvedla, že není jasné, zda všichni pozorovaní operátoři pocházeli ze stejné skupiny. Jádro jedné části aktivity však spojila s jednotlivci, kteří měli být napojeni na Moonshot AI, čínskou společnost stojící za modelem Kimi.
Formulace je důležitá. OpenAI neříká, že za veškerou aktivitou stála přímo celá společnost Moonshot AI, ani že každý účet v odhalené síti patřil stejnému zadavateli. Jde o připsání části pozorované činnosti konkrétním jednotlivcům spojeným s touto firmou.
Moonshot AI provozuje vlastní modely a její Kimi je dostupný také jako model určený pro práci s dlouhým kontextem. Samotná existence konkurenčního modelu však není důkazem, že byl získaný materiál použit v jeho tréninku. OpenAI ve zveřejněném textu takový výsledek netvrdí.
Proč je skryté uvažování cenné
Výstup jazykového modelu není pouze hotová věta. U úloh vyžadujících plánování, programování nebo řešení více kroků může model interně provést řadu operací a až potom zobrazit stručný výsledek. Tyto mezikroky mohou obsahovat postupy, kontrolní mechanismy a způsoby práce, které poskytovatel nechce zveřejnit.
Destilace umožňuje jinému týmu získat podobné chování levněji, než kdyby stavěl vlastní velký model od začátku. Nemusí znát původní architekturu ani všechna trénovací data. Potřebuje dostatečné množství kvalitních příkladů, vhodný trénink a způsob, jak napodobit chování zdrojového systému.
Riziko se netýká jen obchodního tajemství. OpenAI upozorňuje, že při přenosu schopností se nemusí přenést také bezpečnostní omezení původního modelu. Jiný systém může napodobit užitečné schopnosti, ale nemusí mít stejná pravidla pro odmítání nebezpečných požadavků.
To je citlivé u modelů používaných pro programování, automatizaci nebo úlohy s možným dopadem na bezpečnost. Získaný materiál může pomoci vytvořit levnější napodobeninu, aniž by její autor investoval srovnatelné prostředky do ochranných mechanismů.
Jak OpenAI reagovala
Firma uvedla několik vrstev obrany. Zablokovala nebo omezila účty, zpřísnila registrace a kontrolu infrastruktury a rozšířila sledování souvisejících sítí. Pokud se aktivita přesunula ke službám třetích stran, OpenAI s jejich provozovateli hledala a rušila zapojené účty.
Technická opatření se zaměřila na chráněné uvažování napříč uživateli, pracovními prostory, organizacemi a rodinami modelů. OpenAI také uzavřela cestu, která umožňovala znovu použít cizí zašifrovaný blok uvažování a pokusit se z něj obnovit obsah.
Další kontrola má zachytávat streamovaný výstup, který by mohl odhalovat interní uvažování. To je důležité hlavně u systémů, které odpověď posílají postupně. Ochrana pak nemůže kontrolovat jen hotový text na konci, ale musí sledovat i průběžná data.
Informace o útoku OpenAI sdílela přes Frontier Model Forum a příslušné kanály pro výměnu informací s úřady. Podle firmy se podobné problémy mohou týkat i dalších poskytovatelů, hlavně tam, kde systémy pracují s přenositelnými nebo opakovaně použitelnými artefakty uvažování.
Dopad na uživatele a vývojáře
Pro běžného uživatele ChatGPT nebo API je nejpodstatnější informace, že OpenAI podle vlastního popisu nehlásí únik uložených konverzací z databází. Událost se týkala cílené manipulace s interakcemi a koordinovaných účtů, nikoli plošného zpřístupnění zákaznických chatů.
Vývojáři používající API by měli věnovat pozornost tomu, jak jejich aplikace zachází s interními výstupy, systémovými instrukcemi a artefakty předávanými mezi relacemi. Pokud aplikace ukládá nebo přeposílá zašifrované části odpovědí, musí počítat s tím, že jejich opakované použití může vytvořit další útočnou cestu.
Pro české firmy a vývojáře se pravidla nemění podle jazyka uživatelského rozhraní. Stejný typ rizika se může týkat služeb dostupných v Česku i v dalších zemích Evropské unie, pokud používají podobný způsob práce s interními výstupy modelů. OpenAI v oznámení neuvedla zvláštní omezení pro český nebo evropský trh.
Vyšetřování podle OpenAI pokračuje. Firma chce dále upravovat technické ochrany, detekci koordinovaných kampaní, odmítání problematických požadavků a zabezpečení nástrojových výstupů. Zveřejněné údaje tak popisují stav po zablokování odhalené sítě, nikoli konečné řešení celého typu útoku.
FAQ
Znamená tato událost, že unikly moje konverzace?
Podle zveřejněného popisu OpenAI nedošlo k prolomení databází ani k přímému přístupu k uloženým uživatelským konverzacím. Útočníci manipulovali interakcemi s modely a snažili se získat chráněné uvažování ve viditelné podobě.
Bylo prokázáno, že Moonshot AI ukradla celé modely OpenAI?
Ne. OpenAI spojila s jednotlivci napojenými na Moonshot AI pouze jádro jedné části pozorované aktivity. Firma zároveň uvedla, že není jasné, zda všichni operátoři patřili k jednomu aktérovi, a nepotvrdila použití získaných dat v konkrétním modelu.
Co znamená modelová destilace?
Modelová destilace je postup, při kterém se výstupy jednoho modelu používají k trénování nebo vylepšení jiného modelu. V tomto případě OpenAI mluví o nepovoleném získávání chráněného uvažování a o koordinovaném sběru těchto dat.