Přejít k hlavnímu obsahu

Claude má neviditelný vodoznak. Jak funguje a co ho dokáže oslabit

Google Gemini a Workspace AI
Anthropic vysvětluje, jak bude Claude označovat své texty: neviditelným statistickým vzorem ukrytým ve výběru slov, nikoli skrytými znaky nebo vloženým komentářem. Značka má pomoci odhadnout, zda Claude text vytvořil nebo zpracoval. Neřekne ale, kdo ho napsal, a už vůbec nepředstavuje důkaz lidského či strojového autorství.

Co Anthropic skutečně oznámil

Anthropic připravuje textový vodoznak pro budoucí modely Claude. Firma ho popisuje v článku How Claude's text watermarking works jako způsob, jak zpětně určit pravděpodobnost, že se Claude na vzniku textu podílel. V tuto chvíli nejde o veřejný detektor, do kterého by kdokoli vložil odstavec a okamžitě dostal výsledek. Anthropic teprve připravuje detekční API a podrobnosti jeho nasazení zatím nezveřejnil.

Novinka se netýká pouze webového chatu. Podle oznámení má značení fungovat i u výstupů přes API a nástroje Claude Code, a to i v případě, že je model zpřístupněn přes cloudové platformy. Anthropic chce vodoznak zapnout globálně, protože zatím neumí spolehlivě oddělit evropský provoz od zbytku světa. Pro českého uživatele tedy nejde o funkci, která by byla omezena jen na účet vedený v Evropské unii.

Vodoznak není skrytý znak ani HTML kód

Claude generuje odpověď postupně. Při každém kroku vypočítá pravděpodobnosti možných dalších tokenů, tedy slov nebo jejich částí, a z nabídky vybere jednu možnost. U věty „Počasí je dnes…“ mohou být rozumnými pokračováními například „chladné“, „zamračené“ nebo „deštivé“. Výběr mezi několika podobně vhodnými možnostmi obvykle nezmění význam věty.

Právě takové nízkorizikové volby může vodoznak využít. Místo obyčejného náhodného výběru použije model při rozhodování tajný klíč a předchozí kontext. Výsledkem není nové slovo, poznámka ani mezera navíc. Model pouze opakovaně vybírá z podobně dobrých kandidátů tak, aby v celém delším textu vznikl statistický vzorec. Čtenář ho neuvidí, ale detektor, který zná příslušný klíč, může zkontrolovat, zda je sled voleb s vodoznakem konzistentní.

Anthropic uvádí, že jeho přístup vychází z metody SynthID-Text popsané v časopisu Nature. Studie Google DeepMind popisuje takzvané turnajové vzorkování: z kandidátů se postupně vybírají tokeny, které lépe odpovídají pseudonáhodným funkcím navázaným na kontext a klíč. Detektor pak neměří jeden konkrétní znak, ale nahromaděnou statistickou stopu.

Proč značka nemá zhoršit odpověď

Anthropic tvrdí, že vodoznak nemění kvalitu, kreativitu ani čitelnost výstupu. To je důležitý rozdíl proti systémům, které do textu přidávají speciální Unicode znaky nebo záměrně nahrazují slova méně přirozenými synonymy. Značení má působit pouze tam, kde existuje více přibližně rovnocenných možností.

U přesných tvrzení se prostor zmenšuje. Po výrazu „2 + 2 =“ je správnou odpovědí prakticky jen „4“, takže není kam vodoznak vložit, aniž by model riskoval chybu. Stejně tak může být stopa slabší u faktografických pasáží, krátkých textů, tabulek a kódu. U komentářů v programu nebo v dokumentaci může nějaký prostor pro statistický vzor zůstat, samotná logika kódu však podle Anthropicu nemá být ovlivněna.

Jak moc lze vodoznaku věřit

Výsledek budoucího detektoru nebude znít „tento člověk podváděl“. Přesnější interpretace bude: „Tento text je statisticky konzistentní s tím, že ho Claude částečně vytvořil.“ Značka neobsahuje jméno uživatele, organizaci, obsah chatu ani jiný identifikátor. Anthropic výslovně uvádí, že z ní nelze dohledat konkrétní osobu.

Vodoznak také nerozliší, zda Claude napsal celý článek, přeložil odstavec, přeformuloval firemní dokument nebo pouze provedl rozsáhlejší jazykovou úpravu. Pokud model vybírá většinu slov, má více příležitostí stopu vytvořit. Při čisté opravě několika čárek jich bude naopak příliš málo. Překlad je zvláštní případ: Anthropic uvádí, že překlad vytvořený Claudem vodoznak nese, protože každé slovo cílového textu vybírá model.

Stejně jako u jiných detekčních metod platí, že absence nálezu není důkazem lidského autorství. Text může být příliš krátký, obsahovat málo náhodných voleb nebo být po cestě výrazně změněn.

Jde vodoznak obejít?

Krátká odpověď zní: do určité míry ano, ale ne jedním univerzálním trikem. Sám Anthropic přiznává, že lehká editace vodoznak pravděpodobně neodstraní úplně. Naopak kompletní přepis, při němž se nahradí prakticky každé slovo a větná struktura, může statistickou stopu zničit. V takovém případě je ale sporné tvrdit, že výsledný text je stále stejným AI výstupem.

Největší slabinou je skutečnost, že značka žije ve statistice celého textu, ne v jednotlivém slově. Parafrázování, změna pořadí vět, spojení s delším lidským textem nebo výrazná redakce může signál oslabit. Překlad není automatická cesta ven: pokud ho provede znovu Claude, vznikají nové volby a podle Anthropicu také nový vodoznak. Překlad jiným nástrojem může původní vzor narušit, ale současně přidává další AI zpracování a sám o sobě nedokazuje lidské autorství.

Stopa bude přirozeně méně přesvědčivá také u krátkých odpovědí, přesných seznamů, matematických řešení nebo kódu, kde model nemá mnoho bezpečných alternativ. To však neznamená, že každý krátký text automaticky projde. Bez zveřejněné implementace detektoru a testů na reálných českých textech nelze poctivě říct, jaká délka nebo jaký typ úpravy bude stačit.

Co to znamená pro školy, firmy a české autory

Pro školy a zaměstnavatele může být modelový vodoznak užitečným doplňkovým signálem, zejména pokud bude detektor poskytovat pravděpodobnost, interval nejistoty a jasná omezení. Neměl by ale fungovat jako automatický rozsudek. Chybná interpretace by mohla poškodit člověka, který použil Claude jen na korekturu, překlad nebo brainstorming.

Evropský kontext je přímý. Evropská komise uvádí, že povinnosti transparentnosti podle článku 50 AI Actu se uplatňují od 2. srpna 2026. Kodex pro transparentnost obsahu vytvořeného umělou inteligencí je dobrovolný nástroj k prokazování souladu, samotné povinnosti v nařízení jsou však právní. Anthropic proto značení spouští celosvětově, nikoli jen v evropské verzi služby.

U obrázků a některých souborů jde o odlišný mechanismus: Claude má přidávat kryptograficky podepsaná metadata podle standardu C2PA. Ta lze číst specializovanými nástroji, ale mohou zmizet při převodu formátu, opětovném uložení nebo nahrání na službu, která metadata odstraňuje. Textový statistický vodoznak a C2PA tedy nelze zaměňovat.

Verdikt: značka je indicie, ne digitální detektor lži

Anthropic zvolil technicky zajímavý kompromis: vodoznak má být pro čtenáře neviditelný a pro poskytovatele detekovatelný, aniž by se do textu cokoli přidávalo. Jeho praktická hodnota ale bude záviset na třech dosud neznámých věcech: jak často správně zachytí skutečný Claude výstup, kolik falešných poplachů vyvolá a jak odolá běžné redakci.

Obejít ho půjde nejspíš výraznou změnou textu, nikoli odstraněním jednoho skrytého znaku. To je současně jeho hlavní výhoda i omezení. Vodoznak může označit pravděpodobnou účast Claude, ale nemůže rekonstruovat historii dokumentu ani rozhodnout, kdo je jeho autorem. Dokud Anthropic nezveřejní detekční API a výsledky testů, měli bychom ho chápat jako technickou indicii pro další kontrolu, ne jako definitivní důkaz.

Obsahuje vodoznak Claude moje jméno nebo údaje z konverzace?

Ne. Podle Anthropicu značka neobsahuje identifikační údaje uživatele, organizace ani konkrétního chatu. Označuje pouze statistickou pravděpodobnost, že se Claude na textu podílel.

Odstraní vodoznak běžná korektura nebo změna několika slov?

Anthropic uvádí, že lehká editace ho pravděpodobně neodstraní úplně. Výrazný přepis může stopu oslabit, ale neexistuje veřejně potvrzený postup ani záruka, že konkrétní úprava detekci obejde.

Bude existovat veřejný nástroj pro kontrolu textu?

Anthropic připravuje detekční API, ale k 15. srpnu 2026 nezveřejnil jeho dokumentaci ani termín zpřístupnění. Do té doby nelze oficiálním nástrojem spolehlivě ověřit libovolný text.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.