Přejít k hlavnímu obsahu

Třetinu webů od roku 2022 psala AI. Prozrazují ji pomlčky a Oxfordská čárka

Ilustrační obrázek pro jarvis-ai.cz
Pew Research Center prošel téměř půl milionu anglických webových stránek z archivu Common Crawl a nechal na nich běžet detekční model Open Pangram. Výsledek: zhruba každá desátá stránka nese známky, že ji psala nebo výrazně upravila umělá inteligence. Když se ale podíváme jen na weby zveřejněné po listopadu 2022, kdy vyšel ChatGPT, stoupne ten podíl na víc než třetinu. A paradoxně se to nejsnáze pozná na drobnostech — na pomlčkách, Oxfordské čárce a slovech, která AI používá o poznání častěji než lidé.

Jak se vlastně pozná, že text psal stroj

Detekce AI textu nefunguje tak, že by hledala jedno konkrétní slovo nebo frázi. Open Pangram, který Pew použil, je open-weight model od společnosti Pangram Labs. Učí se rozpoznávat statistické vzorce napříč velkým množstvím textu — rytmus vět, frekvenci slov, návyky v interpunkci.

Přirovnal bych to k tomu, jak poznáte svého oblíbeného kytaristu. Ne podle jedné noty, ale podle toho, jak frázuje, kam klade akcenty, jaký má celkový rukopis. Stejně tak detektor nepozná AI podle jednoho podezřelého slova, ale podle celkové textury, kterou lidský autor píše jinak než jazykový model.

A tady je klíčové upozornění, které Pew sám zdůrazňuje: detektor se může mýlit. Může označit lidský text za strojový a naopak. Jedno označení tak neznamená, že celá stránka je vygenerovaná — klidně to může být i člověk, který si nechal od AI pomoct s úpravami. Spolehlivost stoupá teprve tehdy, když se podíváte na stovky tisíc dokumentů najednou.

AI píše nejvíc tam, kde jde o peníze

AI text není po internetu rozprostřený rovnoměrně. Pew porovnal čtyři hlavní doménové koncovky a rozdíl je drtivý. Na .com doménách nese známky AI zhruba každá desátá stránka, na .org 4,6 %, zatímco .edu a .gov se drží kolem jednoho procenta. Jinými slovy: komerční weby nesou stopy AI asi desetkrát častěji než univerzitní a vládní stránky.

Ještě zajímavější je vývoj v čase. Na .com doménách stoupl podíl AI textu z přibližně jednoho procenta v lednu 2021 na 9,35 % v lednu 2026. To není skok, ale pětiletý, soustavný náběh. Důvod je nasnadě: univerzity a úřady publikují pomalu, s redakční kontrolou a schvalovacím procesem, zatímco komerční web je úplně jiný svět — zpravodajské weby, marketingová oddělení a automatizované obsahové farmy, kde rychlost vítězí nad pečlivostí.

Slovní podpis AI: pomlčky, čárky a slovo „delve"

Nejzábavnější část studie je seznam prozrazovačů — drobných jazykových návyků, které AI modely přejaly z trénovacích dat a používají je častěji, než je u lidí běžné. Pew porovnal dnešní internet se snímkem z roku 2023:

  • Em pomlčka (—): četnost se zhruba zdvojnásobila
  • Oxfordská čárka (čárka před „a" ve výčtu): nárůst o 63 %
  • Typická AI slovní zásoba (delve, interplay, testament): četnost se více než zdvojnásobila
  • Negativní paralelismus („není to jen X, ale Y"): skoro trojnásobek, i když pořád vzácné

Ta slova stojí za vysvětlení. „Delve" znamená ponořit se či pátrat, „interplay" vzájemné působení, „testament" svědectví či důkaz. V angličtině je AI používá tak nápadně často, že se staly svým způsobem poznávacím znamením. Do češtiny tohle nejde přenést jedna k jedné — český web je v Common Crawl výrazně menší korpus a srovnatelná studie pro češtinu zatím neexistuje. Princip je ale stejný: i český generovaný text má svůj typický rytmus a oblíbená slova, jen ho zatím nikdo takhle systematicky nezměřil.

Proč by vás to mělo zajímat: fotokopie fotokopie

Tady se dostáváme k tomu nejpodstatnějšímu. Common Crawl sám uvádí, že jeho archiv dodává zhruba 70 až 90 % tokenů, na kterých se trénují skoro všechny velké jazykové modely. Když tedy třetina nových stránek vzniká s pomocí AI, znamená to, že budoucí modely se budou stále častěji učit z textu, který sám vygeneroval stroj.

Problém má jméno: model collapse, česky kolaps modelu. Když model opakovaně trénujete na umělých datech, jeho výkon se postupně zhoršuje — ztrácí jemné nuance a posiluje vlastní chyby i předsudky. Profesor Nicolas Papernot z University of Toronto to popsal jednoduše: je to jako pořád dokola kopírovat fotokopii. Při každém cyklu se nějaká informace ztratí.

Není to jen akademická hrozba. Reálně to znamená, že čím víc AI obsahu na webu je, tím cennější budou pro výrobce modelů čerstvá, lidská data — a tím větší váhu budou mít zdroje, které je umějí produkovat.

Co s tím dělá regulace a výrobci modelů

USA zatím spoléhají spíš na dobrovolnost a detekci. Samostatná analýza s nástrojem od Pangram Labs našla letos AI text ve zhruba 9 % článků amerických novin. V Evropě je přístup odlišný: akt o umělé inteligenci (EU AI Act) ukládá poskytovatelům označovat AI generovaný obsah jako uměle vytvořený a zveřejněný AI text k informování veřejnosti má být jako takový přiznaný. Jde tedy o povinnou transparentnost, ne o dodatečnou detekci.

A výrobci modelů hledají spolehlivější cestu než stylistické známky. Anthropic podle dostupných informací pracuje na otiscích prstů přímo na úrovni modelu pro text z Claude — tedy na metodě, která by uměla identifikovat AI výstup, aniž by se spoléhala jen na jazykové vzorce.

Pro českého čtenáře z toho plyne jedno praktické ponaučení: až budete příště číst článek, který působí podezřele hladce, s přehnaně vybroušenými formulacemi a známým rytmem, možná se díváte na text, který prošel strojem. Neznamená to automaticky, že je špatný — ale stojí za to být ostražitější.

Mohu AI text poznat sám podle pomlček nebo slov jako „delve"?

Jednotlivé znaky nestačí — lidé pomlčky i Oxfordskou čárku používají také, a jeden výskyt tak o ničem nerozhoduje. Smysluplné je teprve nahromadění více znaků najednou: neobvykle časté pomlčky, typická AI slova a vybroušená struktura „není to jen X, ale Y" v jednom textu. Detektory navíc pracují se statistikou, ne s jednotlivými slovy.

Vztahuje se ta třetina AI obsahu i na české weby?

Ne. Studie Pew Research Center měřila pouze anglicky psaný web z archivu Common Crawl, kde má čeština výrazně menší zastoupení. Srovnatelná data pro český internet zatím neexistují, ale principy detekce fungují napříč jazyky podobně — liší se jen konkrétní „prozrazující" slova a vzorce.

Znamená 35 %, že třetina nového obsahu je čistě vygenerovaná AI?

Ne. Výsledek značí „známky AI autorství či výrazné úpravy", takže může jít i o lidský text, kterému autor nechal od AI pomoct s formulacemi nebo editací. Detektor se navíc může v jednotlivých případech mýlit, a Pew to v metodice sám přiznává.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.