Světový boj mezi vydavateli obsahu a vývojáři umělé inteligence právě získal nový, nečekaný směr. Zatímco v USA i v Evropě se právní bitvy stále točí kolem otázky, zda je "scrapování" (automatické sbírání) dat pro trénování modelů legální, indický soud v Dillí udělal krok, který může být pro AI firmy velmi osvobozující. Podle zpráv The Economic Times soud rozhodl, že omezování ChatGPT v používání chráněných děl by bylo škodlivé pro růst celého odvětví AI.
Právní argumentace: "Fair Dealing" vs. porušení autorského práva
Klíčovým bodem sporu byla interpretace indického zákona o autorském právu. Mediální agentura ANI se snažila přesvědčit soud, že OpenAI porušuje jejich práva tím, že ukládá jejich literární díla do datových sad pro trénování LLM (Large Language Models). Soudní senát však rozhodl, že tento proces podléhá ustanovení Section 52(1)(a) indického zákona, což v praxi znamená, že jde o tzv. "fair dealing" (spravedlivé užití).
Tento koncept je velmi podobný americkému "Fair Use". Jde o právní princip, který umožňuje používat chráněný materiál bez souhlasu autora za určitých podmínek – například pro vzdělávací účely, kritiku nebo transformativní využití. V tomto případě soud uznal, že AI modely nepoužívají texty k tomu, aby je jen nekontrolovaně kopírovaly a prodávaly jako takové, ale aby z nich extrahovaly vzorce, gramatiku a znalosti, čímž vzniká zcela nový, transformativní produkt.
Srovnání přístupů: OpenAI, Google a Anthropic
Tento právní precedens v Indii vytváří zajímavý kontrast k tomu, jak se k datům staví ostatní hráči na trhu. I když všichni tři velcí bojují s podobnými právními výzvami, jejich strategie se liší:
- OpenAI (ChatGPT): Spoléhá na masivní sběr dat z internetu a argumentuje transformativním charakterem modelu. ChatGPT Plus stojí 20 USD/měsíc (cca 465 Kč) a je plně dostupný v češtině.
- Google (Gemini): Má výhodu díky vlastnímu ekosystému (YouTube, Google Books, Search). Gemini Advanced (v rámci Google One AI Premium) stojí přibližně 22 USD/měsíc. Google se snaží integrovat data tak, aby minimalizoval právní rizika skrze partnerství s vydavateli.
- Anthropic (Claude): Model Claude 3.5 Sonnet je považován za jeden z nejlepších v oblasti logiky a psaní. Anthropic se profiluje jako "AI safety" firma a klade větší důraz na etické zdroje dat, i když jejich cena za Claude Pro je shodná s OpenAI (20 USD/měsíc).
Dopad na český trh a evropskou regulaci
Možná se ptáte: "Co mi je jedno, co rozhodli v Indii?" Odpověď je však jasná – právní precedenty v globálních technologických centrech často ovlivňují diskusi i v jiných částech světa. Nicméně, pro nás v České republice a celé EU platí jiná pravidla.
Zatímco indický soud vidí v trénování AI příležitost pro růst, Evropská unie reaguje skrze přísný EU AI Act. Tento zákon zavádí přísné požadavky na transparentnost. Vývojáři modelů budou muset jasně dokumentovat, jaké autorské dílo použili k trénování, což je v přímém rozporu s tím "černým boxem", který se kolem trénovacích dat často vytváří.
Co to znamená pro české firmy a tvůrce?
- Pro autory a média: V EU máte silnější právní ochranu než v Indii. Pokud AI model generuje obsah, který je příliš blízký vašemu originálu, můžete se snadněji bránit skrze regulaci EU.
- Pro vývojáře a firmy využívající AI: Při implementaci nástrojů jako ChatGPT nebo Gemini do firemních procesů v ČR musíte dbát na to, aby vaše data nebyla bez vědomí použita k trénování veřejných modelů (používejte Enterprise verze, které garantují soukromí).
- Dostupnost: Všechny tyto modely jsou dostupné v češtině a fungují na českém trhu, ale jejich právní "legitimita" v oblasti dat bude v EU vždy pod drobnohledem regulátorů.
Technický kontext: Proč je trénování tak kontroverzní?
Pro neexperty je důležité pochopit rozdíl mezi kopírováním a učení. Když si fotokopírujete knihu, děláte kopii (infringement). Když se člověk přečte knihu a pak napíše vlastní knihu, nepoužívá text přímo, ale využil znalosti z té první (learning). Spory o AI právě o toto "hranicování" mezi kopírováním a učením probíhají. Soud v Dillí se přiklonil k verzi, že AI se skutečně učí.
Znamená toto rozhodnutí, že si může ChatGPT vzít jakýkoliv text z internetu bez placení?
Ne přímo. Rozhodnutí se týká specifického právního rámce v Indii (fair dealing). V EU a USA stále probíhají procesy, které mohou definovat, co je považováno za "spravedlivé užití" pro trénování AI. Vývojáři stále čelí tlaku uzavírat licenční dohody s vydavateli.
Jak poznám, že nástroj, který používám v práci, neporušuje autorská práva?
Nejspolehlivější cestou je používat placené verze pro firmy (např. ChatGPT Enterprise nebo Google Workspace AI), které nabízejí právní záruky a potvrzení, že vaše vstupní data nejsou využívána k trénování veřejných modelů.
Bude být AI v češtině stejně kvalitní jako v angličtině, i když se učí na chráněných textech?
Kvalita modelu závisí na objemu a kvalitě dat. Pokud se právní spory v EU povedou ve prospěch autorů a vývojáři budou mít omezený přístup k kvalitním českým textům, může to vést k mírnému zaostávání modelů v menších jazycích oproti angličtině.