Přejít k hlavnímu obsahu

Oxford pustí OpenAI k historickým textům. Co získá veřejnost

Ilustrační obrázek
Oxford umožnil společnosti OpenAI využít digitalizované historické materiály z Bodleian Library pro trénování jejích AI modelů. Dohoda se týká především děl, která už nejsou chráněna autorským právem. Veřejnosti může přinést rychlejší zpřístupnění vzácných dokumentů, zároveň ale ukazuje, jak se knihovní archivy stávají důležitou surovinou pro vývoj umělé inteligence.

OpenAI netrénuje jen na webu. Potřebuje nové zdroje textu

Společnost OpenAI získala přístup k materiálům z oxfordské Bodleian Library v rámci pětileté spolupráce s University of Oxford. Digitalizované dokumenty mají sloužit nejen k jejich zpřístupnění studentům a badatelům, ale také jako součást trénovacích dat pro AI modely.

Informace vyšla najevo díky žádosti podle britského zákona o svobodném přístupu k informacím. The Guardian s odkazem na interní dokumenty Oxfordu uvedl, že digitalizované materiály byly vloženy do trénovacího datového souboru OpenAI. Při oznámení spolupráce v březnu 2025 univerzita zdůrazňovala hlavně digitalizaci a lepší dostupnost sbírek. Úloha dat při trénování komerčních modelů nebyla tehdy veřejnosti popsána stejně výrazně.

Oxford tuto interpretaci odmítá jako zjednodušující. Podle vyjádření univerzity bylo od začátku jasné, že projekt bude zkoumat také využití generativní AI a přispěje k trénovacím datům. Rozdíl tedy není pouze technický, ale i komunikační: jedna strana mluví o otevřenosti projektu, druhá o tom, že veřejný popis dohody nezdůraznil její komerční rozměr.

Co přesně OpenAI z Oxfordu získala

Nejde o kompletní obsah celé Bodleian Library. Oxfordské knihovny spravují přibližně 14 milionů tištěných položek a partnerství se týká pouze vybraných částí fondu. Oficiální popis projektu uvádí jako hlavní vzorek kolekci historických disertací.

Do června 2025 bylo podle zveřejněných informací společnosti OpenAI předáno 125 000 naskenovaných obrazů historických doktorských prací z evropských a amerických univerzit. Projekt dále počítá s digitalizací 3 500 akademických disertací z let 1498 až 1884. Součástí práce je také vytvoření přibližně 429 000 digitalizovaných katalogových karet, které pomáhají badatelům v historických fondech vyhledávat.

Ne všechny tyto materiály představují hotový strojově čitelný text. Část dokumentů existuje jako obrazový sken a teprve následně se zpracovává pomocí OCR, tedy optického rozpoznávání znaků. U rukopisů a starších tisků může být výsledek nepřesný. AI proto v tomto procesu není kouzelné tlačítko, ale spíše velmi rychlý pomocník, kterého musí kontrolovat odborníci.

Oficiální stránka Bodleian Libraries popisuje projekt jako test škálovatelné digitalizace. Oxford zkoumá, jak rychle lze historické sbírky snímat, jak zlepšit metadata a přepisy textu a jak využít AI pro vyhledávání v rozsáhlých kolekcích. Jinými slovy: OpenAI nedostává pouze „knihy pro trénink“, ale také pomáhá financovat technologický proces, který z fyzických dokumentů vytváří digitální archiv.

Veřejná doména neznamená nulové riziko

Oxford zdůrazňuje, že dohoda se týká materiálů, na které se už nevztahuje autorské právo. Jde tedy o díla ve veřejné doméně. Univerzita také uvádí, že spolupráce není exkluzivní a Bodleian Library si ponechává práva k vytvořeným skenům. Digitalizované materiály chce v nadcházejících měsících sama zveřejňovat online.

To je důležitý rozdíl oproti situaci, kdy firma získá unikátní materiál a veřejnost k němu přístup ztratí. V tomto případě by výsledek měl být dostupný nejen trénovacímu systému OpenAI, ale také lidem, kteří budou chtít historické dokumenty studovat přímo. Oxford ostatně už dlouhodobě buduje digitální knihovnu a zpřístupňuje části svých sbírek prostřednictvím služby Digital Bodleian.

Současně ale platí, že veřejná doména řeší autorská práva, nikoli všechny otázky spojené s AI. Zůstává například otázka, jak přesně budou modely s historickými texty pracovat, zda dokážou správně rozlišit dobový názor od ověřeného faktu a jak snadno bude možné dohledat původ konkrétní informace v jejich odpovědi.

Trénovací data nejsou databáze, ze které chatbot jednoduše vytáhne stránku knihy. Model se při trénování učí statistické vztahy mezi slovy, strukturami vět a různými typy dokumentů. Výsledkem může být lepší práce s historickým jazykem nebo méně běžnými tématy, ale také nepřesné shrnutí či smíchání několika podobných zdrojů. Digitalizace proto automaticky neznamená, že AI začne dějiny citovat jako archivář.

Oxford získá peníze, nástroje i nepříjemné otázky

Spolupráce je součástí iniciativy NextGenAI. OpenAI na ni vyčlenila 50 milionů dolarů určených na výzkumné granty, výpočetní kapacitu a přístup k API pro zapojené akademické instituce. Oxford zároveň v březnu 2025 oznámil širší partnerství, v jehož rámci měli akademici a zaměstnanci získat přístup k nástrojům OpenAI a univerzita plánovala nasazení ChatGPT Edu.

Pro Oxford je to způsob, jak urychlit digitalizaci rozsáhlých sbírek bez toho, aby musel celý proces financovat pouze z vlastního rozpočtu. Pro OpenAI jde o přístup k historickým a méně běžným datům, která se obtížně získávají běžným procházením internetu.

Web je dnes pro trénování modelů méně pohodlný zdroj než před několika lety. Obsah je roztříštěný, část stránek je za paywallem a stále větší množství textu na internetu vzniká automaticky. Historické knihy a akademické práce proto představují zajímavý zdroj materiálu, který nebývá ve velkém dostupný v digitální podobě.

Na druhé straně se proti dohodě ozvali někteří zaměstnanci Oxfordu a členové výboru spravujícího knihovnu. Kritika se týká reputačního rizika partnerství s firmou, která vyvíjí komerční AI, i energetické náročnosti provozu podobných systémů. Univerzita se dlouhodobě hlásí k ekologickým závazkům a část akademické obce proto řeší, zda přínos digitalizace odpovídá nákladům spojeným s výpočetní infrastrukturou.

Co to znamená pro čtenáře v Česku a EU

Pro české uživatele není tato dohoda novou službou ani nástrojem, který by si mohli okamžitě aktivovat. OpenAI v rámci projektu neoznamuje speciální českou verzi modelu, nový tarif ani funkci dostupnou pouze v Evropské unii. Přímý dopad bude záviset hlavně na tom, kdy Oxford zveřejní digitalizované materiály a v jakém formátu budou dostupné.

Pokud budou dokumenty publikovány otevřeně online, mohou k nim mít přístup také čeští studenti, historici a veřejnost. Výhodou nebude jen možnost číst jednotlivé skeny. Digitální materiály lze opatřit metadaty, fulltextovým vyhledáváním a dalšími nástroji, takže badatel nemusí cestovat do Oxfordu kvůli každému ověření zdroje.

Pro evropské univerzity je případ zajímavý ještě z jiného důvodu. Ukazuje, že vztah mezi akademickými institucemi a AI firmami se posouvá od běžného nákupu softwaru k dlouhodobému sdílení dat, infrastruktury a výzkumných kapacit. To může urychlit projekty, které by knihovny samy zaváděly pomaleji. Zároveň se ale bude muset přesněji popisovat, co partner získá, jak se s daty zachází a co zůstane veřejnosti.

Nejde jen o jednu knihovnu

Oxford není jedinou akademickou institucí, která s OpenAI spolupracuje na výzkumu a přístupu k datům. Podle The Guardian se do podobných aktivit v rámci NextGenAI zapojily také instituce ve Spojených státech, například Boston Public Library, Caltech, MIT a University of Michigan.

Oxfordský případ je ale výrazný tím, že kombinuje tři světy, které se dosud často řešily odděleně: ochranu kulturního dědictví, otevřený přístup k výzkumu a komerční vývoj AI modelů. Knihovna chce své fondy zachovat a zpřístupnit, OpenAI hledá kvalitní data a akademici řeší, jestli je takové spojení dostatečně transparentní.

Nejdůležitější výsledek tedy nebude samotný počet naskenovaných stránek. Podstatné bude, zda Oxford dokáže současně splnit dva sliby: umožnit lidem lepší přístup k historickým dokumentům a srozumitelně vysvětlit, jakou část hodnoty z nich získá komerční AI firma. Pokud budou dokumenty skutečně zveřejněny a podmínky zůstanou neexkluzivní, může jít o užitečný model spolupráce. Pokud se veřejnost o klíčových detailech dozvídá až z interních zápisů, důvěra se bude budovat podstatně hůře.

FAQ

Používá OpenAI všechny knihy z Bodleian Library?

Ne. Dohoda se týká vybraných digitalizovaných materiálů, především historických disertací a dalších dokumentů ve veřejné doméně. Oxfordské knihovny spravují přibližně 14 milionů tištěných položek, ale celý fond není součástí projektu.

Budou digitalizované dokumenty dostupné také veřejnosti v Česku?

Oxford uvedl, že si ponechává práva k vytvořeným skenům a chce je v dalších měsících zveřejňovat online. Pokud bude přístup skutečně otevřený, nebudou dokumenty omezené pouze na britské uživatele. Přesný rozsah a formát zveřejnění zatím není potvrzený.

Platí se za tuto spolupráci nějaký speciální poplatek?

Nejde o spotřebitelský AI tarif ani o službu, kterou by si mohl běžný uživatel předplatit. Projekt je součástí iniciativy NextGenAI, na kterou OpenAI vyčlenila 50 milionů dolarů pro granty, výpočetní kapacitu a přístup k API zapojeným akademickým institucím.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.