Projekt byl oficiálně spuštěn 11. srpna 2026. Stojí za ním Gregory Kurtzer, zakladatel projektů CentOS a Rocky Linux, a sponzoruje jej společnost CIQ. OpenWALDO má fungovat jako komunitně spravovaný základ pro trénování AI modelů, do kterého mohou přispívat jednotlivci, výzkumníci, firmy i instituce.
Nejde tedy o další chatbot ani o nový jazykový model. OpenWALDO buduje infrastrukturu kolem dat, která se při trénování modelů používají. Na oficiálním webu projekt vysvětluje, že jeho cílem je vytvořit zdroje pojmenované, kontrolovatelné, verzované a zpětně ověřitelné. Prakticky řečeno: místo černé krabice má vzniknout veřejná evidence toho, co se do trénovacího procesu dostalo.
Open-weight model ještě neznamená open-source AI
Rozdíl mezi „open-weight“ a skutečně otevřeným modelem je pro běžného uživatele zpočátku trochu akademický. Ve chvíli, kdy ale firma nasazuje AI do produkce, začne být důležitý podobně jako původ součástek u automobilu.
Open-weight model zveřejňuje především své váhy – tedy parametry, které vznikly během trénování. Vývojář si je může stáhnout a provozovat model na vlastním hardwaru nebo v privátním cloudu. To ale samo o sobě neříká, z jakých textů, knih, kódu nebo uživatelských dat se model učil.
Právě v tom OpenWALDO vidí zásadní problém. U některých modelů není jasné, pod jakou licencí byla trénovací data dostupná, zda obsahovala materiály chráněné autorským právem nebo jestli do datasetu pronikly odpovědi jiných AI systémů. Pro firmu to může znamenat právní a provozní riziko. Model sice funguje, ale jeho původ se vysvětluje přibližně stejně jako původ ponožky nalezené po praní.
OpenWALDO chce proto otevřít širší část řetězce: nejen váhy, ale také artefakty, licence, data a jejich původ. Právě z těchto pěti pilířů vzniká název WALDO: Weights, Artifacts, Licenses, Data a Origins.
AI Bill of Materials má ukázat cestu od zdroje k modelu
Jedním z hlavních prvků projektu je standard označovaný jako AI Bill of Materials, zkráceně AI BOM. Název odkazuje na „seznam materiálu“ známý ze softwarového vývoje nebo výroby. U AI modelu by měl evidovat například použité datasety, zdrojové dokumenty, licence, verze dat, výchozí váhy, trénovací běhy a výsledné modelové artefakty.
Podobný seznam může firmě pomoci odpovědět na otázky, které dnes často vyžadují ruční pátrání. Které zdroje byly použity? Jaká licence se na ně vztahuje? Kdy se dataset změnil? Která verze modelu vznikla z konkrétního výběru dat?
Oficiální infrastruktura OpenWALDO využívá Git pro správu významu a metadat, obsahové hashování pro ověření identity souborů a podepisování příspěvků pomocí Developer Certificate of Origin. Data tak nemají být pouze někde vystavena ke stažení, ale mají mít dohledatelnou historii změn.
Pro vývojáře je to důležitý rozdíl. Veřejný soubor bez historie je podobný jako návod bez čísla verze. Může být užitečný, ale při problému se těžko zjišťuje, co přesně se změnilo a kdo za tím stojí.
167 miliard tokenů zní hodně. Ve světě AI je to začátek
Současný veřejný index OpenWALDO obsahuje 167,3 miliardy referenčních tokenů. Projekt uvádí zdroje, jako jsou vládní záznamy, otevřené akademické práce, mailing listy a literatura ve veřejné doméně.
Číslo je působivé, ale v porovnání s trénovacími datasety velkých AI laboratoří jde zatím o menší základ. Komerční špičkové modely se trénují na objemech v řádu bilionů tokenů. OpenWALDO tedy nestaví okamžitou alternativu k datasetům používaným největšími vývojáři modelů. Jeho první hodnota spočívá jinde: v transparentnosti a možnosti nezávislé kontroly.
To je také hlavní limit projektu. Velikost datasetu sama o sobě neurčuje kvalitu výsledného modelu. Rozhoduje výběr dat, jejich čištění, duplicity, poměr jazyků, přítomnost odborného obsahu i způsob trénování. Z 167 miliard tokenů proto automaticky nevznikne model konkurující nejlepším systémům od OpenAI, Anthropic nebo Google DeepMind.
V dostupných informacích zatím není potvrzeno, že by na kompletním datasetu OpenWALDO někdo zveřejnil natrénovaný model s výsledky v běžných benchmarcích. Projekt proto nelze férově srovnávat s aktuálními jazykovými modely podle výkonu. OpenWALDO je především datová a auditní vrstva, nikoli hotový produkt pro koncové uživatele.
Proč projekt přichází právě teď
Otevřené modely v posledních měsících získaly větší pozornost, protože firmy řeší cenu, kontrolu nad daty a závislost na externích API. Aktuální API modely se cenově výrazně liší: například OpenAI GPT-5.6 Sol stojí 5 dolarů za milion vstupních tokenů a 30 dolarů za milion výstupních tokenů, zatímco DeepSeek-V4-Pro-0813 uvádí 0,435 dolaru za milion vstupních a 0,87 dolaru za milion výstupních tokenů.
Cena provozu je ale jen jedna část rovnice. U citlivých firemních aplikací může být stejně důležité, zda lze model provozovat lokálně, jaká data obsahuje a zda lze doložit jejich původ. V regulovaných oborech může audit trénovacích dat znamenat rozdíl mezi hladkým nasazením a dlouhým právním kolečkem.
OpenWALDO se snaží řešit také duplicitu práce. Pokud každá laboratoř znovu sestavuje vlastní základní dataset, opakuje se stejná akvizice, filtrování a kontrola licencí. Sdílený veřejný korpus by mohl část této práce přesunout do společné infrastruktury. Vývojáři by pak přidávali vlastní neveřejná data až nad ověřený základ.
Co to znamená pro české vývojáře a firmy
OpenWALDO je dostupný globálně a jeho zdrojový kód i dokumentace jsou veřejné na oficiálním webu projektu a v jeho GitHub organizaci. Nejde o placenou službu s předplatným ani o chatbot lokalizovaný pro české uživatele. Projekt je komunitní a otevřený, přičemž v dostupných materiálech není uvedena samostatná česká lokalizace.
Pro české firmy může být zajímavý hlavně jako základ pro interní výzkum, vlastní modely nebo kontrolu datových toků. Pokud by organizace chtěla trénovat model nad veřejně dohledatelným obsahem a následně k němu přidat vlastní data, AI BOM by jí mohl usnadnit dokumentaci celého procesu.
To však neznamená, že použitím OpenWALDO automaticky zmizí veškerá právní rizika. Ověřit licenci ještě neznamená získat univerzální souhlas se všemi způsoby využití. Firmy budou muset dál posuzovat konkrétní zdroje, jurisdikci, ochranu osobních údajů a podmínky nasazení. Transparentnější dataset je lepší startovní čára, nikoli právní kouzelná hůlka.
Nejtěžší bude získat důvěru i přispěvatele
OpenWALDO má proti sobě několik praktických překážek. První je rozsah. 167,3 miliardy tokenů je začátek, ale nikoli objem, který by sám o sobě pokryl potřeby trénování moderních univerzálních modelů.
Druhou výzvou bude kvalita komunitního procesu. Otevřený projekt musí řešit spam, nekvalitní zdroje, duplicity, škodlivý obsah i spory o licence. Git a hashování pomohou s historií změn, ale nevyřeší automaticky otázku, zda je každý zdroj vhodný a právně použitelný.
Třetí otázkou zůstává adopce. Vývojáři mohou veřejný korpus použít, ale teprve zveřejněné modely, reprodukovatelné trénovací postupy a nezávislé výsledky ukážou, zda má OpenWALDO praktickou hodnotu i mimo komunitu kolem projektu. Zatím je nejpřesnější popis jednoduchý: vzniká veřejný základ, na kterém se může stavět, ale jeho skutečný vliv se teprve ověří v praxi.
Na myšlence je každopádně zajímavé, že míří na část AI ekosystému, která bývá nejméně viditelná. U modelu si můžete prohlédnout váhy, stáhnout soubory a spustit inferenci. Bez transparentních trénovacích dat ale stále nevidíte, co se odehrálo před tím. OpenWALDO chce tento proces zpřístupnit podobně, jako open-source projekty zpřístupnily zdrojový kód.
FAQ
Je OpenWALDO hotový AI model, který si může stáhnout běžný uživatel?
Ne. OpenWALDO je především veřejný dataset, index a sada nástrojů pro správu původu dat a trénovacích artefaktů. Nejde o chatbot ani o potvrzený univerzální jazykový model pro každodenní používání.
Je OpenWALDO dostupný v češtině?
Projekt je dostupný i českým vývojářům přes web a GitHub, ale v dostupných materiálech není uvedena samostatná česká lokalizace. U českých dat je navíc nutné samostatně ověřit jejich licenci a původ.
Kolik OpenWALDO stojí?
Projekt je veřejný komunitní open-source projekt a nemá uvedený klasický ceník předplatného. Náklady mohou vzniknout až při vlastním ukládání dat, výpočtech a trénování modelů nad jeho infrastrukturou.
Článek vznikl podle informací z The Register, oficiálního webu OpenWALDO a veřejného GitHubu projektu. Stav informací odpovídá 13. srpnu 2026.