Trénovací data podle záměru, ne podle toho, co je zrovna po ruce
Vývoj vlastního AI modelu obvykle nezačíná otázkou „jaké chování od něj chceme?“, ale spíše „jaká data už máme?“. Tým vezme dokumenty, záznamy komunikace, interní databáze nebo veřejný korpus a následně se je snaží filtrovat, čistit a označit tak, aby odpovídaly zamýšlenému úkolu.
Právě tento postup chce Adaption Labs obejít. Funkce Invent a Dataset podle popisu požadovaného chování vytvoří model-ready datovou sadu. Uživatel tedy nemusí dodat výchozí korpus, předem připravené schéma ani detailní návod pro označování jednotlivých záznamů.
Prakticky to může znamenat například zadání typu: „Vytvoř data pro model, který bude odpovídat pacientům jednoduchým jazykem podle příznaků a doporučí další krok.“ Systém následně připraví strukturu dat a generované příklady. Nejde o běžný chatbot, který pouze napíše několik ukázkových odpovědí. Výsledkem má být soubor určený pro další trénování nebo dolaďování modelu.
Jak Invent a Dataset funguje
Adaption nabízí funkci v aplikaci, přes Python SDK i prostřednictvím REST API. Vývojář nejprve vybere doménu, případně její užší poddoménu. Dokumentace uvádí například kód medical nebo přesnější medical.symptoms_diagnosis.
Výběr domény není jen kosmetický přepínač. Slouží jako základní mantinel pro generování dat. Uživatel může kombinovat více domén, případně jednu doménu zúžit pomocí poddomén. Pokud například zadá doménu bez dalšího omezení, systém pracuje s jejím celým rozsahem.
Generování probíhá asynchronně. Volání datasets.invent vytvoří požadavek a okamžitě vrátí stav running. Aplikace nebo vlastní skript pak kontroluje stav přes datasets.get. Po dokončení lze data stáhnout ve formátu JSONL, JSON, CSV nebo Parquet. Podrobný postup popisuje oficiální dokumentace Adaption.
Pro produkční použití jsou důležité i méně nápadné parametry. Funkce estimate=True umožní zjistit předpokládanou spotřebu kreditů bez vytvoření a zpoplatnění běhu. Parametr idempotency_key zase zabrání tomu, aby síťový výpadek spustil stejnou generaci dvakrát. To je drobnost, která může v automatizovaném provozu ušetřit peníze i nervy.
Dvě podoby dat pro různé typy trénování
Výstup může mít podobu klasického instrukčního datasetu. Ten obsahuje zadání a odpověď, tedy dvojici vhodnou pro supervised fine-tuning. Druhou možností jsou preference_pairs, kde systém vytvoří preferovanou a méně vhodnou odpověď. Taková data lze využít například při metodách založených na preferencích, mezi které patří DPO.
Rozdíl je podobný jako mezi učebnicí a hodnocením dvou řešení. V prvním případě model dostane příklad správného postupu. Ve druhém se učí, která ze dvou odpovědí je kvalitnější. Pro firemní modely, které musí dodržovat styl, bezpečnostní pravidla nebo interní politiku, může být druhý formát praktický.
Jazyková expanze myslí i na lokalizaci
Invent a Dataset podporuje také rozšíření dat do více jazyků a lokalizací. Režim translate vytvoří variantu řádku v každém zvoleném jazyce. Režim localize jde dál a pracuje s dvojicí země a jazyka. Nemá tedy pouze překládat text, ale upravovat jeho formulaci podle konkrétního prostředí.
Uživatel může určit také sample_rate, tedy podíl řádků, které se mají rozšířit. Důležitý detail je, že se kredity účtují podle výsledného počtu rozšířených řádků, nikoli pouze podle původní velikosti datové sady.
Pro české firmy je to zajímavá možnost, ale s jednou výhradou. Adaption veřejně dokumentuje princip jazykové a lokální expanze, nikoli konkrétní garanci české lokalizace pro každý typ zadání. Dostupnost češtiny proto nelze automaticky zaměňovat za potvrzenou podporu všech českých regionálních a oborových variant. Před větším během je rozumné ověřit podporované kódy přes API.
Od popisu úkolu až k natrénovanému modelu
Invent a Dataset není izolovaný generátor souborů. Je součástí širší platformy Adaption, která propojuje automatickou tvorbu dat s nástrojem AutoScientist. ID vytvořené datové sady lze předat do další fáze, kde se společně optimalizují data i trénovací recept.
Adaption uvádí, že AutoScientist dosahuje v interních doménově zaměřených testech v průměru o 35 procent vyššího relativního výkonu než ručně konfigurované trénování. Firma zároveň uvádí růst míry výher v porovnání modelů z 48 na 64 procent. Výsledky pocházejí z interního hodnocení napříč osmi oblastmi a datové sady měly mezi 5 000 a 100 000 řádky.
Tato čísla je třeba číst jako výsledky dodavatele, nikoli jako nezávislý benchmark. Neříkají, že každý model po použití Adaption automaticky překoná konkurenci. Ukazují však směr, kterým se vývoj AI posouvá: člověk specifikuje cíl a software se snaží automatizovat co největší část cesty od dat k modelu.
V srpnu 2026 Adaption Labs představila také AutoScientist API a koncept Tiny AutoScientist pro modely s velikostí přibližně od 0,8 do 8 miliard parametrů. Menší modely mohou dávat smysl pro lokální nebo edge nasazení, kde není praktické posílat každý požadavek do drahého cloudového API.
Kolik to stojí a kde je háček
Invent a Dataset funguje na hostované platformě a spotřebovává kredity. Přesná cena se počítá podle konkrétního požadavku, například podle počtu řádků, zvolených domén a případné jazykové expanze. Veřejná dokumentace proto neuvádí jednoduchý ceník typu „jeden milion řádků za pevnou částku“. Nejpraktičtější je použít odhad přes estimate=True.
Adaption Labs v rámci propagace nabízí tři trénovací běhy zdarma a pro nové uživatele také třicetidenní zkušební období. Tyto nabídky se mohou vztahovat k podmínkám konkrétního účtu nebo plánu, takže před nasazením ve firmě je vhodné zkontrolovat aktuální podmínky přímo v aplikaci.
Největším limitem je závislost na cloudu. Generování probíhá na infrastruktuře Adaption a veřejná dokumentace nepopisuje samostatnou cestu, jak Invent a Dataset provozovat kompletně lokálně. Pro firmy s citlivými interními daty, přísnými požadavky na suverenitu nebo omezením přeshraničního zpracování to může být zásadní otázka.
Další limit je samotná kvalita zadání. „Vytvoř chytrého asistenta pro zákaznickou podporu“ je příliš vágní instrukce. Kvalitnější výsledek bude vyžadovat popis tónu, hranic odpovědnosti, typických případů, zakázaných doporučení a požadovaných formátů. Ruční označování možná mizí, ale specifikace cíle se tím nestává zbytečnou. Jen se přesouvá na začátek procesu.
Pro koho má novinka největší smysl
Invent a Dataset může být užitečný především týmům, které chtějí vytvořit specializovaný model, ale nemají dostatečně připravený dataset. Typickým příkladem jsou interní klasifikátory, asistenti pro práci s firemními dokumenty, modely pro zákaznickou podporu nebo nástroje pracující s oborovou terminologií.
Menší firmy mohou ocenit hlavně rychlejší start. Nemusí nejprve budovat vlastní datový tým jen kvůli tomu, aby zjistily, zda má specializovaný model vůbec smysl. Vývojáři zase získají programové rozhraní, které lze zapojit do automatizovaného workflow.
Naopak nejde o univerzální náhradu za reálná data. Pokud má model pracovat s konkrétními firemními dokumenty, interními pravidly nebo skutečnými zákaznickými dotazy, syntetická data mohou sloužit jako základ, ale nemusí zachytit všechny výjimky. Před nasazením je proto nutné výsledek testovat na oddělených, realistických případech.
Adaption Labs tím každopádně posouvá důležitou část vývoje AI od shánění dat k formulaci záměru. A to je změna, která může být pro mnoho týmů praktičtější než další obecný jazykový model. Když totiž přesně víte, co má systém dělat, není vždy největší problém v modelu. Někdy jen nemáte data, která by mu to dokázala vysvětlit.
FAQ
Lze Invent a Dataset provozovat lokálně bez odesílání dat do cloudu?
Veřejná dokumentace popisuje generování na hostované platformě Adaption. Samostatná možnost kompletně lokálního provozu není v dostupných materiálech potvrzena.
Je Invent a Dataset vhodný pro tvorbu českých trénovacích dat?
Platforma podporuje jazykovou expanzi a lokalizaci, ale konkrétní dostupnost a kvalitu českých jazykových variant je vhodné ověřit přes podporované kódy v API před spuštěním většího běhu.
Nahrazuje vygenerovaný dataset testování na reálných datech?
Ne. Syntetická data mohou urychlit přípravu a pokrýt očekávané případy, ale model je stále nutné ověřit na realistických datech, včetně výjimek a případů, které nebyly v zadání výslovně popsány.
Zdroje: oficiální oznámení Adaption Labs, technická dokumentace Invent a Dataset, popis AutoScientist a analýza MarkTechPost.