Tohle není další chatbot
GLiNER2.5-Decide patří do kategorie modelů, které generují strukturovaná rozhodnutí namísto dlouhých textových odpovědí. Do vstupu dostane text a schéma otázek s povolenými možnostmi. Výstupem může být například záměr uživatele, naléhavost požadavku a oddělení, kam má být zpráva odeslána.
V praxi to může vypadat třeba takto: zákazník napíše, že mu nefunguje platba a potřebuje problém vyřešit ještě dnes. Model neodpoví univerzálním odstavcem, ale vrátí například hodnoty billing, high a support. Tyto údaje pak může použít helpdesk, automatizace nebo další AI agent.
Důležité je, že GLiNER2.5-Decide negeneruje textové tokeny jako běžný jazykový model a nevyžaduje klasickou promptovací šablonu. Fastino jej popisuje jako specializovaný klasifikátor postavený na encoderové architektuře. Model neřeší otevřené otázky, nevysvětluje své úvahy a není určený k tomu, aby nahradil chatovací model.
Technické detaily, modelovou kartu a ukázku použití zveřejnila společnost na Hugging Face. Popis architektury a provozních scénářů je dostupný také v oficiálním oznámení Fastino.
Rozhoduje podle pravidel, ne jen podle pravděpodobnosti
Jedna z nejzajímavějších vlastností je společné vyhodnocování více odpovědí. Při běžném nezávislém klasifikování může systém správně odhalit prompt injection, ale současně stejný vstup označit jako bezpečný. Každá jednotlivá predikce může mít slušné skóre, dohromady však nedávají smysl.
GLiNER2.5-Decide dokáže do schématu přidat pravidla, která vztahy mezi odpověďmi omezí. Pokud model rozpozná škodlivý typ obsahu, pravidlo může vynutit celkové označení jako nebezpečné. Výsledek pak obsahuje například dvojici safety=unsafe a harm_type=prompt_injection.
Schéma může obsahovat také vzájemné vyloučení, povinné kombinace, limity počtu odpovědí nebo pořadové hodnoty. Model tedy nedostává úplnou volnost. Připomíná spíše zkušeného operátora, který vybírá z předem definovaného formuláře a nesmí zaškrtnout dvě navzájem rozporné možnosti.
Fastino uvádí, že stejná architektura zvládá také extrakci entit, vztahů a strukturovaných záznamů. U těchto úloh může vracet přesné pozice nalezených úseků v textu. U klasifikačních odpovědí ale důkazní úseky automaticky nevrací, takže výsledek stále vyžaduje kontrolu podle konkrétního použití.
V testu porazil větší modely, ale benchmark má jasné hranice
Na interně vytvořeném benchmarku Fast Decisions dosáhl hlavní model s 340 miliony parametrů přesnosti 60,2 procenta. Test zahrnoval 5 100 příkladů v 17 doménách, například zákaznickou podporu, bankovnictví, klinické požadavky, cestování, třídění e-mailů nebo analýzu sentimentu.
Metrika Exact-Match Accuracy je přísná: výsledek se počítá jako správný pouze tehdy, když přesně odpovídá celé očekávané sadě štítků. GLiNER2.5-Decide vedl v 9 ze 17 testovaných datových sad. Nejsilnější byl u směrování záměru, kde dosáhl 75,3 procenta u podpory a 64,3 procenta u bankovních požadavků.
Ve stejném srovnání měl model JevK5 57,6 procenta, SemIf postavený na Qwen3.5-4B 56,4 procenta, GLiFormer large-v1 49 procent a Laya Router 46,6 procenta. Výsledky ukazují, že menší specializovaný encoder může v konkrétní klasifikační úloze překonat podstatně větší generativní model.
To ale není důkaz, že GLiNER2.5-Decide obecně překonává současné modely GPT, Gemini nebo Claude. Tyto systémy jsou určeny pro širší práci s textem, multimodálními vstupy, kódem nebo otevřeným uvažováním. Benchmark Fast Decisions měří jiný typ úlohy a je navíc interně vytvořený společností Fastino. Výsledek je proto zajímavý hlavně jako srovnání specializovaných rozhodovacích modelů, ne jako univerzální žebříček umělé inteligence.
CPU stačí, ale rychlost není kouzlo
Model má 340 milionů parametrů a lze jej provozovat lokálně na CPU, GPU i v odděleném prostředí bez přístupu k internetu. Fastino uvádí pro test s dávkou jedna, dvěma hlavami a patnácti štítky při vstupu dlouhém 64 tokenů medián latence 167,3 milisekundy na 48vCPU procesoru Intel Xeon Platinum 8581C.
Na grafických kartách byla naměřena latence 43,6 milisekundy na NVIDIA T4, 43,4 milisekundy na L4, 38,3 milisekundy na V100 a 47,3 milisekundy na A100. U krátkých vstupů rozdíly mezi GPU zčásti stírá pevná režie předzpracování a spuštění výpočtu. Při delším vstupu dlouhém 1 024 tokenů už A100 dosáhla 52,6 milisekundy, zatímco V100 měla 75,6 a L4 131,4 milisekundy.
Čísla pocházejí z měření Fastino, nikoli z nezávislého laboratorního testu. Přesto dobře ukazují zamýšlené použití: lokální třídění požadavků, bezpečnostní kontrola před předáním dotazu velkému modelu nebo výběr správného nástroje v agentním systému.
Open-weight model bez poplatků za tokeny
Váhy modelu jsou zveřejněné pod licencí Apache 2.0. Vývojář si je tedy může stáhnout a provozovat ve vlastní infrastruktuře, včetně prostředí bez připojení k internetu. Instalace je podle dokumentace postavená na balíčku gliner2 a rozhraní AutoExtractor.
Lokální provoz neznamená poplatek za každý vstupní a výstupní token. Náklady se přesouvají na vlastní hardware, správu systému a případné úpravy modelu. Fastino nabízí také hostované inference a fine-tuning přes vlastní API, ovšem v dostupných podkladech není uveden konkrétní ceník této služby.
Pro české firmy a vývojáře je model dostupný stejným způsobem jako pro uživatele v dalších zemích Evropské unie: přes veřejné váhy a repozitář. U hlavní 340M varianty však dostupné materiály nepotvrzují samostatně změřenou podporu češtiny. Fastino odkazuje také na vícejazyčný model GLiNER2.5-multi-Decide s 287 miliony parametrů, který v uvedeném benchmarku dosáhl 56,7 procenta. To je dobrý důvod k vlastnímu testování na českých datech, nikoli automatická záruka stejné přesnosti v češtině.
Kde dává model největší smysl
GLiNER2.5-Decide je vhodný tam, kde se opakují jasně definované úkoly a výsledek musí mít předvídatelný formát. Může třídit zákaznické zprávy, rozhodovat o předání požadavku právnímu nebo bezpečnostnímu týmu, vybírat nástroj pro AI agenta nebo kontrolovat, zda kombinace výstupů odpovídá bezpečnostním pravidlům.
Jeho výhoda spočívá v oddělení malého rozhodovacího kroku od velkého jazykového modelu. Pokud je třeba jen určit kategorii, prioritu a trasu, posílat celý požadavek do nákladného generativního systému může být zbytečně komplikované. Specializovaný model zde funguje jako rychlý dispečer, nikoli jako hlavní řečník.
Limity jsou stejně důležité. GLiNER2.5-Decide neumí samo o sobě vést otevřený dialog, vysvětlit složité rozhodnutí ani nahradit obecný model při práci s neznámým typem zadání. Přesnost 60,2 procenta v interním benchmarku navíc znamená, že výstupy nelze bez další kontroly použít pro citlivé automatizované rozhodování. U bezpečnosti, financí nebo zákaznických reklamací musí zůstat prostor pro pravidla, audit a případné předání člověku.
Fastino tak nepřináší dalšího univerzálního asistenta. Přináší menší součástku pro AI infrastrukturu, která má dělat jednu věc opakovaně a předvídatelně. A právě v agentních systémech může být taková součástka praktičtější než další model, který se snaží odpovědět úplně na všechno.
FAQ
Je GLiNER2.5-Decide zdarma?
Lokálně jsou modelové váhy dostupné zdarma pod licencí Apache 2.0. Neplatí se tedy poplatky za tokeny, ale provoz vyžaduje vlastní hardware a technickou správu. Hostované API Fastino má samostatné podmínky; konkrétní cena není v dostupných podkladech uvedena.
Umí GLiNER2.5-Decide česky?
Pro hlavní 340M variantu není v dostupných materiálech uveden samostatný benchmark češtiny. Existuje vícejazyčná varianta GLiNER2.5-multi-Decide s 287 miliony parametrů, ale její výsledek v uvedeném benchmarku nelze automaticky převést na přesnost v češtině.
Může tento model nahradit ChatGPT, Gemini nebo Claude?
Ne. GLiNER2.5-Decide je specializovaný klasifikátor pro strukturovaná rozhodnutí, směrování a pravidlové kontroly. Není určený pro otevřený dialog, dlouhé generování textu ani obecné uvažování.
Zdroje: oficiální oznámení Fastino, modelová karta na Hugging Face, benchmark Fast Decisions, MarkTechPost.