Ternární model Ternary Bonsai 2 27B od Prism ML zabral v našem testu jen 5,95 GB na disku a na jediné grafické kartě RTX 5060 Ti s 16 GB VRAM generoval v průměru 41,51 tokenu za sekundu. To je přibližně pětinásobek rychlosti Qwen3.8-27B ve zdejší konfiguraci. Rychlost ale není vše: Bonsai v českém testu chyboval ve volbě slov a tři z pěti úloh nedokončil, protože narazil na limit výstupu.
27 miliard parametrů v souboru o velikosti 5,95 GB
Prism ML zveřejnil Ternary Bonsai 2 27B v repozitáři Hugging Face jako GGUF model s kvantizací PTQ1_0. Název „ternární“ znamená, že váhy nejsou ukládány tradičními čtyřmi či osmi bity. Pracují s trojicí hodnot: zápornou jedničkou, nulou a kladnou jedničkou. Cílem je stlačit model tak, aby se vešel do běžné grafické paměti, aniž by se jeho schopnosti propadly stejně výrazně jako u běžných agresivních kvantizací.
Model vychází z architektury Qwen3.5 a jeho karta uvádí kontextové okno až 262 tisíc tokenů. Pro běh však není možné použít libovolnou verzi llama.cpp. Prism ML vyžaduje vlastní fork projektu llama.cpp, který obsahuje kernely pro formát PTQ1_0. To je to, co dělí zajímavý experiment od univerzálního lokálního modelu: soubor si lze stáhnout snadno, ale nasazení závisí na specifickém běhovém prostředí.
Jak jsme měřili
Model jsme otestovali v AI Aréně Jarvis AI na serveru jarvisbot. Použili jsme verzi PTQ1_0, Prism ML fork llama.cpp build b10685, jednu grafickou kartu NVIDIA RTX 5060 Ti s 16 GB VRAM, kontext 32 tisíc tokenů a reasoning budget 2 048 tokenů. Šlo o pět textových a programovacích úloh: Drupal modul, HTML/JavaScript animaci, Python vizualizaci, český článek a anglický článek.
Reasoning budget je důležitý detail. Bonsai před finální odpovědí vytváří interní rozvahu, která se započítává do výstupního rozpočtu. Neomezené nastavení by pro srovnání rychlosti nebylo férové, proto jsme limit nastavili na 2 048 tokenů. Výsledky jsou naše vlastní měření, nikoli čísla výrobce.
| Úloha | Rychlost | Celkem tokenů | Čas | Skóre kvality |
|---|---|---|---|---|
| Modul pro Drupal 11 | 41,81 tok/s | 6 291 | 146,9 s | 7/10 |
| HTML/JS animace | 41,34 tok/s | 8 322 | 198,2 s | 8/10 |
| Python galaxie | 41,47 tok/s | 7 245 | 171,3 s | 8/10 |
| Český článek | 41,35 tok/s | 8 373 | 198,1 s | 4/10 |
| Anglický článek | 41,56 tok/s | 6 484 | 152,3 s | 8/10 |
Rychlost počítáme z generovaných tokenů za dobu generování. Sloupec „Celkem tokenů“ uvádí počet tokenů, který vrací API včetně vstupu, proto jej nelze přímo dělit uvedenou rychlostí.
Průměr činil 41,51 tokenu za sekundu. Nejvyšší obsazení VRAM dosáhlo 8 299 MB a teplota GPU se při dlouhých úlohách dostala nejvýše na 82 °C. Rozptyl rychlosti mezi pěti úlohami byl malý, takže nejde o jednorázový šťastný výsledek.
Rychlost proti Qwen3.8-27B
Na stejném stroji jsme dříve testovali Qwen3.8-27B s kvantizací UD-Q3_K_XL. Tento model zde dosahoval přibližně 8,2 tokenu za sekundu a jeho soubor zabírá 13,15 GB. Bonsai se tedy v této konkrétní konfiguraci pohyboval zhruba pětkrát rychleji při méně než poloviční velikosti souboru.
Takové srovnání neříká, že Bonsai automaticky nahradí Qwen ve všech úlohách. Jde o dvě odlišné kvantizace a různé implementace inference. Dobře ale ukazuje, proč jsou ternární váhy zajímavé pro lokální provoz: model s 27 miliardami parametrů se vešel do jedné 16 GB karty s přibližně polovinou paměti stále volnou pro vyrovnávací paměť a provozní režii.
Kód obstál, čeština nikoli
Programovací úlohy dopadly dobře. Odpověď s generátorem 3D galaxie v Pythonu byla dokončena a obsahovala použitelnou strukturu pro NumPy i matplotlib.animation. Model si poradil také s návrhem Drupal modulu a s návrhem animace ve Three.js. U dvou z těchto tří úloh ale narazil na maximální délku výstupu, takže výsledný kód nebylo možné bez kontroly považovat za hotový celek.
Největší problém se objevil v českém článku. Výstup obsahoval slovakismus „neobjavila“, záměnu slova „mění“ za „míní“ a dokonce přepnutí do angličtiny uprostřed věty: „…digitalizace, which? No, Czech:“. Anglický článek ve stejném testu byl naopak souvislý a dokončený. Pro české redakční texty proto Bonsai v tomto nastavení nepovažujeme za použitelný bez důkladné posteditace.
Celkem tři z pěti testů skončily stavem finish=length. Nejde o pád serveru ani o nedostatek VRAM. Model spotřeboval dostupný výstupní prostor, část z něj na interní uvažování, a odpověď byla ukončena limitem. Vyšší limit může pomoci, současně ale prodlouží běh a zhorší předvídatelnost nákladů v lokální aplikaci.
Co ukazují materiály Prism ML
Prism ML v kartě modelu popisuje Bonsai jako ternární rodinu určenou pro vysoký výkon na spotřebitelském hardwaru a zveřejňuje vlastní benchmarky. Tyto výsledky je potřeba číst jako tvrzení autora modelu: používají jiné úlohy, jiné stroje i jiné konfigurace než naše AI Aréna.
Naše měření jeho hlavní tezi o efektivitě potvrzuje. Model o velikosti pod 6 GB běžel svižně na jedné 16 GB kartě a rychlost neklesala ani při dlouhém generování. Kvalita však není rovnoměrná podle jazyka a typu úlohy. Pro anglický prototyp, lokální pomoc při programování nebo rychlé experimenty má Bonsai zajímavý poměr výkonu a velikosti. Pro český publikační workflow by zatím potřeboval buď lepší jazykové doladění, nebo spolehlivý redakční proces po generování.
Verdikt: silný důkaz pro ternární inference, ne univerzální češtinář
Ternary Bonsai 2 27B ukazuje, že ternární kvantizace není jen laboratorní demonstrace. Na spotřebitelské RTX 5060 Ti dosáhl model s 27 miliardami parametrů rychlosti přes 41 tokenů za sekundu a vyžádal si necelých 8,3 GB grafické paměti. To je kombinace, která byla ještě nedávno u této velikostní třídy obtížně dostupná.
Vedle čísel ale stojí konkrétní omezení: závislost na upraveném runtime, nedokončené dlouhé odpovědi a slabá čeština. Bonsai je proto vhodnější jako rychlý lokální pracovní model než jako samostatný autor či kontrolní agent českého obsahu. Právě rozdíl mezi těmito dvěma rolemi rozhoduje, zda úspora paměti přináší v praxi skutečný užitek.
Časté otázky
Co znamená ternární kvantizace?
Váhy modelu se ukládají pomocí tří stavů místo běžných vícebitových hodnot. Cílem je výrazně snížit velikost modelu a nároky na paměť při inference.
Lze Bonsai 2 27B spustit v běžné aplikaci llama.cpp?
Podle dokumentace Prism ML je potřeba jejich fork llama.cpp s podporou formátu PTQ1_0. Standardní build model korektně neobslouží.
Je Bonsai vhodný pro české články?
V našem testu nebyl. Český výstup obsahoval závažné jazykové chyby, takže by vyžadoval pečlivou posteditaci.
Zdroje: Prism ML: Ternary Bonsai 2 27B GGUF; model card a metodika výrobce; PrismML-Eng/llama.cpp; vlastní měření AI Arény Jarvis AI