Přejít k hlavnímu obsahu

Liquid AI zrychluje práci s obrázky, bez změny odpovědí modelu

Ilustrační obrázek
Liquid AI přidala ke svému vision-language modelu LFM2.5-VL-3B nový pomocný model LFM2.5-VL-3B-DSpark. Díky spekulativnímu dekódování má v testech zrychlit samotné generování odpovědi až 3,13× na Apple M5 Max a až 2,66× na grafice NVIDIA H100. Výstup přitom zůstává shodný s hlavním modelem. Háček je v tom, že technologie neurychluje zpracování obrázku ani úvodní fázi výpočtu.

Malý pomocník, který nechá velký model pracovat méně často

Novinka byla zveřejněna 24. září 2026 jako experimentální rozšíření modelu LFM2.5-VL-3B. Ten patří mezi takzvané vision-language modely, tedy systémy, které kromě textu dokážou zpracovávat také obrázky. Mohou například popsat fotografii, přečíst text z dokumentu nebo odpovídat na otázky nad grafem.

DSpark není nový samostatný chatbot ani náhrada hlavního modelu. Funguje jako drafter, tedy pomocník, který rychle navrhuje několik dalších tokenů. Hlavní model je následně ověří. Pokud návrhy dávají smysl, nemusí každý token počítat úplně od začátku.

V běžném autoregresivním generování model vytváří odpověď postupně: nejdříve jeden token, potom další a tak dále. Je to podobné jako psaní věty, při kterém smíte položit na stůl vždy jen jedno písmeno. Spekulativní dekódování zkusí položit několik písmen najednou. Velký model je stále kontroluje, takže nejde o zrychlení za cenu horší přesnosti.

U LFM2.5-VL-3B-DSpark se obrazové části a textové tokeny nejprve převedou do společného vnitřního formátu. Pomocný model pak pracuje s takzvanými skrytými stavy hlavního modelu. Nemusí proto zvlášť řešit, zda právě zpracovává slovo, část popisku nebo vizuální informaci z obrázku. Podrobnější popis principu uvádí oficiální oznámení Liquid AI.

Výsledky: nejvíce získá samotné generování

Liquid AI testovala novinku na šesti úlohách z oblasti práce s obrazem. Patřilo mezi ně obecné vizuální otázky, čtení textu z obrázků, popis fotografií, otázky nad grafy, složitější uvažování a vícekolová konverzace. Měření vycházelo z benchmarku MMSpec.

Na Apple M5 Max s prostředím MLX-VLM se rychlost dekódování podle konkrétní úlohy zlepšila 2,30 až 3,13krát. Celková odezva systému, tedy čas zahrnující i další části zpracování, se zlepšila 1,56 až 2,62krát.

Na počítačích s Apple Silicon ale nejde o jediný výsledek. Při použití llama.cpp na stroji s čipem M3 Ultra dosahovalo zrychlení dekódování 1,57 až 2,14krát. Celková latence se v tomto scénáři zlepšila 1,30 až 1,77krát.

Na serverové grafice NVIDIA H100 uvádí Liquid AI až 2,66krát rychlejší dekódování a end-to-end zrychlení až 2,27krát. Jde o měření výrobce na konkrétním hardwaru a v konkrétních úlohách, nikoli o univerzální číslo platné pro každý počítač.

To je důležitý rozdíl. Dekódování znamená samotné generování odpovědi token po tokenu. End-to-end výsledek zahrnuje celý průchod systémem, takže je pro uživatele praktičtější. Pokud model tráví významnou část času načítáním obrázku nebo přípravou vstupu, nemůže se celkový čas zkrátit stejně výrazně jako samotná tvorba textu.

Za rychlost se platí hlavně pamětí, ne kvalitou výstupu

Drafter má 279,5 milionu parametrů a skládá se ze čtyř vrstev dekodéru, projekce skrytých stavů, Markovovy hlavy a malé confidence head. V nasazeném modelu přidává přibližně 8,9 procenta parametrů oproti základnímu LFM2.5-VL-3B.

Na papíře je to poměrně rozumný kompromis. Model se nezvětší o další miliardy parametrů, ale přesto získá pomocníka schopného připravovat bloky kandidátních tokenů. Liquid AI při trénování použila blok o velikosti devíti tokenů. Pro běh doporučuje velikost osm na Apple Silicon a devět v prostředí NVIDIA H100, podle konkrétního nasazení.

Klíčové je, že jde o beztrátové spekulativní dekódování. Hlavní model každý navržený token ověřuje. Pokud návrh odmítne, pokračuje vlastním výpočtem. Při greedy generování by tedy měl být výsledek stejný jako při použití samotného cílového modelu. Modelová karta uvádí také měření počtu navržených a přijatých tokenů pro každou odpověď.

To odlišuje DSpark od zmenšených nebo kvantizovaných modelů, u kterých se může měnit přesnost, chování nebo schopnost pracovat s některými úlohami. Tady se nemění samotný cílový model. Přidává se pouze další výpočetní cesta, která se snaží jeho práci lépe rozvrhnout.

Omezení je ukryté před prvním tokenem

Největší slabina technologie souvisí s tím, co přesně zrychluje. Spekulativní dekódování pomáhá až ve chvíli, kdy model začne generovat odpověď. Neurychluje vision encoder, který převádí obrázek na vnitřní reprezentaci, ani fázi prefill, během které systém zpracuje obraz a textový dotaz před prvním tokenem.

U vision-language modelů může být tato úvodní fáze výrazná. Obrázek se nejprve rozloží na množství vizuálních tokenů a ty se následně zpracují společně s textovým promptem. Pokud uživatel čeká především na první odpověď, nemusí maximální zrychlení dekódování pocítit v plné výši.

Liquid AI tento limit popisuje pomocí Amdahlova zákona: celkové zrychlení je omezené částí úlohy, kterou nezrychlujeme. Když například více času zabere načtení a analýza obrázku než samotné napsání odpovědi, ani velmi rychlý drafter nedokáže zkrátit celý proces stejným násobkem.

Výsledky proto dávají největší smysl u delších odpovědí, kde dekódování tvoří větší část celkového času. U krátké odpovědi na jednoduchou fotografii může být přínos menší. V oznámení Liquid AI není uvedeno měření, které by potvrzovalo stejný přínos pro každý typ obrázku nebo každou délku odpovědi.

Dostupnost: otevřené váhy a podpora běžných nástrojů

Model je dostupný ke stažení na Hugging Face ve formátech Safetensors a GGUF. Liquid AI jej označuje jako open-weight, takže jej lze stáhnout, upravovat a nasazovat bez použití placeného API. Samostatná cena za model v oznámení uvedena není; náklady tak závisí na hardwaru, úložišti a případném provozu serveru.

Podpora je od začátku připravena pro tři ekosystémy: llama.cpp, MLX-VLM a SGLang. První z nich je zajímavý pro lokální provoz v GGUF, MLX-VLM cílí především na Apple Silicon a SGLang na GPU serverové nasazení.

Pro české uživatele to znamená, že nejde o službu s českým webovým rozhraním nebo předplatným dostupným jedním kliknutím. Jde o technický model pro lokální a serverové nasazení. Zveřejněné materiály nepotvrzují zvláštní českou lokalizaci ani samostatné testy kvality v češtině. Model tedy lze provozovat i v Česku a EU, ale jeho praktická použitelnost pro české dotazy bude záviset na jazykové schopnosti základního LFM2.5-VL-3B a konkrétním nasazení.

Také není k dispozici přímé srovnání kvality s aktuálními modely GPT, Gemini nebo Claude. U této novinky by ostatně takové srovnání nebylo hlavním tématem. Liquid AI měří především rychlost inference vlastního modelu proti stejnému modelu bez draf­teru, nikoli to, zda lépe rozpozná obrázek než konkurenční systémy.

Co novinka skutečně mění

LFM2.5-VL-3B-DSpark ukazuje praktický směr, kterým se lokální multimodální AI ubírá: místo neustálého zvětšování hlavního modelu lze část práce přesunout na malý specializovaný pomocník. Výsledkem může být rychlejší generování při relativně malém nárůstu paměťových nároků.

Nejde ale o univerzální zrychlovač všeho, co se děje po vložení obrázku. Největší přínos se projeví během delšího generování a na podporovaném hardwaru. Pro uživatele Apple Silicon a vývojáře pracující s llama.cpp, MLX-VLM nebo SGLang je novinka zajímavá hlavně tím, že je dostupná okamžitě a zachovává výstup cílového modelu.

V praxi tedy DSpark nepřidává modelu nové znalosti ani lepší zrak. Dává mu svižnější způsob, jak dojít ke stejné odpovědi. A někdy je přesně tohle užitečnější než další desítky miliard parametrů.

FAQ

Je LFM2.5-VL-3B-DSpark samostatný chatbot?

Ne. Jde o pomocný drafter pro hlavní model LFM2.5-VL-3B. Sám o sobě není zamýšlen jako plnohodnotný chatbot; navrhuje kandidátní tokeny, které následně ověřuje cílový model.

Zrychlí DSpark také načtení a analýzu obrázku?

Ne. Spekulativní dekódování urychluje především generování textu po zpracování vstupu. Vision encoder ani fáze prefill podle popisu Liquid AI zrychleny nejsou.

Lze model používat v češtině?

Model lze technicky provozovat i v Česku, protože je dostupný ke stažení v otevřených formátech. Zveřejněné materiály však neuvádějí samostatné testy češtiny ani českou lokalizaci, takže kvalitu českých odpovědí nelze z těchto údajů potvrdit.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.