Jak dostat obrazovou AI přímo do telefonu
LFM2.5-VL-3B patří mezi takzvané vizuálně-jazykové modely. Nepracuje tedy jen s textem, ale dokáže přijmout také fotografii, snímek obrazovky nebo naskenovaný dokument. Uživatel se pak může zeptat například na to, co je na obrázku, kde se nachází konkrétní objekt nebo co obsahuje tabulka.
Proti běžnému používání cloudových chatbotů má model jiný způsob nasazení: může běžet přímo v zařízení. Fotografie účtenek, interní dokumenty nebo snímky obrazovky tak nemusí automaticky opouštět zařízení. To je praktické nejen z hlediska soukromí, ale také při práci bez stabilního připojení k internetu. Samotný lokální běh samozřejmě neznamená, že je každý způsob použití automaticky bezpečný. Záleží na tom, odkud model stáhnete, jak ho spustíte a zda aplikace, která ho obaluje, neposílá data dál.
Podle oficiálního oznámení Liquid AI na Hugging Face kombinuje model jazykové jádro LFM2.5-2.6B s obrazovým enkodérem SigLIP2 NaFlex od Googlu. Jednoduše řečeno: jedna část modelu se stará o porozumění textu a druhá o převod obrazu do podoby, se kterou může jazyková část pracovat.
Od účtenky po tlačítko na obrazovce
Novinka není zaměřená jen na popisování fotografií. Liquid AI vyzdvihuje především čtyři oblasti:
- Porozumění obrazovkám a rozhraním – model dokáže určit, kde se na obrazovce nachází tlačítko nebo jiný prvek uživatelského rozhraní.
- OCR a práce s dokumenty – umí číst text z dokumentů a zachovat také informaci o jejich rozložení.
- Grounding – na základě slovního zadání dovede označit konkrétní objekt v obraze.
- Více obrázků a volání funkcí – může porovnávat několik snímků a předávat informace dalším nástrojům prostřednictvím volání funkcí.
Pro běžného člověka to může znamenat například rychlé vytěžení údajů z účtenek, roztřídění fotografií produktů, kontrolu jednoduchého formuláře nebo převod naskenovaného PDF do textu. Grafička může model využít při prvotní kontrole podkladů, hledání konkrétního prvku ve velkém množství obrázků nebo při popisu obsahu fotografií pro archivaci. Výsledek je ale potřeba kontrolovat stejně jako u jiných obrazových modelů. Chyba v jednom čísle z faktury nebo špatně rozpoznaný detail v návrhu může být důležitější než rychlost.
Proč je důležitá odezva přímo v zařízení
LFM2.5-VL-3B byl navržený pro nízkou odezvu a přímé generování odpovědí. Model se nesoustředí na dlouhé mezikroky uvažování, což snižuje latenci. Pro úlohy typu „přečti tento dokument“, „najdi tlačítko“ nebo „popiš obrázek“ je to často praktičtější než čekat na rozsáhlou analýzu.
Liquid AI podle zveřejněných měření uvádí na Apple M5 Max rychlost 228 tokenů za sekundu a na AMD Ryzen AI Max+ 395 rychlost 116 tokenů za sekundu. V kvantizované podobě se vejde přibližně do 3,3 GB paměti, přičemž pro telefony může být náročnost zhruba kolem 2 GB. Na Samsungu Galaxy S26 Ultra Liquid AI uvádí rychlost 20 tokenů za sekundu. Jde o údaj výrobce, nikoli o výsledek nezávislého testu. Orientačně to naznačuje, že by odezva mohla být dostatečná pro interaktivní práci s fotografiemi nebo obrazovkou, nikoli jen pro laboratorní ukázku.
Na serverovém GPU NVIDIA H100 dosahuje podle údajů Liquid AI při vysokém souběhu přibližně 11 000 tokenů za sekundu. U pětisnímkového videa uvádí firma odezvu k prvnímu tokenu kolem 34 milisekund. Tato čísla jsou zajímavá hlavně pro vývojáře, kteří chtějí zpracovávat velké množství obrazových vstupů. Pro domácí použití je podstatnější, že model může fungovat lokálně a bez placení za každý jednotlivý dotaz.
Výsledky: silný hlavně při práci s obrazovkou
V oficiálních testech se LFM2.5-VL-3B zlepšil proti předchozímu LFM2-VL-3B hlavně v porozumění obrazovkám, lokalizaci objektů, práci s více obrázky a volání nástrojů. Například v testu RefCOCO zaměřeném na lokalizaci objektů dosáhl skóre 87,9 bodu, zatímco předchozí verze měla 57,1 bodu.
V testu ScreenSpot-v2 pro práci s grafickým rozhraním dosáhl průměrného skóre 80,7. Podle stejné tabulky v oficiální modelové kartě dosáhla Gemma-4-E4B skóre 51,2, Qwen3.5-4B 78,5 a InternVL-3.5-4B 84,1 bodu. V některých úlohách ale větší modely zůstávají napřed. InternVL-3.5-4B například ve stejné tabulce a v tomto testu dosáhl 84,1 bodu a Qwen3.5-4B 78,5 bodu.
Podobně smíšený obrázek nabízí práce s dokumenty. V testu ChartQA zaměřeném na grafy získal LFM2.5-VL-3B 81,3 bodu. To je lepší než u některých menších konkurentů, ale Qwen3.5-4B dosáhl 84,2 bodu. V testu DocVQA pro porozumění dokumentům model získal 91,1 bodu, zatímco Qwen3.5-4B dosáhl 94,8 bodu.
Čísla pocházejí z měření výrobce a jednotlivé výsledky závisí na použitých parametrech i způsobu vyhodnocení. Nejde proto o univerzální žebříček, který by rozhodl, který model je nejlepší pro každého. Z výsledků ale vyplývá, že LFM2.5-VL-3B se nesnaží porazit větší modely ve všech disciplínách. Jeho výhodou je kombinace nízké velikosti, rychlosti a dobré práce s obrazovkami a objekty.
Čeština zatím chybí
Pro český trh je důležitá jazyková podpora. Modelová karta uvádí 16 jazyků: angličtinu, arabštinu, čínštinu, francouzštinu, němčinu, italštinu, japonštinu, korejštinu, portugalštinu, španělštinu, vietnamštinu, thajštinu, indonéštinu, hindštinu, ruštinu a polštinu. Čeština mezi nimi uvedena není.
To neznamená, že model v češtině vždy selže. Znamená to ale, že Liquid AI českou podporu v dostupné dokumentaci nepotvrzuje a výsledek nemusí být spolehlivý. Pro české dokumenty je proto vhodné udělat vlastní test na několika typech textu – například na účtence, smlouvě, tabulce a fotografii s diakritikou. U citlivých nebo právně důležitých dokumentů by lokální AI neměla nahrazovat kontrolu člověkem.
Stažení je zdarma, nasazení něco stojí
LFM2.5-VL-3B je k dispozici jako open-weights model na platformě Hugging Face. Podle licence Liquid AI je zdarma ke stažení a spuštění. Komerční použití je bez licenčního poplatku určeno subjektům s ročním příjmem do 10 milionů dolarů. Před komerčním nasazením je nutné zkontrolovat aktuální licenční podmínky a přesnou definici příjmového limitu; firmy nad touto hranicí by si měly ověřit, zda podmínky licence splňují.
Model lze používat přes Transformers, vLLM, SGLang, llama.cpp, ONNX nebo MLX. Pro běžného uživatele je nejjednodušší vyzkoušet webovou ukázku ve WebGPU, která umožňuje nahrát obrázek bez instalace celého vývojového prostředí. Vývojář, který chce model provozovat lokálně, bude potřebovat základní znalost Pythonu, správu modelů a vhodný hardware.
Pro domácí notebook bez samostatné grafiky může být první instalace zbytečně složitá. Naopak pro malou firmu, která pravidelně zpracovává fotografie, dokumenty nebo obrazovky, může lokální model dávat smysl. Odpadá průběžná platba za API a citlivá data mohou zůstat v interním prostředí. Náklady se ale přesouvají na hardware, instalaci, údržbu a kontrolu výstupů.
Pro koho je lokální obrazový model vhodný
Pokud hledáte rychlý model pro rozpoznávání obrázků, OCR, lokalizaci objektů nebo práci s obrazovkou, LFM2.5-VL-3B stojí za vyzkoušení. Zvlášť zajímavý je pro vývojáře, kteří chtějí obrazovou AI provozovat přímo na zařízení nebo v interní síti.
Pro českého uživatele je ale rozumné začít opatrně. Čeština není oficiálně uvedená mezi podporovanými jazyky a model není určený pro dlouhé, složité uvažování nebo náročné technické dotazy. Jeho předností je rychlá a konkrétní práce s obrazem, nikoli univerzální náhrada velkého cloudového asistenta.
Za mě je nejzajímavější právě praktická kombinace: model je malý, rychlý a umí víc než jen popsat fotografii. Pokud Liquid AI dokáže jeho jazykovou podporu rozšířit také o češtinu, mohl by být pro lokální zpracování dokumentů a obrazovek podstatně zajímavější i pro české domácnosti a firmy. Dnes je ale nejlepší brát ho jako schopný nástroj pro konkrétní vizuální úlohy, ne jako univerzálního českého asistenta.
FAQ
Mohu LFM2.5-VL-3B spustit bez připojení k internetu?
Ano. Po stažení modelu a potřebných knihoven může běžet lokálně na podporovaném počítači, telefonu nebo jiném zařízení. Internet je potřeba především pro stažení modelu, aktualizace a případné doplňkové služby.
Umí model číst české účtenky a dokumenty?
Liquid AI češtinu mezi oficiálně uvedenými podporovanými jazyky nemá. Český text může někdy rozpoznat, ale přesnost je potřeba ověřit na vlastních dokumentech a výsledek u důležitých údajů ručně zkontrolovat.
Je LFM2.5-VL-3B vhodný pro dlouhé odborné analýzy?
Spíše ne. Model je určený hlavně pro rychlé úlohy, jako je OCR, popis obrázků, lokalizace objektů, práce s obrazovkou a volání funkcí. Modelová karta ho nedoporučuje pro dlouhé, reasoningově náročné úkoly.