Přejít k hlavnímu obsahu

Google ukázal, že na AI agenty nepotřebujete cloud. Drobný model s 270M parametry poráží latenci i účty za API

Ilustrační obrázek
Google ukázal, že na solidní AI agenty nepotřebujete cloud. Jeho tým pro on-device AI předvedl, jak drobný jazykový model s pouhými 270 miliony parametrů — Function Gemma — dokáže po jemném doladění volat funkce telefonu s více než 90% úspěšností. V cloudu by takový výkon nikoho nevzrušil, ale tady mluvíme o modelu, který běží lokálně na tři roky starém Pixelu 7 a zvládá 140 tokenů za sekundu. Cormac Brick z Googlu poodhalil celý pipeline: od syntetických trénovacích dat až po ostré nasazení v transkripční aplikaci Eloquent.

Proč jsou velké modely problém — a malé řešení

Obrovské jazykové modely jako GPT-5.5 nebo Claude Fable 5 potřebují datová centra plná GPU, což s sebou nese tři zásadní nevýhody: latence (každý dotaz putuje přes internet), cena (každý token něco stojí) a soukromí (vaše data opouštějí zařízení). Pro běžné úkony jako „přidej schůzku do kalendáře“ nebo „přepiš diktovanou poznámku bez výplňových slov“ je posílat data na server zbytečné — a v éře EU AI Actu a GDPR často i problematické.

Google na to jde opačně: místo jednoho obřího modelu nasazuje sadu malých, specializovaných modelů. Každý z nich má jen 100–500 milionů parametrů (pro srovnání: GPT-5.5 jich má stovky miliard). Trik je v tom, že malý model musí mít extrémně úzce vymezený úkol — a právě v něm může po správném doladění dosahovat překvapivě vysoké spolehlivosti.

Function Gemma: z 46 % na 90 % díky syntetickým datům

Jádrem prezentace Cormaca Bricka byl Function Gemma — model o 270 milionech parametrů postavený na technologii Gemma 3. Jeho úkol zní jednoduše: na základě hlasového nebo textového příkazu uživatele vybrat správnou funkci zařízení a zavolat ji. V praxi jde o věci jako „přidej zítra v 10 schůzku s Pavlem“, „pošli SMS Martině“ nebo „nastav budík na 6:30“.

Bez doladění — tedy v režimu zero-shot, kdy model dostane jen systémový prompt s popisem funkcí — byla úspěšnost pouhých 46 %. To je pro nasazení v aplikaci naprosto nepoužitelné.

Google proto nasadil chytrý trik: syntetická trénovací data generovaná větším modelem. Konkrétně vzali Gemini Flash (cloudový model) a nechali ho vygenerovat tisíce dvojic „uživatelský dotaz → správné volání funkce“ pro sedm až deset předdefinovaných intentů. Těmito daty pak Function Gemma doladili přes Hugging Face Space.

Výsledek? Úspěšnost vyskočila nad 90 % pro osm z deseti funkcí, u zbylých dvou se pohybovala nad 80 %. Brick to komentoval lakonicky: „Ano, je to víc práce než jen promptovat větší model. Ale umožňuje vám to dodat něco robustního ve vaší aplikaci ve velkém měřítku.“

Jak rychle to na telefonu skutečně běží

Google testoval Function Gemma na Pixelu 7 — telefonu z roku 2022, tedy tříletém hardwaru. Naměřené hodnoty:

  • Pre-fill fáze (zpracování vstupního kontextu): téměř 2 000 tokenů za sekundu
  • Decode fáze (generování odpovědi): přibližně 140 tokenů za sekundu

To znamená, že model stihne odpovědět dřív, než si uživatel všimne jakéhokoliv zpoždění. Pro srovnání: když stejný úkol pošlete do cloudu, přičtěte 100–300 ms latence sítě — a najednou je lokální inference rychlejší.

Brick zmínil i další model — Apple Fast VLM s 500 miliony parametrů, který běží na Qualcomm NPU (Neural Processing Unit) přes Google NPU stack. Přesná čísla neuvedl, ale označil ho za „opravdu svižný“. To naznačuje, že výrobci čipů jako Qualcomm začínají brát inferenci malých modelů vážně a optimalizují pro ni hardware.

LiteRT-LM: open-source motor pod kapotou

Aby to celé fungovalo, potřebujete runtime, který malý model na zařízení skutečně rozběhne. Google k tomu vyvinul LiteRT-LM — open-source framework nahrazující starší formát .tflite. Projekt na GitHubu má přes 6 000 hvězdiček a nabízí:

  • Jeden soubor obsahující model, tokenizer a metadata
  • API pro C++, Javu, Python a Kotlin (Swift a JavaScript v early preview)
  • Export z Hugging Face Transformers přes balíček LiteRT-Torch
  • Podporu GPU, CPU i NPU akcelerace napříč Androidem, iOS, desktopem i Raspberry Pi

Pro vývojáře to znamená jednoduchý pipeline: vezmete model z Hugging Face, exportujete ho přes LiteRT-Torch a nasadíte ho do mobilní aplikace. Celé je to open-source pod licencí Apache 2.0.

Eloquent: dva malé modely, jeden solidní přepis

Brick také ukázal reálnou aplikaci — Eloquent, iOS transkripční nástroj postavený na dvou malých modelech založených na technologii Gemma 3:

  1. ASR engine (automatické rozpoznávání řeči) s několika stovkami milionů parametrů, který zajišťuje základní přepis
  2. Text polishing engine ve stejném měřítku, který odstraňuje vycpávková slova („ééé“, „hm“) a uplatňuje osobní slovník — tedy termíny, jména nebo technický žargon, které si uživatel nadefinuje

Klíčový detail: aplikace funguje zcela offline. Žádná data neopouštějí telefon. To je zásadní pro profese, kde je důvěrnost kritická — právníky, lékaře, novináře. Ačkoliv zatím není v Evropě dostupná (čeká se na dokončení Swift API pro LiteRT-LM), jde o důkaz, že dva úzce specializované malé modely v řetězci dokážou konkurovat cloudovým přepisovacím službám.

Srovnání: Google, Apple a Meta v závodě o on-device AI

Google není jediný, kdo sází na AI přímo v zařízení. Pojďme se podívat, jak si stojí konkurence:

Firma Klíčový model Parametry Přístup
Google Gemma 4, Function Gemma 270M–12B Open-source modely + vlastní runtime (LiteRT-LM) + jemné doladění
Apple Apple Foundation Models (součást Apple Intelligence) ~3B (odhad) Uzavřený ekosystém, hluboká integrace s iOS/Mac, důraz na soukromí
Meta Llama 4 (lightweight varianty) 1B–8B Open-source, zaměření na výzkum, integrace do brýlí Ray-Ban Meta
Microsoft Phi-4 (small varianty) ~3B Open-source, důraz na nasazení v Copilot+ PC

Google má oproti Applu jednu výhodu: celý stack je open-source. Zatímco Apple Intelligence funguje jen v uzavřeném ekosystému, LiteRT-LM a Gemma modely může použít kdokoliv — od startupu v Brně po výrobce chytrých hodinek v Šen-čenu.

Co to znamená pro Česko a Evropu

On-device AI má pro evropský trh specifickou přidanou hodnotu. EU AI Act (plně účinný od srpna 2026) klasifikuje AI systémy podle rizika a vyžaduje transparentnost. Když model běží lokálně a data neopouštějí zařízení, řada regulatorních povinností odpadá — jde totiž o nasazení s minimálním rizikem.

Pro české firmy a vývojáře z toho plynou dvě konkrétní příležitosti:

  • Mobilní aplikace s AI funkcemi bez cloudových nákladů — Function Gemma si můžete doladit na vlastní sadu intentů a nasadit přes LiteRT-LM. Bez poplatků za API volání, bez závislosti na konektivitě.
  • Privátní transkripce a asistence — podobně jako Eloquent. V češtině sice zatím dostupné nejsou (Gemma modely češtinu zvládají jen omezeně), ale architekturu lze použít s modelem, který češtinu podporuje — například s menší variantou Llama 4, která má solidní vícejazyčné schopnosti.

Nutno dodat, že Google zatím oficiálně neoznámil, kdy přesně bude Swift API pro LiteRT-LM hotové a kdy se Eloquent dostane do Evropy. Brick to naznačil jako „coming soon“ — realisticky nejdříve koncem roku 2026.

Skills systém: jak Gemini na telefonu přemýšlí v JavaScriptu

Samostatnou kapitolou je Custom Skills systém uvnitř aplikace Gemini. Model Gemma 4 (4 miliardy parametrů) si v něm vybírá z asi osmi předpřipravených „skills“ — malých JavaScriptových modulů, které dokážou například:

  • Zobrazit widget Google Maps
  • Roztočit „restaurační ruletu“ (náhodný výběr podniku v okolí)
  • Spustit ADB příkaz pro ladění
  • Vytvořit novou skill pomocí jiné skill (meta-schopnost)

Vývojáři mohou psát vlastní skilly ručně (návod je na GitHubu) nebo je generovat pomocí Gemini CLI a Cloud Code. Brickův tým jich takto vytvořil už kolem osmdesáti. Komunitní skilly se sdílejí přes GitHub Discussions.

Zajímavý detail: volání více skillů v rámci jedné odpovědi zatím spolehlivě nefunguje. Brick přiznal, že tým „stále zjišťuje, jak to udělat robustnější“. To je podstatné omezení — skutečně autonomní agent by měl umět zřetězit více akcí za sebou („najdi italskou restauraci do 2 km, zarezervuj stůl na 19:00 a pošli adresu Martině“). Tady je Google teprve na začátku.

Funguje to i na hodinkách a v Chromu

LiteRT-LM už pohání on-device GenAI funkce v Chromu, Chromebooku Plus a Pixel Watch. To znamená, že malé jazykové modely od Googlu běží na zařízeních od nositelné elektroniky po notebooky. Na hodinkách jde typicky o rychlé odpovědi na hlasové příkazy nebo sumarizaci notifikací — úkoly, kde by cloudová latence byla neúnosná.

Google také provozuje AI Edge Gallery — aplikaci dostupnou na Google Play a App Store, kde si můžete modely okamžitě vyzkoušet na vlastním zařízení. To je ideální startovní bod pro každého, kdo chce on-device AI otestovat bez nutnosti cokoliv instalovat či konfigurovat.

Můžu Function Gemma používat pro aplikace v češtině?

Function Gemma je primárně trénovaný na angličtinu a češtinu oficiálně nepodporuje. Pro vícejazyčné nasazení byste museli model doladit na česká data — architektura (LiteRT-LM + Hugging Face pipeline) to umožňuje, ale vyžaduje to vlastní dataset českých uživatelských příkazů a odpovídajících intentů. Alternativou je použít malou variantu Llama 4, která má solidní podporu středoevropských jazyků.

Jak se on-device AI liší od Apple Intelligence?

Oba přístupy běží lokálně na zařízení, ale zásadně se liší v otevřenosti. Apple Intelligence je uzavřený systém hluboce integrovaný do iOS a macOS — vývojář třetí strany ho nemůže upravit ani rozšířit. Google naproti tomu nabízí open-source modely (Gemma) i runtime (LiteRT-LM), takže kdokoliv může celý stack vzít, upravit a nasadit ve vlastní aplikaci. Apple sází na bezproblémovou uživatelskou zkušenost, Google na flexibilitu pro vývojáře.

Kolik stojí nasazení on-device modelu oproti cloudovému API?

On-device model má nulové provozní náklady na inferenci — žádné poplatky za tokeny, žádné API volání. Zaplatíte jen jednorázově za vývoj a doladění modelu. Pro srovnání: cloudové volání funkce přes GPT-5.5 může při 100 000 dotazech denně vyjít na stovky dolarů měsíčně. U on-device řešení platíte pouze za elektřinu, kterou spotřebuje procesor telefonu — což jsou jednotky haléřů. Nevýhodou je, že doladění modelu vyžaduje technickou expertizu a vlastní dataset.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.