Avatar není jen animovaná hlava
Na první pohled by se mohlo zdát, že Google k hlasovému chatbotu jednoduše přidal digitální obličej. Technicky je ale změna zajímavější. Gemini 3.8 Live s Live Avatarem kombinuje nativní komunikaci speech-to-speech s nízkolatenčním generováním videa. Model tedy nepracuje pouze s přepisem řeči, který následně pošle textovému modelu a syntetizátoru hlasu. Zpracovává zvuk a obraz současně a odpověď vytváří jako kombinaci audia a videa.
Pro uživatele to znamená přirozenější průběh rozhovoru. Avatar může reagovat na přerušení, měnit výraz obličeje, správně synchronizovat pohyb rtů a plynule předávat slovo druhé straně. Google popisuje využití například pro zákaznickou podporu, interaktivní průvodce nebo samoobslužné kiosky. Jinými slovy: chatbot už nemusí působit jako hlas zavřený v reproduktoru. Může být součástí vizuálního rozhraní, které uživatel vidí a sleduje.
Funkce je dostupná v rámci Gemini Enterprise a Google ji od 24. září označuje jako obecně dostupnou pro podnikové nasazení. Technologie byla nejprve představena v náhledu na Google Cloud Next 2026.
Model může pracovat na pozadí, aniž přeruší rozhovor
Nejdůležitější částí novinky nemusí být samotný avatar, ale způsob, jakým Gemini zachází s nástroji. Asynchronní volání nástrojů umožňuje modelu spustit API nebo jiný firemní proces na pozadí a současně dál mluvit s uživatelem.
Praktický příklad nabízí Google v podobě hotelového odbavení. Uživatel může říct, že dorazil na hotel, a agent mezitím v systému ověří rezervaci, zkontroluje údaje nebo spustí další interní operaci. Avatar nemusí ztichnout a čekat, než se backend vrátí s odpovědí. Může potvrdit, že požadavek zpracovává, a pokračovat v konverzaci.
To je rozdíl oproti jednodušším hlasovým botům, kteří po každém požadavku působí jako telefonní automat čekající na další stisk tlačítka. Vizuální avatar sám o sobě produkt nezachrání, pokud pod ním nefungují nástroje, firemní data a správně nastavená oprávnění. Právě propojení živého rozhovoru s agentní logikou proto dává celé funkci větší význam než samotný pohyb obličeje.
Gemini 3.8 Live navíc současně zpracovává zvuk, živý obraz z kamery a sdílení obrazovky. Agent tak může například sledovat dokument nebo předmět před kamerou a reagovat na něj během rozhovoru. Google tuto schopnost ukazuje mimo jiné na scénáři příjmu pojistné události, kdy uživatel popisuje škodu a současně ji snímá kamerou.
97 jazyků, ale češtinu Google výslovně nepotvrdil
Live Avatar podporuje automatické rozpoznávání a přepínání mezi 97 jazyky. Google uvádí, že se při změně jazyka přizpůsobí nejen hlas, ale také synchronizace rtů a výrazy avatara. Cílem je zabránit tomu, aby při vícejazyčné konverzaci vznikal vizuální nesoulad mezi řečí a pohybem úst.
Pro české firmy je důležitá opatrná interpretace. Google potvrzuje podporu 97 jazyků, ale v dostupném oznámení neuvádí jejich úplný seznam. Nelze proto bez dalšího tvrdit, že Live Avatar oficiálně podporuje češtinu na stejné úrovni jako všechny ostatní jazyky. Z hlediska dostupnosti je podstatné, že služba běží na zabezpečených koncových bodech v USA a Evropské unii. To je relevantní pro firmy, které řeší umístění dat, podnikové řízení a regulatorní požadavky.
Nejde však o funkci, kterou by si dnes běžný uživatel v Česku jednoduše zapnul v mobilní aplikaci Gemini. Aktuální uvedení míří na Gemini Enterprise a vývojáře využívající rozhraní Gemini Live API. Pro domácí použití tak zůstává živý avatar spíše ukázkou směru, kterým se budou konverzační asistenti vyvíjet.
Výkon v testech a srovnání s konkurencí
Podle hodnocení Speech-to-Speech Quality Index od Artificial Analysis dosáhl Gemini 3.8 Live Extended Thinking skóre 82,6 bodu a obsadil první místo v daném hodnocení. V testu agentního plnění úkolů τ-Voice dosáhla rozšířená verze úspěšnosti 68,6 procenta, zatímco základní Gemini 3.8 Live dosáhl 30,1 procenta.
Čísla jsou zajímavá, ale není správné z nich automaticky vyvodit, že Gemini je ve všech situacích lepší než aktuální modely GPT nebo Claude. Benchmark měří konkrétní schopnosti za konkrétních podmínek. Neříká, jak si systém povede v každém zákaznickém centru, při každém přízvuku nebo při práci s interními databázemi. Přesto naznačuje, že Google nesází pouze na efektní video, ale také na kombinaci živé komunikace a práce s nástroji.
Rozšířený režim Gemini 3.8 Live Extended Thinking má podle dodaných informací v současnosti stále status privátního náhledu. Produkčně dostupná je tedy Live Avatar vrstva postavená na Gemini 3.8 Live, zatímco delší uvažování není automaticky součástí veřejně dostupného nasazení pro všechny zákazníky.
Kolik živý avatar stojí
Google účtuje Gemini 3.8 Live podle spotřeby tokenů. Oficiální ceník Agent Platform uvádí cenu 3 USD za 1 milion vstupních audio tokenů a 12 USD za 1 milion výstupních audio tokenů. Textový vstup stojí 0,75 USD a textový výstup 4,50 USD za 1 milion tokenů. Samotný výstup avatarového videa je účtován sazbou 1 USD za 1 milion tokenů.
Google v přepočtu uvádí zhruba 0,005 USD za minutu audio vstupu a 0,018 USD za minutu audio výstupu. U živého videa je ale potřeba dávat pozor na způsob účtování. Dokumentace uvádí, že video výstup avatara se účtuje pouze v době, kdy avatar aktivně mluví, nikoli během celého času, kdy poslouchá.
Výsledná cena proto nebude záviset jen na délce hovoru. Do účtu vstupuje také množství textu v kontextu, počet volání nástrojů, délka mluvených odpovědí a to, jak často avatar skutečně generuje video. Pro firmu s tisíci hovory denně je to provozní položka, kterou nelze odhadovat pouze podle ceny jedné minuty.
Vlastní avatar ano, ale zatím jen přes allowlist
Zákazníci mohou využít knihovnu připravených avatarů. Vlastní avatar lze vytvořit z referenční fotografie a zvukového vzorku, přičemž Google slibuje zachování podoby, stylu značky nebo identity postavy. Vlastní tvorba je ale v současnosti dostupná pouze podnikům zařazeným na allowlist.
To je rozumné omezení. Avatar vytvořený podle skutečné osoby může být užitečný pro firemní prezentaci, školení nebo zákaznickou podporu, ale zároveň přináší otázky souhlasu, identity a zneužití. Google proto generovaný zvuk i video označuje neviditelným vodoznakem SynthID. Ten má pomoci rozpoznat obsah vytvořený nástroji Googlu a omezit riziko záměny s autentickým záznamem.
Gemini 3.8 Live s Live Avatarem je tak především podniková platforma pro konverzační agenty, nikoli nový způsob, jak si každý vytvoří digitální kopii sebe sama. Její hodnota bude stát hlavně na napojení na reálné systémy, kvalitě dialogu a schopnosti pracovat s obrazem bez přerušení rozhovoru. Samotný avatar je jen přední část celého stroje. A jako u každého stroje bude záležet na tom, co je připojeno pod kapotou.
FAQ
Je Gemini 3.8 Live s avatarem dostupný zdarma?
Ne jako běžná bezplatná funkce pro veřejnost. Live Avatar je dostupný v Gemini Enterprise a využívání přes API se účtuje podle spotřeby audio, textových a video tokenů.
Umí avatar sledovat kameru nebo sdílenou obrazovku?
Ano. Gemini 3.8 Live dokáže současně zpracovávat zvuk, živé video z kamery i sdílenou obrazovku a reagovat na ně během hovoru.
Lze vytvořit avatara podle vlastní fotografie?
Ano, Google tuto možnost nabízí, ale vlastní tvorba avatarů je zatím dostupná pouze prostřednictvím schváleného enterprise allowlistu.