Přejít k hlavnímu obsahu

Gemini přemýšlí nahlas. Nový hlasový model mluví 97 jazyky

Ilustrační obrázek
Google oznámil dva nové hlasové modely — Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking. Oba zvládnou konverzaci v 97 jazycích, přepínají mezi nimi uprostřed věty a rozumí i obrazu z kamery. Silnější varianta navíc umí svůj postup uvažování přečíst nahlas, čímž řeší největší bolest dosavadních hlasových asistentů: trapné ticho ve chvíli, kdy model „přemýšlí“.

Hlasoví asistenti měli dlouho jeden společný problém. Když jste se jich zeptali na něco složitějšího, nastalo ticho. Vy jste nevěděli, jestli asistent stále poslouchá, spadl, nebo se jen snaží. Google teď na tuhle nepříjemnost odpovídá modelem, který svou práci prostě komentuje nahlas. A rovnou ve 97 jazycích.

Dva modely pro dvě různé úlohy

Google nevsadil na jeden univerzální model, ale rozdělil práci mezi dva. Gemini 3.8 Live je levnější a rychlejší varianta určená pro velké nasazení — vývojář, který hlasovou AI zabuduje do aplikace s tisícovkami uživatelů, ocení hlavně nízkou cenu a zpracování obrazu s téměř nulovým zpožděním. Gemini 3.8 Live Extended Thinking je naopak silnější model s vícekrokovým uvažováním, určený pro úlohy, kde na rychlosti tolik nezáleží, ale na správnosti ano.

Obě varianty jsou od oznámení dostupné přes Gemini API, Google Workspace a aplikaci Gemini. Kromě 97 jazyků nabízejí přepínání jazyka uprostřed konverzace a práci na pozadí — model může plnit úkol, aniž by přerušil hovor.

Přemýšlet nahlas je vlastnost, ne trik

Klíčovou novinkou je takzvané „vokalizované uvažování“ (vocalized reasoning). Když model dostane složitý požadavek, místo ticha řekne něco ve smyslu „počkej, mrknu na to“ a dál zpracovává úkol v pozadí, přičemž průběžně hlásí postup. Pro uživatele to znamená, že konverzace nepůsobí, jako by se zadrhla.

V ukázkách, které Google zveřejnil, model reaguje na hlasové pokyny s pochopením kontextu a Extended Thinking při programování slovně komentuje, co právě dělá. V jednom demu model pozná náčrt nakreslený na tabuli, spojí ho s hlasovou zpětnou vazbou a vygeneruje React komponenty — tedy prakticky propojuje vidění a řeč při skutečné práci.

Jak si stojí proti konkurenci

Nezávislé hodnocení dává Googlu zatím za pravdu. V indexu kvality řeči Artificial Analysis (Speech to Speech Quality Index) dosáhl Extended Thinking skóre 82,6 a obsadil celkově první místo — před OpenAI GPT-Live-1-Astra a Grok Voice Think Fast 2.0 od SpaceXAI.

Zajímavější je druhý žebříček, Speech Agent Arena, kde lidé hodnotí kvalitu zvuku, aniž by věděli, který model ho vyprodukoval. Tam se Gemini 3.8 Live umístil druhý — a první místo drží starší generace Gemini 3.1 Flash Live Minimal, tedy Google sám. V praxi to znamená, že špičku hlasové AI momentálně obsazuje jedna firma, a to dvěma modely najednou.

Čestně je ale potřeba dodat, že benchmark není to samé jako reálná zkušenost. Skóre 82,6 vypovídá o kvalitě v testovaných podmínkách, ne o tom, jak se model bude chovat v hlučné kanceláři nebo při češtině s nářečím.

Vodoznak v každé větě. A EU AI Act

Každý zvuk, který nové modely vygenerují, bude opatřen digitálním vodoznakem SynthID. To je reakce na rostoucí obavy z deepfakes, tedy zneužití syntetického hlasu. Google k modelům vydal i takzvaný model card, dokument shrnující bezpečnostní informace.

Tenhle krok není náhoda. Jde stejným směrem, jakým míří evropský AI Act, který požaduje označování obsahu vytvořeného umělou inteligencí a transparentnost vůči uživatelům. Pro evropské firmy, které budou hlasovou AI nasazovat, je to signál, že Google přichází s řešením odpovídajícím regulaci ještě před tím, než začne platit v plném rozsahu.

Co to znamená pro Česko

Nejpodstatnější otázka pro českého čtenáře zní: je mezi 97 jazyky i čeština? Google v oznámení konkrétně zmiňuje japonštinu, český jazyk oficiálně nepotvrdil. Při takovém počtu podporovaných jazyků je její zahrnutí pravděpodobné, ale dokud to Google výslovně nepotvrdí, je férové to napsat jako otevřené.

Pro vývojáře je cesta jasná. Modely jsou k dispozici přes Gemini API a Google AI Studio, a Google se kvůli rychlejší adopci spojil s infrastrukturními firmami Agora, LiveKit a Vercel, aby šlo streamy zvuku v reálném čase napojit snadno. Běžní uživatelé si technologii vyzkouší přes Search Live, zatímco Extended Thinking se postupně dostává do Workspace pro platící zákazníky Gemini Live a Google AI.

Cenu za použití přes API Google v oznámení nezveřejnil, takže pro vývojáře, kteří plánují nasazení ve větším měřítku, zůstává klíčová otázka nákladů zatím otevřená.

Novinka navazuje na řadu Gemini 3.8 Flash, kterou Google vydal začátkem září. Flash exceluje v textu a obrazu, Live přidává hlas — dohromady tak Google skládá kompletní multimodální portfolio. Zatímco se OpenAI, SpaceXAI a řada startupů předhánějí v hlasové AI, Google vsadil na dvě věci, které se v reálném provozu ukážou jako rozhodující: počet jazyků a schopnost modelu komunikovat, co právě dělá.

Je Gemini 3.8 Live dostupný v češtině?

Google uvádí podporu 97 jazyků a konkrétně zmiňuje japonštinu, český jazyk ale v oznámení výslovně nepotvrdil. Při takovém rozsahu je čeština pravděpodobná, oficiální potvrzení zatím chybí.

Jaký je rozdíl mezi Gemini 3.8 Live a Extended Thinking?

Live je levnější a rychlejší model pro velké nasazení, Extended Thinking je silnější varianta s vícekrokovým uvažováním, která navíc umí svůj postup přečíst nahlas.

Zabrání vodoznak SynthID zneužití hlasu?

SynthID označí, že zvuk vygenerovala AI, a usnadní odhalení syntetického obsahu. Nezabrání samotnému vytvoření deepfaku, ale pomáhá s jeho identifikací a zpětným dohledáním.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.