Přejít k hlavnímu obsahu

Gemini 3.5 Transcribe rozumí opravám i české řeči. Co umí a kolik stojí

Ilustrační obrázek
Gemini 3.5 Transcribe není jen další nástroj, který převede zvuk na text. Google ho staví jako specializovaný model pro přepis řeči, který zvládá automaticky rozpoznávat jazyky, rozlišovat mluvčí a chápat opravy uprostřed věty. Pro českého uživatele je důležité hlavně to, že mezi podporovanými jazyky nechybí čeština.

Google představil Gemini 3.5 Transcribe v srpnu 2026 jako model určený přímo pro převod řeči na text. Dostupný je přes Gemini API, Google AI Studio a Google Enterprise Agent Platform. Model je stále ve fázi preview, takže se jeho chování, limity i dostupnost mohou měnit. Na druhou stranu už nyní nabízí několik funkcí, které běžný diktovací nástroj obvykle řeší až pomocí dalších kroků.

Od přepisu k pochopení toho, co člověk řekl

Tradiční automatický přepis funguje trochu jako písař, který se snaží zachytit každé slovo. Výsledkem bývá text plný výplňových slov, opakování a nedokončených vět. Pokud člověk řekne: „Schůzku uděláme v úterý, vlastně ne, ve středu ve dvě,“ jednoduchý systém může přepsat celou větu přesně tak, jak zazněla.

Gemini 3.5 Transcribe nabízí vedle doslovného režimu také takzvaný Smart transcription. Ten umí odstranit výplňová slova, opravit opakování a zohlednit samovolné opravy mluvčího. Z uvedené věty tak může vzniknout například: „Schůzku uděláme ve středu ve 14:00.“ Nejde o klasické shrnutí. Model by neměl vymýšlet nový obsah, ale upravit podobu toho, co zaznělo, aby se text lépe četl.

Právě tady je rozdíl proti obyčejnému diktafonu s automatickým přepisem. Gemini 3.5 Transcribe se snaží zachovat význam, nejen jednotlivá slova. V praxi to může být užitečné při diktování e-mailů, poznámek po jednání nebo prvního návrhu článku. Samozřejmě stále platí, že u právních, zdravotních nebo finančních dokumentů je nutná lidská kontrola. Umělá inteligence má talent udělat sebevědomou chybu přesně ve chvíli, kdy ji nikdo nepotřebuje.

Čeština je podporovaná, stejně jako přepínání jazyků

Google uvádí podporu více než 85 jazyků a lokálních variant. V oficiální dokumentaci je uvedena také čeština s kódem cs-CZ a slovenština s kódem sk-SK. Model dokáže jazyk automaticky rozpoznat, případně lze jazyk nastavit ručně pomocí kódu BCP-47.

Zajímavější než samotný počet jazyků je podpora takzvaného code-switchingu. Jde o situaci, kdy mluvčí během hovoru přechází mezi jazyky. Typickým příkladem může být česká porada, ve které se míchají anglické názvy produktů, technické zkratky a české věty. Gemini 3.5 Transcribe má podle dokumentace zvládat přepínání jazyků uvnitř vět i mezi jednotlivými promluvami.

Pro české firmy může být důležitá také možnost zadat vlastní slovník. Dokumentace uvádí možnost poslat až 1 000 vlastních výrazů, přičemž Google doporučuje pro nejlepší výsledky spíše menší seznam přibližně do 100 termínů. Hodí se to pro názvy interních systémů, produktů, příjmení nebo technologií, které běžné rozpoznávání řeči často komolí.

Mluvčí, časové značky a limity

U nahraného souboru umí model rozlišovat jednotlivé mluvčí. Funkce se označuje jako speaker diarization a výstup může například označit části textu jako Speaker 1 nebo Speaker 2. Dokumentace uvádí podporu až tří mluvčích, přičemž podpora tří a více mluvčích je experimentální. Marketingové tvrzení o „rozpoznání všech účastníků porady“ je tedy potřeba brát s určitou rezervou. (Google AI for Developers)

Gemini 3.5 Transcribe zvládá také časové značky na úrovni jednotlivých slov. To je praktické při titulkování videa, vyhledávání konkrétní věty v nahrávce nebo při práci s rozhovory. Google ale upozorňuje, že zapnutí slovních časových značek může zhoršit celkovou přesnost přepisu. Funkce tedy není zadarmo ani výpočetně, ani kvalitativně.

U běžného předem nahraného zvuku je základní limit až jedna hodina na požadavek. Pokud uživatel zapne diarizaci nebo časové značky, limit může klesnout na 30 minut. Živý režim používá samostatný model gemini-3.5-transcribe-live a jedna relace může trvat nejvýše 10 minut. Pro delší záznamy je proto potřeba zvuk rozdělit na více částí nebo použít jiný provozní postup. (Google AI for Developers)

Benchmarky vypadají dobře, přímé srovnání ale chybí

Google uvádí, že Gemini 3.5 Transcribe dosahuje podle měření Artificial Analysis průměrné chybovosti WER 4,0 procenta při streamování a 2,6 procenta u nestreamovaného přepisu. WER, tedy Word Error Rate, vyjadřuje podíl chybně rozpoznaných slov. Nižší číslo je lepší, ale výsledek výrazně ovlivňuje jazyk, kvalita zvuku, přízvuk, počet mluvčích i množství okolního hluku.

Na benchmarku FLEURS Google uvádí hodnotu 5,50 procenta pro streamovací režim a 5,04 procenta pro nestreamovaný přepis. Zároveň tvrdí, že čas do finálního přepisu se proti staršímu modelu Chirp 3 zlepšil o 70 procent. Tato čísla pocházejí z materiálů Googlu, takže je nelze automaticky považovat za nezávislý test všech běžných scénářů. (Google DeepMind)

Nejbližším přímým konkurentem je například GPT-4o Transcribe od OpenAI. OpenAI u něj uvádí zlepšení chybovosti a rozpoznávání jazyků proti původním modelům Whisper, na oficiální stránce však neposkytuje stejné WER srovnání, které by umožnilo férově postavit oba modely vedle sebe. GPT-4o Transcribe stojí 2,50 dolaru za milion vstupních audio tokenů a 10 dolarů za milion výstupních tokenů; dostupnost bezplatné úrovně oficiální dokumentace neuvádí. (OpenAI)

Claude v tomto srovnání není přímou alternativou specializovaného přepisovacího modelu. Z dostupných oficiálních materiálů nelze potvrdit samostatný model Claude určený pro audio transkripci se srovnatelnými parametry. Porovnávat proto jeho obecné jazykové schopnosti s přepisovacím modelem by bylo spíše technologické jablko proti hrušce. A obojí může být chutné, ale benchmark z toho nebude.

Kolik Gemini 3.5 Transcribe stojí

Google pro Gemini API uvádí bezplatnou úroveň i placený provoz. U modelu Gemini 3.5 Transcribe je cena stanovena na 2 dolary za milion vstupních audio tokenů a 12 dolarů za milion výstupních textových tokenů. Při orientačním kurzu 23 Kč za dolar jde přibližně o 46 Kč za milion vstupních audio tokenů a 276 Kč za milion výstupních textových tokenů. Google zároveň uvádí orientační cenu přibližně 0,005 dolaru za minutu, tedy asi 0,12 Kč za minutu při stejném kurzu. Jde o odhad, nikoli pevnou cenu za každou minutu v každém typu nahrávky: skutečná cena závisí na tokenizaci zvuku a výsledného textu. (Google AI for Developers – ceník)

Pro živý přepis je cena jiná. Model Gemini 3.5 Transcribe Live má podle ceníku stát přibližně 0,009 dolaru za minutu při započtení vstupního zvuku a výstupního textu, což při orientačním kurzu 23 Kč za dolar odpovídá asi 0,21 Kč za minutu. I zde jde o orientační částku a skutečná cena závisí na tokenizaci. Bezplatná úroveň je označena jako dostupná, ale Google rozlišuje mezi testováním a placeným používáním. U bezplatného provozu také uvádí, že data mohou být použita ke zlepšování produktů, zatímco u placeného provozu je tato možnost uvedena jako ne. Pro firemní nasazení je proto nutné zkontrolovat konkrétní smluvní a datové podmínky. (Google AI for Developers – ceník)

Je dostupný v Česku?

Po technické stránce ano. Čeština je v seznamu podporovaných jazyků a model je dostupný přes Gemini API a Google AI Studio. Cloudová dokumentace uvádí globální dostupnost v režimu preview. To však neznamená, že všechny funkce musí být současně dostupné v každé spotřebitelské aplikaci Googlu nebo na každém zařízení v Česku.

Pro běžného uživatele je proto rozdíl mezi „model podporuje češtinu“ a „Google ho nabízí jako hotovou funkci v konkrétní aplikaci“. Vývojář může s modelem pracovat přes API, zatímco dostupnost některých funkcí v aplikacích jako Gboard, Gemini nebo Chrome se může lišit podle regionu, účtu a fáze zavádění. K 27. srpnu 2026 je nejjistější cesta pro vlastní testování Google AI Studio nebo Gemini API. (Google DeepMind)

Komu dává nový model smysl

Gemini 3.5 Transcribe má největší praktický potenciál u vývojářů, zákaznických linek, médií, tvůrců titulků a firem, které zpracovávají rozhovory nebo porady. Výhodou není pouze převod hlasu na text, ale kombinace jazykové identifikace, vlastního slovníku, rozlišení mluvčích a chytrého formátování.

Naopak pro jednorázový přepis krátké hlasové poznámky nemusí být API nejpohodlnější cesta. Uživatel musí řešit účet, klíč API, nahrání souboru a ochranu citlivých dat. Pokud jde jen o rychlé nadiktování SMS, jednodušší bude využít běžnou diktovací funkci v telefonu.

Gemini 3.5 Transcribe tedy nepřináší pouze přesnější „přepisovač“. Jeho důležitější změna spočívá v tom, že se snaží přiblížit rozdílu mezi tím, co člověk řekl, a tím, co skutečně potřebuje dostat na obrazovku. U češtiny, odborných výrazů a smíšených jazyků bude rozhodovat až reálné testování na konkrétních nahrávkách. Čísla z benchmarků jsou slibná, ale mikrofon v místnosti plné lidí má pořád vlastní názor.

FAQ

Umí Gemini 3.5 Transcribe přepisovat české nahrávky?

Ano. Čeština je uvedena mezi podporovanými jazyky pod kódem cs-CZ. Model lze používat také se slovenštinou a podporuje automatické rozpoznání jazyka.

Dokáže Gemini 3.5 Transcribe rozpoznat jednotlivé mluvčí?

Ano, u předem nahraných souborů podporuje diarizaci až tří mluvčích. Podpora tří a více mluvčích je experimentální.

Je Gemini 3.5 Transcribe zdarma?

Google uvádí bezplatnou úroveň v Gemini API, ale placený provoz se účtuje podle tokenů. U modelu Gemini 3.5 Transcribe je uvedena cena 2 dolary za milion vstupních audio tokenů a 12 dolarů za milion výstupních textových tokenů. Skutečná cena závisí na tokenizaci zvuku a textu.

Zdroje: Google DeepMind – představení Gemini 3.5 Transcribe, Google AI for Developers – dokumentace k přepisu, Google Gemini API – ceník, OpenAI – GPT-4o Transcribe.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.