Přejít k hlavnímu obsahu

Gemini nově prohledá celé video. U dlouhých záznamů šetří až 88 % tokenů

Ilustrační obrázek
Gemini už video pouze „neprohlíží“ od začátku do konce podle předem daného vzorku. Nový agentický přístup umožňuje modelu samostatně procházet časovou osu, vyhledávat důležité momenty a podle potřeby si vyžádat konkrétní snímky, zvuk nebo přepis. U dlouhých záznamů tak Google uvádí až 88% úsporu tokenů, nižší náklady a přesnější odpovědi.

Video už není jen dlouhý pás snímků

Analýza videa bývala z pohledu jazykového modelu poměrně mechanická. Systém dostal soubor, z něj se v pravidelných intervalech vybraly snímky a ty se následně poslaly do modelu. Například jedno video mohlo být rozděleno na jeden snímek za sekundu. U krátkého klipu to funguje obstojně. U několikahodinového záznamu ale takový přístup připomíná čtení knihy tak, že si z každé stránky vyfotíte jedinou náhodnou větu.

Problém je zřejmý: důležitá událost může trvat jen několik sekund, zatímco mezi dvěma vybranými snímky se odehraje celý děj. Model pak sice dostane velké množství dat, ale nemusí vidět právě to, na co se uživatel ptá.

Google DeepMind proto u modelů Gemini 3.7 Flash, Gemini 3.6 Flash a Gemini 3.5 Flash-Lite nasazuje takzvané agentické porozumění videu. Podrobnosti zveřejňuje na svých stránkách k modelům Gemini a v přehledu aktuálních oznámení. Oficiální srovnání modelů Gemini popisuje tento přístup jako součást širšího posunu k modelům, které dokážou plánovat více kroků a aktivně používat nástroje.

Jak agentické porozumění videu funguje

Agentický systém nepracuje s videem jako s jedním obřím balíkem dat. Nejdříve si vytvoří základní představu o záznamu a potom podle otázky uživatele rozhoduje, kam se podívat podrobněji.

Pokud se například zeptáte, kdy se během tříhodinové porady diskutovalo o rozpočtu, Gemini nemusí analyzovat každý snímek se stejnou intenzitou. Nejprve vyhledá relevantní části časové osy, následně může požádat o přesnější snímkování konkrétního úseku, získat zvukovou stopu nebo pracovat s přepisem řeči. Z více nalezených částí pak sestaví odpověď.

To je důležitý rozdíl proti statickému zpracování. Model si sám volí, jaké informace potřebuje, podobně jako člověk při hledání určité scény ve videu. Nejprve přeskakuje po časové ose, potom se vrací k místu, které vypadá relevantně, a teprve tam si pustí záznam podrobněji. Rozdíl je v tom, že Gemini tento postup provádí prostřednictvím API a bez ručního posouvání přehrávače.

Nejde jen o obraz

Agentické video porozumění kombinuje více typů informací. Model může pracovat s obrazovými snímky, zvukem, textem v obraze i přepisem mluveného slova. To je praktické například u školení, přednášek nebo zákaznických hovorů, kde samotný obraz často nestačí.

Uživatel se tak může ptát nejen na to, co se ve videu objevilo, ale také kdy konkrétní osoba něco řekla, ve kterém okamžiku se změnil graf na obrazovce nebo jak spolu souvisí události z různých částí záznamu.

Až 88 procent méně tokenů a nižší náklady

Nejzajímavější čísla se týkají efektivity. Google uvádí, že agentické zpracování může u dlouhého videoobsahu snížit spotřebu tokenů až o 88 procent ve srovnání se statickým přístupem. Finanční náklady na analýzu mají klesnout až o 66 procent a přesnost odpovědí se podle interního měření může zvýšit až o 7 procent.

Čísla je potřeba číst s určitou opatrností. Nejde o garanci pro každé video a každý dotaz. Úspora bude záviset na délce záznamu, složitosti scény, množství mluveného slova i na tom, jak přesně je úloha zadána. U krátkého videa nemusí být rozdíl výrazný. U několikahodinových záznamů ale může být významný, protože model nemusí detailně zpracovávat části, které s dotazem nesouvisejí.

Pro Gemini 3.7 Flash a Gemini 3.6 Flash platí zaváděcí cena 0,75 dolaru za 1 milion vstupních tokenů a 3,75 dolaru za 1 milion výstupních tokenů. Podle oficiálního přehledu má tato cena platit do 31. prosince 2026. Od 1. ledna 2027 se má zvýšit na 1,50 dolaru za milion vstupních a 7,50 dolaru za milion výstupních tokenů.

Gemini vede v dlouhém videu, konkurence ale nezůstává pozadu

V benchmarku LVBench pro porozumění dlouhému videu dosahuje Gemini 3.7 Flash skóre 85,4 procenta. Gemini 3.6 Flash získává 84,2 procenta. Pro srovnání, ve stejné tabulce je Claude Sonnet 5 uveden se skóre 68,5 procenta a GPT-5.6 Terra se 78,9 procenta.

V tomto konkrétním testu tedy novější Gemini dosahuje nejlepšího výsledku z uvedených modelů. Benchmark ale není univerzální známka kvality. Měří konkrétní typ úloh a nemusí vypovídat o práci s českými videi, nekvalitním zvukem, rychlými střihy nebo odbornou terminologií.

Rozdíl mezi modely se navíc neprojevuje pouze v přesnosti. Důležitá je také cena a způsob práce s kontextem. Claude Fable 5.1 má podle aktuálních ověřených údajů cenu 10 dolarů za milion vstupních a 50 dolarů za milion výstupních tokenů. GPT-5.6 Sol stojí 5 dolarů za milion vstupních a 30 dolarů za milion výstupních tokenů. Gemini tak v případě videoanalýzy nabízí výrazně levnější vstupní i výstupní tokeny, byť samotná výsledná cena závisí na konkrétním workflow.

Co to znamená pro vývojáře a firmy

Agentické video porozumění je dostupné přes Interactions API a GenerateContent API. Google uvádí také podporu v Google AI Studio a prostředí Google Cloud Vertex AI respektive Agent Platform. V praxi to znamená, že nejde pouze o funkci schovanou v běžném chatbotu. Vývojář ji může zabudovat do vlastního nástroje pro vyhledávání ve videích, automatické reporty nebo kontrolu záznamů.

Praktické využití se nabízí například u firemních porad, zákaznické podpory, bezpečnostních kamer, výukových videí nebo technické dokumentace. Uživatel může nahrát záznam a získat seznam klíčových událostí, časové značky nebo odpověď složenou z několika částí videa.

Pro české firmy a vývojáře je důležitá především dostupnost přes API a cloudové platformy. Podpora češtiny pro tuto konkrétní funkci není v uvedeném oznámení samostatně specifikována, takže nelze automaticky tvrdit, že všechny možnosti budou v češtině fungovat stejně dobře jako v angličtině. U českých záznamů bude záležet na kvalitě zvuku, přepisu a odborné slovní zásobě.

Cena je uvedena v amerických dolarech a výsledná částka pro uživatele v Česku se může lišit podle poskytovatele, kurzu, daní a cloudového tarifu. Samotný model proto může být levný, ale celý provoz zahrnuje také ukládání videa, přenos dat a případné další služby.

Nový přístup má i své limity

Agentické neznamená neomylné. Gemini může špatně rozpoznat okamžik, přehlédnout krátkou událost nebo nesprávně spojit obraz se zvukem. U záznamů s překrývajícími se hlasy, špatným osvětlením nebo rychlými střihy bude výsledek méně spolehlivý.

Pro právní, bezpečnostní nebo personální rozhodování proto není rozumné brát výstup modelu jako jediný důkaz. Vhodnější je používat Gemini jako rychlý nástroj pro orientaci a vyhledání relevantních částí, které člověk následně ověří.

Přesto jde o praktickou změnu. Největší přínos není v tom, že model „vidí video“. To už umělé inteligence umějí delší dobu. Podstatné je, že si sama plánuje, na které části videa se podívat podrobněji. Tím se z videoanalýzy stává méně pasivní převod souboru na text a více aktivní vyhledávání informací.

Verdikt: méně slepého vzorkování, více skutečného hledání

Gemini 3.7 Flash posouvá zpracování dlouhých videí směrem k agentnímu workflow. Model nemusí plýtvat výpočetní kapacitou na každý okamžik stejně, ale průběžně si vybírá data, která potřebuje k odpovědi. Podle zveřejněných výsledků to přináší lepší skóre v LVBench, nižší spotřebu tokenů a nižší náklady.

Pro běžného uživatele se změna projeví hlavně tehdy, když pracuje s dlouhými záznamy. U krátkého videa zůstane rozdíl spíše technickou zajímavostí. U několikahodinové přednášky, porady nebo školení už ale může být rozdíl mezi „prohlédni všechno stejně“ a „najdi, co potřebuji“ velmi konkrétní. A také podstatně levnější.

FAQ

Umí Gemini agenticky analyzovat video v češtině?

Konkrétní oznámení Google DeepMind samostatně nepotvrzuje rozsah podpory češtiny pro tuto funkci. Výsledek proto bude záviset na kvalitě českého zvuku, přepisu, obrazu a odborné terminologii ve videu.

Lze agentické porozumění videu použít přes API?

Ano. Google uvádí podporu přes Interactions API a GenerateContent API. Funkce je dostupná také v Google AI Studio a Google Cloud Vertex AI respektive Agent Platform.

Je agentické zpracování vhodné pro kontrolu bezpečnostních kamer?

Může pomoci s rychlým vyhledáním událostí v dlouhém záznamu, ale výstup by neměl být jediným podkladem pro bezpečnostní nebo právní rozhodnutí. Významné události je nutné ověřit přímo ve videu.

Zdroje: Google DeepMind – modely Gemini a jejich srovnání; Google DeepMind – aktuální oznámení.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.