Přejít k hlavnímu obsahu

Gemini se ve videu naučilo samo hledat. Analýza je až o 66 % levnější

Ilustrační obrázek
Video bylo dosud tím nejdražším, co jste mohli umělé inteligenci předložit. Model vzal celou stopáž a přečetl ji snímek po snímku, ať už se ptal na souhrn, nebo na jednu větu. Google teď u modelů Gemini Flash spouští agentní porozumění videu, které tohle chování obrací naruby: místo přehrávání se model v záběru sám rozhlíží a hledá jen to, co k odpovědi skutečně potřebuje. Výsledek je až o 88 % méně tokenů, o 66 % nižší náklady a o 7 % vyšší přesnost — bez jakéhokoli příplatku.

Od přehrávání k procházení: jak to funguje

Doposud Gemini zpracovával video „staticky“. To v praxi znamenalo pevnou frekvenci jednoho snímku za sekundu (1 FPS), zvuk v jediném kanálu o kvalitě 1 Kbps a časové značky po jedné sekundě. Na devadesátiminutovou přednášku to vyjde zhruba na 5 400 snímků — a všechny putovaly do kontextu, ať už vás zajímal souhrn, nebo jen jediný okamžik, kdy přednášející přešel k ceníku.

Agentní režim tuhle logiku ruší. Model teď dostane k videu vlastní sadu nástrojů pro vyhledávání a spustí smyčku Think → Act → Observe: nejdřív si rozmyslí, co hledá, pak si načte konkrétní segment, snímek, přepis řeči nebo zvukovou stopu, vyhodnotí výsledek a teprve podle toho se rozhodne, kam se podívat dál. Do kontextu tak putuje jen to, co dotaz opravdu vyžaduje.

Představte si to jako rozdíl mezi tím, když si půjčíte film a pustíte si ho celý, versus když ho procházíte podle obsahu a kapitol. Obojí vám na konci odpoví na stejnou otázku, ale ta druhá cesta vás stojí řádově méně času — a v tomto případě i peněz.

Proč na tom záleží: čísla místo dojmů

Google v oficiálním oznámení uvádí tři měřitelné efekty. Spotřeba video tokenů klesla až o 88 %, náklady na analýzu videí až o 66 % a přesnost vyhodnocení vizuálních úkolů vzrostla až o 7 %. Největší úspory se projevují právě u dlouhého obsahu — od desetiminutových návodů až po několikahodinové záznamy schůzek či konferencí.

Dodejme ještě jednu věc, která se v titulcích ztrácí: za agentní režim se neplatí žádný dodatečný poplatek. Účtují se výhradně běžné ceníkové sazby Gemini API za spotřebované tokeny. Levnější analýza tedy není „speciální balíček“, ale prostě důsledek toho, že model načte méně dat.

Rychlý řádový přepočet pro představu: 90minutové video při 1 FPS dá přes 5 000 snímků. Každý snímek se do modelu převádí na stovky tokenů, takže samotné obrázky snadno spolknou přes milion tokenů, a k tomu se přidává zvuk a přepis. Když agentní režim spotřebu tokenů srazí o 88 %, z milionů se stávají statisíce — a účet se odpovídajícím způsobem ztenčí. U vývojáře, který denně zpracovává desítky nahrávek, se to na faktuře projeví okamžitě.

Co umí navíc: momenty kratší než sekunda

Agentní porozumění není jen o úspoře. Díky tomu, že si model sám volí, na co se podívat, přibyly i nové schopnosti: detekce událostí kratších než jedna sekunda, přesnější počítání objektů a lepší odhalování anomálií. To je užitečné všude tam, kde statické vzorkování jednou za sekundu něco důležitého prostě přeskočilo — třeba krátký záblesk na kameře, rychlý pohyb ve sportovním záznamu nebo náhlou změnu na bezpečnostní kameře.

Google dává novinku k dispozici v modelech Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash a 3.5 Flash-Lite. Vývojáři ji zapnou jediným polem v požadavku — processing: "agentic" — a to buď v Google AI Studio, nebo přes Gemini API. Analýza funguje jak na nahraných souborech, tak přímo na veřejných odkazech z YouTube. V rámci jedné žádosti lze navíc režimy míchat: agentně zpracovat dlouhou přednášku a krátký klip nechat staticky.

Kdy se agentní režim nevyplatí

Novinka nemá být univerzální náhradou. Google sám uvádí, že statický režim zůstává lepší pro klipy kratší než pět minut a pro práci, která vyžaduje snímek po snímku. U krátkého videa totiž úspora z vyhledávání nepřeváží režii samotného plánování — model si musí rozmyslet, co hledá, a to taky něco stojí. Kdo potřebuje zkontrolovat každý jednotlivý snímek, ať zůstane u statiky.

Za zmínku stojí i to, jak se náklady vykazují. Uvažování o navigaci ve videu se účtuje jako thought tokens, zatímco načtené snímky, zvuk a přepisy jako tool-use tokens. V odpovědi API navíc přibyly dva nové typy kroků — processing_call a processing_result — díky kterým poznáte, že agentní režim skutečně běží, a můžete jimi řídit živý ukazatel průběhu ve svém rozhraní.

Co to znamená pro české vývojáře

Pro české týmy je to dobrá zpráva především proto, že se nic nemění v dostupnosti. Google AI Studio i Gemini API jsou dostupné bez omezení i z Česka, platí se v běžných sazbách a model rozumí českým zadáním i českým videím. Každý, kdo dnes staví nástroj na shrnování záznamů porad, analýzu bezpečnostních kamer, zpracování školení nebo hledání v archivu videí, dostává stejnou funkci výrazně levněji — bez nutnosti cokoli přepisovat, stačí přidat jedno pole.

Z pohledu širšího vývoje to zapadá do trendu, který v agentní AI sledujeme už delší dobu: modely přestávají být pasivními „překladači“ vstupu na výstup a začínají aktivně rozhodovat o tom, které informace načtou. U videa je ten posun nejlépe vidět, protože úspora je tu nejdramatičtější. Google navíc naznačil, že stejnou technologii brzy nasadí i do spotřebitelské funkce „Ask YouTube“, kde se na videa ptáte přímo na stránce sledování.

Hlavní omezení zůstává klasické: jde o hostovanou funkci v rámci API. Žádné otevřené váhy, nic k samohostingu. Kdo řeší citlivá data a chce běžet lokálně, ten si na tuhle úsporu ještě počká.

Musím za agentní porozumění videu něco připlácet?

Ne. Za agentní režim se neplatí žádný dodatečný poplatek. Účtují se pouze běžné ceníkové sazby Gemini API za spotřebované tokeny, přičemž právě jejich spotřeba u videa klesá až o 88 %.

Funguje analýza i u videí, která nejsou na YouTube?

Ano. Podporovány jsou jak nahrané videosoubory v Gemini API a Google AI Studio, tak veřejné odkazy z YouTube. V jedné žádosti lze navíc kombinovat agentní zpracování dlouhého videa se statickým u krátkého klipu.

Poznám v odpovědi, že agentní režim opravdu běžel?

Poznáte. V poli steps se objevují nové kroky processing_call a processing_result, které se střídají s kroky thought a předcházejí model_output. Jejich přítomnost potvrzuje, že agentní zpracování proběhlo, a dá se z nich postavit i živý ukazatel průběhu.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.