Přejít k hlavnímu obsahu

Gemini 4 Argon zlevňuje cache o 95 procent: Do běžného provozu nespěchá

Abstraktní technologická vizualizace neuronových sítí a datových toků nového modelu Gemini 4 Argon

Google představil novou generaci svého AI modelu s názvem Gemini 4 Argon. Ten přináší výrazný technologický posun v podobě výstupního limitu až 1 milion tokenů najednou a agresivního zlevnění práce s opakovaným kontextem, neboli cache, o 95 procent. Ačkoliv už v interních provozech Googlu přepisuje statisíce řádků kritického kódu a optimalizuje datacentra, k běžným uživatelům a vývojářům se kvůli přísným bezpečnostním prověrkám dostane až v dalších týdnech. Nestandardní představení AI modelu.

Shrnutí v bodech

  • Skok ve výstupu: Gemini 4 Argon zvětšuje generovací strop ze 64k na 1 000 000 tokenů v jediném běhu bez nutnosti kouskování.
  • Výhodná cache: Cena za 1M vstupních tokenů činí 2 dolary, výstup vyjde na 10 dolarů a prompt caching sráží vstupní náklady o 95 % na pouhých 0,10 dolaru.
  • Interní nasazení: Agenti s modelem Argon v Googlu autonomně optimalizovali paměť datacenter s úsporou přes 300 TiB a migrují jádro Fuchsia Zircon do Rustu.
  • Postupný start: Široká veřejnost si počká. Model nejdříve prochází dobrovolným bezpečnostním auditem vlády USA a programem Fairwind pro prověřené obránce.

Milion tokenů na výstupu a radikální zlevnění cache

Zatímco dosavadní frontier modely měly velkorysá kontextová okna na vstupu, jejich výstup byl standardně omezen na 32 000 až 64 000 tokenů. Pokud jste potřebovali vygenerovat kompletní softwarový projekt, rozsáhlou právní rešerši nebo přepsat monolitickou aplikaci, museli jste úlohu složitě štěpit do desítek navazujících promptů. S tímto limitem se Gemini 4 Argon loučí: výstupní limit posouvá na rovný 1 milion tokenů. A to opravdu není málo.

Výrazný signál vysílá Google také v cenové politice. Zaváděcí ceník API počítá s cenou 2 USD za milion vstupních tokenů a 10 USD za milion výstupních tokenů. Klíčovým prvkem je však 95% sleva na cachované vstupy, která sráží cenu opakovaně čteného kontextu na pouhých 0,10 USD za milion tokenů. Při rozsáhlých softwarových repozitářích nebo právních archivech, které v paměti zůstávají napříč desítkami dotazů, tato funkce dramaticky snižuje celkový účet za provoz vývojářských agentů.

Graf: Ceník API pro model Gemini 4 Argon a úspora při prompt caching
Srovnání nákladů na tokeny v oficiálním API pro Gemini 4 Argon. Využití prompt cache snižuje cenu vstupu ze 2 USD na 10 centů za 1M tokenů. Zdroj dat: Google, graf: jarvis-ai.cz.

Co Argon dokázal uvnitř Googlu: Úspora paměti i přepis do Rustu

Google novinku tentokrát neprezentuje pouze suchými syntetickými benchmarky, ale konkrétními nasazeními ve vlastní infrastruktuře. Týmy inženýrů nasadily specializované agenty postavené na modelu Argon k analýze telemetrie serverových farem. Výsledkem byla autonomní optimalizace správy paměti, která v ostrém provozu datacenter uvolnila přes 300 TiB operační paměti, přičemž celkový potenciál úspor v plném nasazení Google odhaduje na 500 TiB až 1 PiB.

Neméně působivý je rozsah v oblasti modernizace softwaru. Agenti s modelem Argon pracují na velkých migracích z jazyků C a C++ do paměťově bezpečného Rustu. Záběr sahá od knihoven jako re2 či libgav1 až po mikrokernel Fuchsia Zircon s více než 800 000 řádky kódu. U videodekodéru libgav1 dokázali agenti na základě profilování a analýzy výstupu kompilátoru přepsat 32 000 řádků SIMD kódu do bezpečné vektorizované podoby v Rustu. Výsledný dekodér dosahuje 2,7násobného zrychlení oproti původnímu portu při zachování identického obrazového výstupu.

Výsledky v benchmarcích: Inženýrství, video a kybernetická bezpečnost

V nezávislých i oborových měřeních potvrzuje Gemini 4 Argon špičkovou formu. V komplexním testu DeepSWE v1.1, který hodnotí řešení reálných dlouhodobých programátorských úkolů na GitHubu, dosáhl model nového rekordu se skóre 77,9 %. V testu AutomationBench od Zapieru, zaměřeném na end-to-end automatizaci firemních procesů, obsadil první příčku se ziskem 51,3 %.

Graf: Výsledky Gemini 4 Argon v benchmarcích DeepSWE, LVBench, CWE-bench a AutomationBench
Výsledky modelu Gemini 4 Argon v oborových testech softwarového vývoje, kyberbezpečnosti a zpracování dlouhého videa. Všechny hodnoty představují úspěšnost v procentech. Zdroj dat: Google, graf: jarvis-ai.cz.

Výrazný posun zaznamenal model také při práci s multimédii. V benchmarku LVBench, který prověřuje porozumění dlouhému videozáznamu a vyhledávání jemných detailů napříč časovou osou, zaznamenal Argon hodnotu 91,7 %. V ekonomickém indexu Vals Index, jenž váží schopnosti modelů v právu, financích, daních a kódování podle jejich skutečného podílu na HDP, se Argon rovněž posunul do čela žebříčku.

Kybernetická obrana: Prověření experti dostanou verzi bez filtrů

Jednou z nejzajímavějších kapitol představení je zaměření na bezpečnostní analýzu. Model dosáhl děleného prvního místa v hodnocení CWE-bench v1 s úspěšností 68,0 % při autonomním hledání a opravování zranitelností ve zdrojových kódech. Do testování v reálném světě se zapojila například bezpečnostní společnost Wiz v rámci iniciativy Scan for Good, kde Argon dokázal odhalit dosud neznámou kritickou zranitelnost v nemocničním systému používaném zdravotnickými zařízeními po celém světě.

Zatímco běžní uživatelé se setkávají s přísnými mantinely odmítajícími cokoliv spojeného s exploity, prověřeným obráncům v programu Fairwind a interním bezpečnostním týmům Google model zpřístupní bez kybernetických filtrů. Cílem je umožnit etickým hackerům a správcům infrastruktury simulovat realistické útoky, objevovat napadnutelné vektory a generovat funkční opravy dříve, než slabiny zneužijí útočníci.

Dostupnost: Proč si na model musíme počkat

Navzdory oznámení není Gemini 4 Argon v tuto chvíli dostupný pro širokou veřejnost ani v rozhraní Google AI Studio. Společnost uplatňuje fázovaný model nasazení. Před uvolněním do placeného API a pro předplatitele tarifu Google AI Ultra prochází model dobrovolným předběžným hodnocením rizik v rámci procedur vlády Spojených států.

Google se soustředí na čtyři hlavní bezpečnostní oblasti: odolnost proti zneužití (včetně sledování vnitřních aktivací neuronové sítě), obranu proti nepřímým prompt injection útokům na benchmarku Gray Swan IPI, monitorování myšlenkového toku (chain-of-thought) kvůli odhalení případného nesouladu s instrukcemi a izolaci v pevných sandboxech. Teprve po uzavření této fáze se Argon otevře běžným komerčním vývojářům a podnikovým zákazníkům.

Kdy bude Gemini 4 Argon dostupný pro běžné uživatele a vývojáře?

Google zatím přesné datum plného spuštění neoznámil. V první fázi mají k modelu přístup vládní auditoři v USA a vybraní partneři v programu Fairwind. Širší dostupnost pro placené API a předplatitele tarifu Google AI Ultra má následovat po vyhodnocení zpětné vazby a bezpečnostních testů.

V čem spočívá hlavní výhoda výstupu o velikosti 1 milionu tokenů?

Většina dosavadních modelů končila na 32k až 64k tokenech výstupu, což nutilo uživatele velké úlohy dělit. Argon dokáže v jednom nepřerušeném běhu zanalyzovat a kompletně vygenerovat rozsáhlé softwarové moduly, komplexní právní rešerše nebo knihovny bez ztráty kontextu mezi dílčími kroky.

Kolik bude stát provoz modelu přes vývojářské API?

Oficiální zaváděcí ceny činí 2 dolary za milion vstupních tokenů a 10 dolarů za milion výstupních tokenů. Pokud však v aplikaci využijete prompt caching pro neměnná data (například zdrojové kódy či firemní dokumentaci), cena vstupu klesá díky 95% slevě na 0,10 dolaru za 1M tokenů.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.