Přejít k hlavnímu obsahu

Google DeepMind představil Gemini Robotics 2: Tři AI mozky pro humanoidní roboty

Ilustrační obrázek pro jarvis-ai.cz
Google DeepMind představil Gemini Robotics 2 — kompletní rodinu tří modelů umělé inteligence, které mají společný cíl: dát humanoidním robotům skutečný "mozek". Nejde přitom o jeden model, ale o promyšlený ekosystém, kde jeden model plánuje, druhý řídí motoriku a třetí běží přímo v robotovi bez připojení k internetu. Novinka přichází jen rok a půl po první generaci a ukazuje, že Google to s fyzickou AI myslí vážně.

Tři modely, tři úkoly: Jak Gemini Robotics 2 funguje

Google tentokrát nesází na jeden univerzální model, ale rozdělil inteligenci robota do tří specializovaných vrstev:

Gemini Robotics 2 (VLA) je vision-language-action model, který převádí obraz a textové instrukce přímo na motorické povely. Umí ovládat celé humanoidní tělo — od chodidel po konečky prstů. V testech na robotu Apptronik Apollo 2 zvládl chůzi, ohýbání, dřepy i balancování. S pětiprstou rukou SharpaWave (22 stupňů volnosti) dokáže zašroubovat žárovku (92% úspěšnost) nebo zavázat pytel na odpadky (44 %). S klasickým dvouprstým chapadlem na platformě Franka Duo dosahuje téměř 90% přesnosti u přesných vkládacích úkolů.

Gemini Robotics ER 2 je "vysoký mozek" robota — model založený na architektuře Gemini 3.5 Flash, který zpracovává instrukce, plánuje vícekrokové úkoly a koordinuje spolupráci více robotů. Pracuje se 128tisícovým kontextovým oknem a podporuje text, obraz, video i audio. Dokáže sledovat videozáznam v reálném čase, rozpoznat v jaké fázi se úkol nachází, a s přesností na 0,96 sekundy určit klíčový okamžik — například kdy přestat nalévat kávu. ER 2 je ze všech tří modelů nejdostupnější: je ve veřejném preview přes Google AI Studio a Gemini API, zdarma.

Gemini Robotics On-Device 2 je odlehčená verze VLA modelu optimalizovaná pro běh přímo na hardwaru robota. Nepotřebuje internetové připojení a dokáže se adaptovat na zcela novou robotickou platformu během několika hodin — typicky s méně než 200 ukázkovými příklady.

Bezpečnost na prvním místě: ASIMOV-Agentic

Google DeepMind s druhou generací výrazně posílil bezpečnostní mechanismy. Nový benchmark ASIMOV-Agentic měří schopnost modelu odmítnout nebezpečný příkaz, detekovat člověka v blízkosti a včas zastavit robota. ER 2 dosáhl 97,9% úspěšnosti v dodržování bezpečnostních instrukcí (oproti 47,2 % u předchozí verze ER 1.6) a detekuje člověka do vzdálenosti jednoho metru s 93% přesností — to je skok z původních 51,1 %.

To je zásadní posun, protože Evropská unie prostřednictvím AI Actu klasifikuje robotické systémy s AI jako vysoce rizikové. Výrobci robotů, kteří chtějí působit na evropském trhu, budou muset prokazovat právě takové bezpečnostní standardy. Google má v tomto ohledu náskok — ER 2 je podle DeepMindu "nejbezpečnější robotický model, jaký kdy byl vyvinut".

Srovnání s konkurencí: ER 2 v číslech

Google k modelu zveřejnil podrobné benchmarky, ve kterých ER 2 porovnává nejen s předchozí verzí ER 1.6, ale i s konkurenčními modely Anthropic Claude Opus 5 a OpenAI GPT-5.6 Sol:

Benchmark ER 2 ER 1.6 Claude Opus 5 GPT-5.6 Sol
Detekce úspěchu (obraz) 87,7 % 82,9 % 83,6 % 83,1 %
Detekce úspěchu (video) 82,4 % 76,0 % 81,0 % 74,7 %
Embodied QA (ERQA) 78,5 % 72,5 % 67,2 % 43,2 %
Klasifikace průběhu úkolu 57,4 % 42,7 % 37,1 % 46,2 %
Dodržování bezp. instrukcí 97,9 % 47,2 % 95,9 % 91,4 %
Detekce člověka (1 m) 93,0 % 51,1 % 77,1 % 83,4 %

ER 2 vítězí ve všech šesti klíčových metrikách. Nejmarkantnější rozdíl je v embodied reasoning (ERQA), kde GPT-5.6 Sol dosáhl jen 43,2 % — méně než polovinu toho, co zvládne specializovaný robotický model od Googlu. To potvrzuje trend, že obecné jazykové modely v robotice na specializované systémy zatím nestačí.

Fyzické nasazení: Apptronik, Boston Dynamics a 100+ testerů

Google nesází jen na laboratorní výsledky. Gemini Robotics 2 už testuje přes 100 firem — od velkých automatizačních podniků po robotické startupy. Mezi oficiálními partnery jsou Apptronik (humanoid Apollo 2), Boston Dynamics (čtyřnohý Spot) a Agile Robots. V demo ukázce ER 2 ovládal robota Spot, který na hlasový povel došel pro svačinu — příklad, jak může vypadat blízká budoucnost logistiky a skladové automatizace.

VLA model aktuálně funguje ve třech různých konfiguracích hardwaru: Apptronik Apollo 2 s pětiprstými chapadly, Apollo 2 s klasickými chapadly Inspire a dvouramenná platforma Franka Duo. Jeden a tentýž model přitom zvládne ovládat všechny tři — to je u robotických AI systémů neobvyklé a ukazuje to na vysokou míru generalizace.

Co to znamená pro Česko a Evropu

Evropská robotika má silnou základnu — od německého KUKA přes dánský Universal Robots až po české výrobce, jako je Brano Group či Compass. Gemini Robotics ER 2 je přitom dostupný ve veřejném preview přes Google AI Studio, což znamená, že čeští vývojáři a firmy mohou model testovat už teď a zdarma. API podporuje standardní REST rozhraní a Google k němu vydal i open-source ukázky na GitHubu, včetně Jupyter notebooku pro první kroky.

Pro firmy, které chtějí integrovat AI do robotických systémů prodávaných v EU, je klíčové, že ER 2 už nyní plní přísné bezpečnostní standardy — což výrazně usnadní certifikaci podle AI Actu. Na druhou stranu, plnohodnotný VLA model (Gemini Robotics 2) zůstává v uzavřeném preview a jeho dostupnost pro evropské partnery zatím není potvrzena. Zde může sehrát roli geopolitika — podobně jako v případě omezení exportu pokročilých AI čipů do některých regionů.

Kdy to bude fungovat v praxi?

Přes všechna působivá čísla je důležité být střízlivý. Úspěšnost VLA modelu u komplexních úkolů s pětiprstou rukou se pohybuje mezi 32 a 92 procenty — u zavazování sáčku na zip je to jen 40 %. To znamená, že od nasazení v reálném provozu, kde se vyžaduje konzistentní 99% spolehlivost, nás dělí ještě roky vývoje. Gemini Robotics 2 je důležitý milník, ale ne hotový produkt pro tovární haly.

ER 2 je naproti tomu připraven k použití hned — a to i pro vývojáře bez robotického hardwaru. Stačí účet u Google AI Studio, pár řádků kódu a můžete začít experimentovat s plánováním robotických úkolů ve virtuálním prostředí.

FAQ

Je Gemini Robotics 2 dostupný i pro jednotlivce nebo jen pro firmy?

Model ER 2 je ve veřejném preview a může ho vyzkoušet kdokoliv přes Google AI Studio nebo Gemini API — stačí mít Google účet. VLA model (Gemini Robotics 2) je zatím pouze v soukromém preview pro vybrané partnery a pro přístup je třeba se přihlásit na waitlist. On-Device 2 je v režimu důvěryhodných testerů.

Podporuje Gemini Robotics 2 češtinu?

ER 2 je postaven na Gemini 3.5 Flash, který češtinu podporuje na velmi dobré úrovni. To znamená, že by měl rozumět českým hlasovým pokynům i textovým instrukcím. U VLA modelu záleží na konkrétní implementaci, ale vzhledem k tomu, že jazyková složka je odvozena od modelů Gemini, lze očekávat minimálně základní porozumění češtině.

Jaký je rozdíl mezi Gemini Robotics 2 a Gemini Robotics 1.5?

Gemini Robotics 1.5 (září 2025) byl jeden model zaměřený primárně na motorické ovládání. Gemini Robotics 2 je rodina tří specializovaných modelů (VLA, ER 2, On-Device 2), které pokrývají celý řetězec od plánování přes motoriku po lokální běh. Největší skok je v bezpečnosti — dodržování bezpečnostních instrukcí se zlepšilo z 47,2 % na 97,9 %, detekce člověka z 51,1 % na 93,0 %.

X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.