AI, který nemusí ztichnout, když začne pracovat
Běžný hlasový asistent funguje trochu jako vysílačka. Jeden mluví, druhý čeká. Pokud člověku skočíte do řeči, systém často neví, jestli má pokračovat, zastavit odpověď, nebo celou konverzaci zahodit a začít znovu.
Gander se snaží tento model změnit. Podle technické zprávy týmu Hunyuan Speech od Tencentu dokáže vést plně duplexní dialog. To znamená, že současně poslouchá, mluví, sleduje obrazové vstupy a může na pozadí spustit další činnost. Uživatel tak může říct například „prohledej tyto soubory“, během práce se zeptat na průběh a následně zadání doplnit bez nutnosti čekat na konečný výsledek.
Výzkumníci Gander oficiálně představili 9. září 2026. Projekt je dostupný jako open source a jeho kód, modely i související data jsou zveřejňovány pod licencí Apache 2.0. Technická zpráva na arXivu popisuje systém jako multimodálního agenta pro hlasovou spolupráci, průběžné vnímání obrazu a dlouhé úkoly vykonávané asynchronně.
Dva modely místo jednoho kompromisu
Nejzajímavější částí Ganderu není samotné rozpoznávání řeči. Tencent rozdělil systém na dvě hlavní části, kterým říká mozeček a mozek. Přirovnání zní lehce anatomicky, ale technicky dává smysl.
Mozeček hlídá konverzaci
Takzvaný Cerebellum, tedy mozeček, se stará o rychlé reakce. Rozhoduje, zda má systém poslouchat, začít mluvit, odpověď přerušit, nebo vydat pokyn pro spuštění úkolu. Gander rozděluje průběh interakce do jednosekundových operačních rámců. V každém z nich vyhodnocuje, co se právě děje a jaký má být další krok.
Pro audio vstup používá vzorkovací frekvenci 16 kHz, zatímco výstupní řeč vzniká ve frekvenci 24 kHz. Model Thinker může pro jednu mluvící jednotku využít až 8 lexikálních tokenů a modul Talker až 50 S3 tokenů. Zjednodušeně řečeno: jeden modul rozhoduje, co a kdy říct, druhý to převádí do plynulé řeči.
Výhodou oddělení je, že generování hlasu nemusí zablokovat vnímání dalšího vstupu. Pokud uživatel začne mluvit uprostřed odpovědi, systém může řeč zastavit a předat mu slovo. U klasického sekvenčního hlasového asistenta by podobná situace často znamenala několik sekund čekání nebo nutnost zopakovat příkaz.
Mozeček pracuje, zatímco mozek plánuje
Druhá část, označovaná jako Brain, řeší náročnější úkoly. Může jít o psaní kódu, prohledávání souborů nebo práci s externími nástroji. Tato část nemusí být pevně spojená s konverzačním modelem. Architektura je navržena tak, aby šel „mozek“ vyměnit za jiného agentního vykonavatele bez nutnosti přeškolit celý systém.
To je důležitý detail. Gander není jen jeden velký model, který se snaží současně mluvit, plánovat, volat nástroje a kontrolovat správnost výsledku. Spíše připomíná tým dvou pracovníků: jeden udržuje kontakt se zákazníkem, druhý mezitím hledá dokumenty a opravuje kód v kanceláři vedle. Když se situace změní, první pracovník předá novou instrukci druhému.
V aktuální podobě je systém založený na modelu MiniCPM-o-4_5. Oficiální repozitář na GitHubu uvádí, že součástí řešení je streamingový Thinker, oddělený Talker, runtime pro řízení úkolů a pluggable Brain pro dlouhé operace.
V přerušování je Gander přesvědčivý, v přesnosti už méně
Nejkonkrétnější výsledek Ganderu se týká načasování dialogu. V benchmarku Full-Duplex-Bench v3 začal systém mluvit ve správný okamžik ve všech 100 testovaných scénářích. K nevhodnému přerušení uživatele došlo v 8 % případů.
To je lepší výsledek než u některých konkurenčních hlasových systémů uvedených ve srovnání. GPT-Realtime měl v daném testu podíl nevhodných přerušení 13,5 %, nejslabší konkurent se blížil 48 %. Výsledek ale neznamená, že je Gander celkově nejlepší hlasový asistent. Měří konkrétní vlastnost: zda dokáže správně odhadnout, kdy mluvit a kdy zůstat zticha.
Jakmile se začne hodnotit plnění celého úkolu, obrázek je méně působivý. Gander v kompletním hlasovém systému zaostává v přesnosti za konkurenčními modely. Do výsledku se totiž započítává nejen práce „mozku“, ale také rozpoznání řeči, práce s obrazem, načasování a převod odpovědi do hlasu. Jedna špatně rozpoznaná věta může pokazit jinak správně naplánovaný úkol.
Technická zpráva zároveň ukazuje, že samotný Brain si při přímém textovém zadání vede výrazně lépe než celý hlasový řetězec. Omezení tedy neleží pouze v logice agenta. Část problémů vzniká na hranici mezi řečí, obrazem a vykonáváním příkazů.
Slabší stránkou zůstává také multimodální porozumění. Gander v některých testech obrazu a zvuku zaostal za svým základním modelem, například při počítání objektů nebo určování jejich polohy. Systém byl trénován hlavně na plynulou spolupráci, takže přirozený dialog dostal přednost před přesnou analýzou každého detailu ve scéně.
Trénink na 2,7 milionu příkladů a vysoké hardwarové nároky
Gander byl trénován na přibližně 2,7 milionu příkladů. Data zahrnovala hlasovou interakci, audiovizuální úlohy, agentní scénáře i negativní příklady. Model se tedy učil nejen odpovídat, ale také mlčet v situaci, kdy na něj nikdo nemluví, ignorovat rušivé zvuky nebo pracovat v prostředí s více lidmi.
Oficiální repozitář uvádí konkrétnější rozdělení: 1,01 milionu příkladů pro hlasovou interakci, 1,10 milionu pro audiovizuální úlohy, 359,6 tisíce pro agentní scénáře a 229,7 tisíce pro odolnost vůči rušení. Nejde tedy o jednoduchý hlasový chatbot natrénovaný na několika ukázkách dialogu.
Za open-source dostupností se však skrývá poměrně náročné spuštění. Uvedený release profil počítá se třemi fyzickými GPU: jedním pro Thinker, jedním pro Talker a jedním pro automatický přepis řeči. Repozitář dále uvádí Linux, prostředí Conda a kompatibilní ovladač NVIDIA pro CUDA 12.4.
Pro českého uživatele je podstatné, že Gander není běžná webová služba, do které se člověk přihlásí a okamžitě začne mluvit. Jde o výzkumný open-source projekt určený především pro vývojáře a výzkumné týmy. Cena za stažení modelu je nulová, provoz ale vyžaduje odpovídající hardware a technické nastavení. Výslovná podpora češtiny v dostupné dokumentaci uvedena není, takže projekt nelze označit za hotového českého hlasového asistenta.
Gander ukazuje, kam se agentní systémy posouvají
Hlavní myšlenka Ganderu je praktická: konverzace a práce nemusí probíhat odděleně. Uživatel nemusí čekat, až AI dokončí dlouhé hledání nebo úpravu kódu, aby mohl doplnit další požadavek. Agent může průběžně hlásit stav, položit doplňující otázku nebo si vyžádat oprávnění.
Současně ale platí, že přirozenější dialog automaticky neznamená přesnější výsledek. Gander zatím ukazuje zajímavý kompromis. V načasování hlasové interakce je silný, zatímco při komplexním plnění úkolů a multimodálním porozumění má rezervy.
Právě oddělení rychlé konverzační vrstvy od výkonného agenta může být důležitější než samotné jméno modelu. Jakmile se zlepší jednotlivé části, není nutné pokaždé přepracovat celý systém. To je z pohledu vývoje praktičtější než stavět jednoho obřího asistenta, který má zároveň poslouchat, mluvit, plánovat, vidět a nikdy se nesplést. Takový kolega zatím neexistuje ani v kanceláři, natož v počítači.
Gander je proto zatím především výzkumnou ukázkou směru, kterým se hlasoví agenti ubírají. Je zdarma, otevřený a technicky zajímavý, ale pro běžné nasazení v české domácnosti nebo firmě má stále výrazné překážky v hardwaru, lokalizaci i přesnosti.
FAQ
Je Gander dostupný pro běžné uživatele v Česku?
Gander je dostupný jako open-source projekt, nikoli jako hotová česká webová služba. Ke spuštění je podle oficiálního repozitáře potřeba Linux, kompatibilní prostředí a release profil počítající se třemi fyzickými GPU. Výslovná podpora češtiny v dokumentaci uvedena není.
Kolik Gander stojí?
Software, kód a modely jsou zveřejněny zdarma jako open-source projekt pod licencí Apache 2.0. Samotný provoz ale vyžaduje výkonný hardware a případné náklady na navázané agentní nástroje nebo infrastrukturu.
Umí Gander pracovat s obrazem i zvukem současně?
Ano. Systém je navržen pro současné zpracování řeči, obrazu a textu. Uživatel může například mluvit, sdílet obrazovku, zadat úkol a během jeho řešení doplňovat další požadavky. Testy ale ukázaly, že přesnost audiovizuálního porozumění zatím není bez omezení.
Zdroje: The Decoder, technická zpráva na arXivu a oficiální repozitář Ganderu na GitHubu.