Hlasová AI se učí nejen odpovídat, ale také přemýšlet
Hlasové modely bývají velmi dobré v přirozeném rozhovoru, rychlé reakci nebo napodobení lidské intonace. Jakmile ale dostanou složitější matematický příklad, jejich přesnost obvykle zaostává za textovými modely. Důvod je praktický: hlasový systém musí průběžně generovat zvuk, aby konverzace nepůsobila jako dlouhé mlčení. Na skryté výpočty mu proto zbývá méně prostoru.
Výzkumníci z pařížské laboratoře Kyutai nyní ukázali, že tento problém lze částečně řešit učením s posilováním. Jejich práce Voice of Reason: Reinforcement Learning for Spoken Math byla zveřejněna v září 2026 a navazuje na předchozí výzkum hlasových modelů schopných pracovat přímo se zvukem.
Označení speech-native znamená, že model zpracovává řeč přímo. Nemusí nejdříve vytvořit textový přepis, předat ho samostatnému jazykovému modelu a nakonec výsledek znovu převést na hlas. Takové řešení může snížit počet mezikroků a zachovat některé vlastnosti řeči, například tempo, intonaci nebo další zvukové signály.
Dva modely, dva způsoby řešení úlohy
Voice of Reason vychází z modelu GLM-4-Voice-9B. Kyutai zveřejnilo dvě varianty. První odpovídá přímo a celý postup řešení vysvětluje nahlas. Druhá varianta nazvaná Stitch vkládá mezi mluvené části krátké bloky tichého uvažování.
Uživatel tedy neslyší každý mezikrok výpočtu jako samostatnou část interního procesu, ale model si mezi hlasovými bloky ponechává prostor pro další výpočet. Podle autorů jsou pozdější části tohoto uvažování generovány v době, kdy už se přehrává předchozí řeč. Samotné přemýšlení tak podle jejich měření nemusí znamenat delší čekání na odpověď.
To je důležitý rozdíl oproti běžnému chatbotu, který pouze okamžitě předpovídá další část odpovědi. U složitějších úkolů zde model dostává možnost postupovat v několika krocích a výsledek průběžně zlepšovat. Nejde však o záruku správnosti. Hlasový výstup může znít přesvědčivě i tehdy, když je výpočet chybný.
Výsledky jsou lepší než u předchozího hlasového modelu
V benchmarku GSM8K, který obsahuje slovní matematické úlohy, dosáhl základní GLM-4-Voice přesnosti 27,3 procenta. Po supervised fine-tuningu, tedy řízeném dodatečném tréninku na specializovaných datech, se výsledek zvýšil na 61,7 procenta.
Následné učení s posilováním posunulo přímou variantu Voice of Reason na průměrných 65,5 procenta při testování se třemi běhy. U zveřejněného checkpointu bez omezení top-k dekódování dosáhl výsledek 70,3 procenta. Varianta Stitch měla průměr 74,8 procenta a zveřejněný checkpoint dosáhl 77,1 procenta.
Výsledek je lepší než u dřívější metody STITCH, která se ve stejném přehledu dostala na 58,7 procenta. Přímé srovnání s většími systémy ale vyžaduje opatrnost. Qwen2.5-Omni s textovým výstupem dosáhl 84,7 procenta, Qwen3-Omni 94,6 procenta a kaskádové řešení s převodem řeči na text, jazykovým modelem a převodem textu na řeč 95,7 procenta.
Tyto systémy ale nemají stejnou velikost ani stejnou architekturu. Autoři studie proto výsledky nepředkládají jako důkaz, že Voice of Reason je přesnější než současné špičkové textové nebo multimodální modely. Přínos je jinde: jde o výrazné zlepšení v kategorii modelů, které řeší matematiku přímo v řečovém režimu.
Co se model učil a proč záleží na učení s posilováním
První fáze tréninku využila 150 616 matematických problémů z datasetu Orca-Math. Úlohy byly upraveny pro hlasové použití a následně namluveny různými hlasy. Tato fáze pomohla modelu naučit se, jak matematické otázky v mluvené podobě vypadají a jak na ně odpovídat.
Ve druhé fázi model dostával za jednu otázku několik možných odpovědí. Hodnotící model potom posuzoval, zda je řešení správné, a výsledek sloužil jako odměna pro další trénink. Hodnotitel se přitom nedíval na referenční odpověď, ale posuzoval dekódovaný text. Na stovce ručně zkontrolovaných případů se shodl s lidmi v 88 procentech případů.
Trénink probíhal na 16 grafických kartách NVIDIA H100 a zahrnoval 1 500 aktualizačních kroků. Zajímavé je, že výzkumníci museli upravit i samotný způsob výpočtu ztráty. Po odstranění korekce teploty klesla přesnost z 65,5 na 12,3 procenta. U hlasových modelů tedy nestačí jen přidat více dat nebo delší výpočet. Záleží také na tom, jak se při tréninku zachází s textovými a zvukovými tokeny.
Model si polepšil v matematice, ale ztratil část obecných znalostí
Specializace má svou cenu. V testu TriviaQA, který ověřuje obecné znalosti, klesla úspěšnost přímé varianty z 40,6 na 34,0 procenta. U varianty Stitch dosáhla 21,4 procenta.
Autoři připisují většinu tohoto poklesu především fázi supervised fine-tuningu na matematických datech, nikoli samotnému učení s posilováním. Jde o známý kompromis: když model výrazně přizpůsobíte jednomu typu úloh, nemusí si zachovat původní univerzálnost.
Výsledky navíc nejsou zcela bez výhrad. Při kontrole 678 testovacích otázek se u 54 procent objevila překryvnost s parafrázovanými úlohami z Orca-Math. To neznamená, že je benchmark bezcenný, ale je to důvod číst čísla opatrně. Vyšší skóre může být částečně ovlivněno podobností trénovacích a testovacích příkladů.
Provoz je možný, domácí počítač ale stačit nebude
Oba checkpointy jsou dostupné jako open-weight modely na Hugging Face. Kyutai uvádí, že pro provoz jednoho modelu je potřeba jedna grafická karta NVIDIA H100. Kromě samotných vah je nutné použít také repozitář GLM-4-Voice, který poskytuje potřebný zvukový tokenizer a dekodér.
To je zásadní omezení pro běžného zájemce. H100 není součástí standardního notebooku ani běžného domácího počítače. Model je proto v současné podobě zajímavější pro výzkumníky, vývojáře a firmy s vlastní GPU infrastrukturou než pro rodinu, školu nebo malého podnikatele.
Veřejné API ani hotový hosted inference provider podle zveřejněných informací k 23. září 2026 k dispozici není. Cena za používání tedy není stanovena. Kdo chce model provozovat, musí počítat s náklady na vlastní hardware nebo pronájem výpočetní kapacity. Konkrétní částku nelze férově uvést bez znalosti poskytovatele, délky provozu a vytížení.
Pro české uživatele je důležité také to, že Kyutai u tohoto vydání neuvádí českou lokalizaci ani veřejnou službu dostupnou v češtině. Zveřejněné výsledky se týkají mluvených matematických úloh, nikoli českého jazyka. Model proto nelze automaticky považovat za nástroj připravený pro české domácnosti nebo školy.
Proč je Voice of Reason přesto zajímavý
Největší význam projektu nespočívá v tom, že by porazil všechny textové modely v matematice. To se podle uvedených výsledků nestalo. Důležité je, že ukazuje použitelný směr pro hlasové systémy, které mají nejen rychle reagovat, ale také řešit složitější úkoly.
V budoucnu může být podobný přístup relevantní například pro hlasové doučování, asistivní technologie nebo ovládání zařízení bez obrazovky. Zatím je však Voice of Reason především výzkumný výsledek a otevřený základ pro další práci. Pro běžného uživatele není připraven jako jednoduchá aplikace ke stažení.
Kyutai tím zároveň potvrzuje svou dlouhodobou orientaci na otevřený výzkum hlasových a multimodálních systémů. Zájemcům dává k dispozici nejen modelové váhy, ale také vědecký popis tréninku. To je užitečné hlavně proto, že umožňuje ověřovat, kde přesně se zlepšení vzalo a jaké kompromisy s sebou přineslo.
FAQ
Lze Voice of Reason vyzkoušet online bez vlastní grafické karty?
Podle dostupných informací k 23. září 2026 není pro model k dispozici veřejné API ani hostovaný inference provider na Hugging Face. Pro vlastní provoz je potřeba výkonná GPU infrastruktura, přičemž Kyutai uvádí jednu NVIDIA H100 pro checkpoint.
Rozumí Voice of Reason češtině?
Zveřejněná studie českou lokalizaci ani výsledky pro české mluvené úlohy neuvádí. Nelze proto tvrdit, že je model připravený pro spolehlivé používání v češtině.
Je 77,1 procenta nejlepší výsledek mezi AI modely pro matematiku?
Ne. Jde o výsledek nejlepší zveřejněné varianty Voice of Reason v testu mluvené matematiky. Ve stejném přehledu dosáhly větší systémy Qwen2.5-Omni, Qwen3-Omni a kaskádové řešení vyššího skóre, ale nejde o dokonale srovnatelné modely.
Zdroje: výzkumná práce Voice of Reason, shrnutí projektu na MarkTechPost, oficiální web Kyutai.