Dva světy psaní textu: po slově, nebo naráz
Většina dnešních chatbotů patří do rodiny autoregresních (AR) modelů. Text generují po jednom tokenu — zhruba jako když píšete větu písmeno po písmenu a každé další písmeno smí záviset jen na těch předchozích. Je to pomalé, ale má to jednu výhodu: tok informací běží striktně jedním směrem, takže model „nevidí" do budoucnosti vlastní odpovědi.
Druhý tábor tvoří difuzní jazykové modely (DLM). Ty postupují opačně: začnou s kompletně zamaskovaným (prázdným) textem a v každém kole odmaskují část tokenů, na které si nejvíc věří. Funguje to jako když mlhavý obrázek postupně ostříte, až z něj vyleze čitelný text. Výhodou je rychlost — tokeny se dají odmaskovávat paralelně, ne jeden po druhém.
Problém? Difuzní modely k textu přistupují „obousměrně", a proto jim v řetězcích úvah chybí jasná posloupnost kroků. Zatímco AR modely vládnou matematice a logice, difuzní modely se na složitějším uvažování historicky trápily. Práce CaLR: Causal Latent Revision for Robust Diffusion Reasoning publikovaná 17. září 2026 na arXivu se snaží přesně tuhle mezeru zacelit.
Teleologický klam: když model vysvětlí příčinu výsledkem
Autoři pojmenovali konkrétní neduh difuzních modelů. Když model díky obousměrné pozornosti „vidí" i budoucí tokeny, snadno sklouzne k tomu, čemu říkají teleologický klam: generuje příčinu na základě následku, který ještě neměl být známý.
Představte si studenta u zkoušky, který si nejdřív někde přečte správný výsledek, pak k němu zpětně domyslí postup — a protože postup neodvodil poctivě, ve složitějším příkladu se zamotá. Podobně difuzní model při odvozování kroku „délky odvěsen" nahlíží do kroku „výsledná plocha", ačkoli plocha by měla z odvěsen teprve vycházet. Logika se tak obrací naruby.
CaLR: model dostane „jízdní řád" závislostí
Navržený rámec CaLR (Causal Latent Revision) řeší problém dvěma kroky. Nejdřív nechá silnější „učitelský" model rozebrat úlohu na jednotlivé kroky a určit, který krok na který smí navazovat. Vznikne kauzální topologická matice (CTM) — takový jízdní řád závislostí, který přesně říká: od kroku A smíš přejít ke kroku B, ale opačný směr je zakázaná zóna.
Druhý krok probíhá přímo v latentním prostoru modelu. Místo aby model přepisoval celou větu, vypočte si „opravný vektor" — malou změnu vnitřní reprezentace, která myšlenku vyladí směrem k logické konzistenci, aniž by porušila kauzální omezení. Matematicky se to opírá o implicitní derivaci a řešič s konjugovanými gradienty, což umožňuje spočítat gradient bez invertování obří Hessovy matice.
Autoři k tomu přidávají i teoretický důkaz: s pomocí kauzální masky dokáže model simulovat logické obvody o hloubce d v konstantním počtu dekódovacích kol s pamětí úměrnou šířce obvodu. Jinými slovy — hluboké uvažování nemusí nutně znamenat dlouhé sekvenční generování.
Čísla: kde CaLR poráží autoregresní modely
CaLR je natrénovaný na modelu LLaDA-8B pomocí LoRA (efektivní doladění s rankem 128). V tabulce výsledků autoři uvádějí tato čísla (jedná se o vlastní měření autorů práce, nikoli nezávislý audit):
| Benchmark | CaLR-8B | LLaDA-8B | Llama-3.1-8B | Qwen2.5-7B |
|---|---|---|---|---|
| GSM8K (matematika) | 88,2 % | 70,3 % | 83,5 % | 85,4 % |
| ARC-C (selský rozum) | 76,7 % | 56,2 % | 61,4 % | 63,7 % |
| MMLU (znalosti) | 73,5 % | 58,7 % | 73,0 % | 74,2 % |
| HumanEval (kód) | 61,8 % | 35,4 % | 60,6 % | 57,9 % |
Nejvýraznější skok je v matematice: na GSM8K CaLR-8B s 88,2 % překonává nejen mateřský LLaDA-8B (70,3 %), ale i silné autoregresní modely Llama-3.1-8B (83,5 %) a Qwen2.5-7B (85,4 %). Poctivě je třeba dodat, že na MMLU ho Qwen2.5-7B o necelý procentní bod předběhne — CaLR nevyhrává všude.
Nejpřesvědčivější důkaz přichází z Sudoku 4×4, kde je řešení plně dané logickými pravidly. Zde autoregresní modely kolabují — Llama-3.1-8B dosáhla jen 8,6 %, protože obousměrné závislosti řádků, sloupců a bloků prostě neumí zpracovat. CaLR-8B se s pouhými 200 tréninkovými příklady dostal na 87,9 % (mateřský LLaDA-8B na 77,1 %), a s 5 000 příklady vystoupal na 92,97 %.
Rychlost zůstává: paralelní generování bez ztráty kvality
Klíčovou výhodou difuzních modelů je paralelní dekódování. Problém je, že běžné DLM při agresivnějším paralelismu (více tokenů v jednom kroku) rychle ztrácejí přesnost. CaLR podle autorů tuhle degradaci zpomaluje — a čím agresivnější paralelismus, tím větší náskok.
Na benchmarku HumanEval narostl rozdíl oproti LLaDA z +21,8 % (konzervativní nastavení) na +33,6 % (zhruba 8 tokenů na krok), na MBPP pak z +10,2 % na +23,7 %. Kauzální maska tu podle autorů funguje jako „logická kotva", která filtruje chyby vznikající při rychlém paralelním vzorkování.
Co to znamená — a kde jsou limity
Druhý zdroj, japonský portál Fugu-MT, který práci shrnuje, potvrzuje stejné závěry. Je ale fér zdůraznit, co CaLR není: nejde o produkt ani o veřejně dostupný model. Je to výzkumný článek, k němuž zatím nejsou zveřejněné váhy ani kód, a čísla pocházejí od samotných autorů. Pro české čtenáře to znamená jediné — nic si dnes nestáhnete ani nevyzkoušíte.
Význam je jinde. CaLR ukazuje, že rozdíl mezi „rychlým, ale hloupým" difuzním přístupem a „pomalým, ale chytrým" autoregresním přístupem není nevyhnutelný. Pokud se kauzální struktura dá do difuzního modelu vstříknout levně (zde jen LoRA doladěním), otevírá se cesta k textové generaci, která bude rychlá a zároveň schopná vícestupňového uvažování. To je pro směr, který v posledních dvou letech sledují i velké laboratoře v USA a Číně, podstatný signál.
Co je vlastně difuzní jazykový model a čím se liší od ChatGPT?
ChatGPT a většina chatbotů generuje text autoregresně — token po tokenu, kdy každý další závisí jen na předchozích. Difuzní model naopak začíná s „prázdným" textem a postupně ho odmaskovává, podobně jako se zaostřuje mlhavý obrázek. Díky tomu může generovat více tokenů najednou, a být tak rychlejší.
Je CaLR dostupný jako model nebo aplikace?
Ne. Jde o výzkumnou práci publikovanou na arXivu, k níž autoři zatím nezveřejnili váhy ani kód. Čísla v článku jsou výsledky samotných autorů na standardních benchmarcích a neprošla nezávislým auditem.
Nahradí tohle dnešní velké jazykové modely?
Zatím ne. CaLR dokazuje, že difuzní přístup zvládne logické uvažování na úrovni osmimiliardového modelu, ale je to jeden výzkumný článek, ne hotová technologie. Směr je ale zajímavý hlavně kvůli kombinaci rychlosti a schopnosti uvažovat.