Proč dospělácké modely selhávají na novorozencích
Když dáte současnému špičkovému modelu rentgen plic dospělého člověka, odvede slušnou práci. Ale přepnout ho na novorozence znamená narazit na dvě zásadní překážky. Zaprvé takzvaný „doménový posun" — modely jako Qwen, LLaVA nebo InternVL se učily téměř výhradně na datech dospělých pacientů. Plíce novorozence přitom vypadají jinak: jsou nezralé, nálezy menší a hůř kontrastní.
Zadruhé, a to je možná důležitější, nemoci novorozenců se na rentgenu navzájem nápadně podobají. Neonatální pneumonie, syndrom dechové tísně (NRDS) i přechodná tachypnoe novorozence (TTN) mohou na snímku vypadat prakticky stejně. Zkušený neonatolog se proto nekouká jen na snímek — kombinuje ho s porodními údaji: jestli byl porod císařským řezem, zda matka měla předčasný odtok plodové vody, kolik dítě vážilo nebo jak dopadlo Apgar skóre.
A přesně tady je jádro článku, který vyšel 3. září 2026 na serveru arXiv. Autoři tvrdí, že existující modely se soustředí hlavně na propojení obrazu a textu, ale žádný z nich neumí správně zkombinovat rentgen s klinickým kontextem tak, jak to dělá skutečný lékař.
NeoRed a jeho „návod od neonatologa"
NeoRed bere na vstupu dvě věci: rentgen hrudníku a 21 klinických faktorů rozdělených do tří skupin. Vývojové faktory (gestační věk, porodní váha), perinatální rizika (způsob porodu, preeklampsie) a fyziologický stav (Apgar, tělesná teplota, krevní plyny). Výstupem je strukturovaná zpráva s nálezem na snímku a samotnou diagnózou.
Zajímavý je ale hlavně tréninkový rámec, který autoři pojmenovali Knowledge–Logic–Alignment (KLA). Dá se přeložit jako „znalost–logika–zarovnání" a skládá se ze tří částí. Knowledge Prior Injection (KPI) vpraví do modelu předem danou znalost, která nemoc souvisí s kterým typem informace — pneumonie se pozná spíš z porodních rizik, NRDS spíš z vývojových faktorů. Diagnostic Logic Constraint (DLC) pak hlídá, aby vygenerovaný text byl konzistentní s logikou diagnózy, a Visual Semantic Alignment (VSA) zajišťuje, že popis na snímku skutečně odpovídá tomu, co model na rentgenu vidí.
Přirovnání pro názornost: běžný model je jako stážista, který se podívá jen na rentgen. NeoRed je spíš student, kterému někdo do ruky vložil manuál „u téhle nemoci si všímej hlavně tohohle" a navíc ho kontroluje, jestli jeho závěr dává logicky smysl.
Čísla: lepší než konkurence, ale na kliniku to nestačí
Autoři model otestovali proti osmi mainstreamovým multimodálním modelům na dvou vlastních datasetech. NeoCXR obsahuje 6 278 vzorků od 2 466 pacientů z jedné nemocnice, NeoCXR-EV pak 1 089 vzorků od 590 pacientů z druhé nemocnice, která slouží jako externí validace — tedy test, jestli model funguje i na datech, která nikdy neviděl.
Na hlavním datasetu dosáhl NeoRed skóre ROUGE-L 53,29 % a F1 pro klinickou efektivitu 65,19 %. Pro srovnání: nejlepší obecný model Qwen3-VL-8B dosáhl F1 jen 24,25 %, nejsilnější medicínský model HuatuoGPT-V-7B dokonce jen 9,73 %. Na externí validaci spadla přesnost NeoRedu na F1 39,28 % — což je mimochodem upřímný signál, jak těžké je přenést model na jiné pracoviště.
Důležitý detail: autoři korektně ukázali i to, co udělá s konkurencí prosté doladění na datech novorozenců. Když vzali Qwen3-VL a LLaVA-Rad a natrénovali je na NeoCXR, skokově se zlepšily — průměrně o 35,12 %, respektive 39,45 %. To napovídá, že velkou část přínosu tvoří samotná data, nikoli jen chytrý rámec KLA. Ten sice dál přidá zhruba 3–4 %, ale základ je v datech, kterých je u novorozenců chronicky málo.
Český a evropský úhel
Respirační potíže patří celosvětově k hlavním příčinám nemocnosti a úmrtnosti novorozenců a Česká republika s hustou sítí perinatologických center není výjimkou. Právě tady může být podobný výzkum do budoucna zajímavý: neonatologové u nás řeší stejný problém jako ti v Šanghaji — syndrom dechové tísně, pneumonie a další stavy je nutné zachytit co nejdřív.
Zároveň je potřeba zůstat střízlivý. Jde o výzkumný preprint, který neprošel recenzním řízením. Autoři nezveřejnili váhy modelu ani kód, pouze datasety „na vyžádání" po schválení. A 65% přesnost F1 znamená, že zhruba třetinu případů by model hodnotil špatně — v medicíně, kde se rozhoduje o životě předčasně narozených dětí, je to pořád daleko od jakéhokoli klinického nasazení.
Dobrá zpráva pro odbornou komunitu: NeoRed si zároveň uchoval konkurenceschopnost na dospělých datasetech MIMIC-CXR a IU-Xray, kde skončil druhý za specializovanými modely. To naznačuje, že trénink na novorozencích model „nepokazil", což je u úzce zaměřeného doladění vždy riziko.
Co si z toho odnést
NeoRed je poctivý kus výzkumu, který pojmenovává skutečný problém — že medicínská AI se zatím novorozencům spíš vyhýbá. Autoři nejen postavili model, ale hlavně sesbírali a zdokumentovali dvě reálná klinická data, která v oboru chyběla. To je hodnota, která přetrvá, i kdyby samotný model nakonec nikam nevedl.
Pro českého čtenáře z toho plyne jednoduché ponaučení: když uslyšíte, že „AI už umí diagnostikovat z rentgenu", vždy se ptejte, na kterých datech a u kterých pacientů. Model, který exceluje na dospělých, může být u novorozence prakticky k ničemu. A přesnost, která v technologickém článku zní působivě, může být v nemocnici pořád zoufale nízká.
Je NeoRed už dostupný v nemocnicích nebo jako nástroj pro veřejnost?
Ne. Jde o výzkumný preprint na serveru arXiv, který neprošel recenzním řízením. Autoři nezveřejnili váhy modelu ani kód — na vyžádání po schválení nabízejí pouze datasety. Klinické nasazení je v nedohlednu a přesnost k tomu zatím ani nestačí.
Co přesně znamená F1 skóre 65,19 % a proč je to „málo"?
F1 je míra, která kombinuje, kolik skutečných diagnóz model odhalí (recall) a jak přesný je v tom, co označí (precision). Hodnota 65,19 % znamená, že zhruba třetinu případů hodnotí špatně. V diagnostice novorozenců, kde chyba může znamenat ohrožení života, je to pro samostatné nasazení nedostatečné — model může fungovat nanejvýš jako podpora pro lidského neonatologa.
Proč se AI učí hůř na novorozencích než na dospělých?
Dva důvody: dat je málo (kvalitních rentgenů novorozenců je řádově méně než dospělých) a nálezy jsou vizuálně podobné — pneumonie, NRDS i TTN se na snímku snadno zamění. Proto je u novorozenců klíčové kombinovat snímek s klinickými údaji, což běžné modely neumějí.