Přejít k hlavnímu obsahu

GPT-5 pozná trhlinu v koleni, ale falešných poplachů dává příliš

Ilustrační obrázek
GPT-5 dokázal v pilotním testu najít trhliny menisku na snímcích magnetické rezonance kolene s přesností 76 procent. Nadějný výsledek má ale háček: u zdravých menisků se spletl výrazně častěji než specializované radiologické systémy. Model tak zatím připomíná spíš rychlého druhého čtenáře než digitálního radiologa.

GPT-5 dostal jednoduchou otázku: ano, nebo ne

Studie publikovaná v časopise Cureus zkoumala, zda obecný multimodální jazykový model zvládne úkol, pro který se běžně staví specializované medicínské algoritmy. Výzkumníci vzali 100 vyšetření kolene z veřejné databáze MRNet: 50 snímků obsahovalo trhlinu menisku a 50 nikoli. Meniskus je chrupavčitá ploténka mezi stehenní a holenní kostí, která v koleni funguje trochu jako pružný tlumič nárazů.

GPT-5 dostal sagitální a koronální série snímků převedené do formátu PNG. Sagitální řez ukazuje koleno z boku, koronální zepředu. Model neměl k dispozici věk pacienta, popis potíží ani klinickou anamnézu. Použit byl jediný pevný prompt: určit, zda je přítomna trhlina, a odpovědět pouze „yes“ nebo „no“. Žádné doučování na medicínských datech, žádné dolaďování a žádné nápovědy.

To je důležitý detail. Nešlo o test hotového zdravotnického produktu, ale o zero-shot experiment. Zero-shot znamená, že model řeší úlohu bez speciálního tréninku na stejném typu dat. Je to podobné, jako kdybyste zkušenému všeumělovi poprvé podali radiologický atlas a požádali ho o binární verdikt.

Výsledek: dobře zachytí problém, hůř uklidní zdravého pacienta

Celková přesnost GPT-5 byla 76 procent, s 95% intervalem spolehlivosti 66,8 až 83,3 procenta. Citlivost neboli recall pro skutečné trhliny dosáhla 84 procent. Z padesáti pozitivních případů tedy model správně označil 42. To je vlastnost, která se hodí pro předběžné třídění: podezřelé snímky by mohl poslat k rychlejší kontrole člověkem.

Problém se ukázal na druhé straně rovnice. Specificita byla jen 68 procent. Model správně poznal 34 z 50 kolen bez trhliny a 16 zdravých případů označil jako pozitivní. Na souboru zdravých kolen tak vznikla 32% falešná pozitivita (16 falešných poplachů), přičemž celkový počet všech chyb byl 24 ze 100 vyšetření. Přesnost pozitivní předpovědi byla 72,4 procenta a F1-skóre pro třídu s trhlinou 0,778. F1 je jedno číslo, které kombinuje citlivost a přesnost, takže trestá systém, který sice nic nepřehlédne, ale současně označuje příliš mnoho zdravých kolen.

V běžné nemocnici by navíc poměr pozitivních a negativních nálezů nebyl uměle nastavený na 50:50. Při nižší skutečné četnosti trhlin by byl podíl falešných poplachů mezi všemi pozitivními hlášeními ještě důležitější. Číslo 76 procent proto nelze jednoduše přeložit jako „GPT-5 správně vyhodnotí tři ze čtyř pacientů“ bez znalosti konkrétní populace a způsobu použití.

Obecný model zaostává za nástroji stavěnými pro MRI

Nejzajímavější srovnání není s člověkem, ale s algoritmy, které mají užší záběr. Studie uvádí, že specializovaný systém MRNet dosáhl pro detekci trhlin menisku AUC 0,847. AUC vyjadřuje, jak dobře model odděluje pozitivní a negativní případy napříč různými rozhodovacími prahy; není to totéž co přesnost, ale umožňuje rozumnější srovnání klasifikátorů.

Další systém označovaný jako KneeXNet ve stejné literatuře dosáhl AUC nad 0,96. Takové modely pracují s MRI jako s objemem složeným z mnoha navazujících řezů, nikoli jako s několika obrázky, které má obecný chatbot popsat. Jsou trénované na úloze detekce kolenních poranění, umí zohlednit pořadí řezů a mohou vytvořit mapu oblastí, jež k verdiktu přispěly.

GPT-5 má proti tomu jinou výhodu: jeden model zvládne obrázek, text i vysvětlení a není nutné pro každý nový typ otázky stavět samostatný systém. Jenže univerzálnost není náhradou za kalibraci. Radiolog potřebuje vědět nejen „ano“, ale také kde přesně je problém, jak jistý si systém je a co dalšího na snímku vidí. V testu GPT-5 vrátil pouze jednoslovnou odpověď a neposkytl lokalizaci trhliny ani heatmapu.

Pro české zdravotnictví je to zatím výzkum, ne diagnóza

GPT-5 je multimodální LLM, tedy jazykový model s obrazovým vstupem. Přes API může přijímat obrázky, ale tato studie neověřovala češtinu, české radiologické zvyklosti ani provoz v české nemocnici. Testovaná data pocházela z veřejné databáze bez demografických údajů a se zachovanými pouze dvěma obrazovými rovinami. Výsledek proto nelze automaticky přenést na české přístroje, jiné protokoly MRI nebo pacienty po operaci.

Autoři navíc nepoužili chirurgicky potvrzenou pravdu u každého případu. Referenční štítky vycházely z konsenzu tří zkušených muskuloskeletálních radiologů, kteří měli k dispozici kompletní vyšetření, zprávy a následné snímky. To je solidní základ pro pilotní test, ale nikoli absolutní „zlatý standard“. Studie také neporovnávala GPT-5 přímo s radiology na stejných 100 případech.

Pro českého pacienta z toho plyne hlavně praktická brzda: nahrát vlastní MRI do veřejného chatbotu není bezpečná cesta k diagnóze. Snímky mohou obsahovat citlivá zdravotní data a model může být aktualizován způsobem, který ztíží reprodukovatelnost výsledku. Pokud by podobný systém někdy vstoupil do klinického workflow v Česku nebo Evropské unii, musel by projít ověřením na lokálních datech, vyřešit ochranu osobních údajů a fungovat pod dohledem kvalifikovaného zdravotníka.

Kam se multimodální AI může hodit

Výsledek není důkazem, že GPT-5 umí samostatně diagnostikovat koleno. Je ale zajímavým signálem, že obecný model dokáže bez speciálního tréninku zpracovat obrazový materiál a zachytit většinu pozitivních případů. Realističtější použití by vypadalo jako human-in-the-loop: algoritmus označí studie, které si zaslouží rychlejší kontrolu, a radiolog rozhodne.

Takový scénář má smysl jen tehdy, pokud se současně sníží počet falešných poplachů a model ukáže, na kterých řezech své rozhodnutí založil. Jinak může místo úspory času vyrábět další frontu kontrol. Pilotní studie tedy nepřináší návod, jak nahradit odborníka. Přináší přesnější otázku: zda lze obecný multimodální model zkrotit do bezpečného pomocníka, nebo zda je pro medicínu rozumnější použít menší, specializovaný a lépe vysvětlitelný algoritmus.

Co je meniskus?

Meniskus je chrupavčitá struktura v koleni mezi stehenní a holenní kostí. Pomáhá rozkládat zatížení a stabilizovat kloub; při trhlině může vzniknout bolest, otok nebo omezení pohybu.

Znamená přesnost 76 procent, že GPT-5 může nahradit radiologa?

Ne. Šlo o malý pilotní test 100 vyvážených případů bez klinického kontextu. Model měl specificitu 68 procent, nevysvětlil lokalizaci nálezu a autoři jej za samostatný diagnostický nástroj nedoporučují.

Je GPT-5 z této studie dostupný českým nemocnicím jako diagnostický nástroj?

Studie testovala model přes API, ale nedokládá schválený klinický produkt ani nasazení v českých nemocnicích. Dostupnost API proto nelze zaměňovat za zdravotnickou certifikaci.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.