Co vědci vlastně testovali
Studie Multimodal Large Language Models Rate Wetlab Suturing Repeatably but Fail to Detect Training-Related Improvement vzala multimodální velké jazykové modely (MLLM) a pustila je na záznamy chirurgického šití v takzvaném wetlabu — tedy praktickém trenažéru, kde se studenti učí vázat uzly a manipulovat s tkání na modelech či zvířecích preparátech. Úkolem modelu bylo ohodnotit provedení stehu podobně, jako by to udělal zkušený chirurg-školitel.
Proč zrovna wetlab? Protože jde o bezpečné prostředí, kde si začínající chirurg může opakovaně trénovat bez rizika pro pacienta. A právě hodnocení — jak objektivně, spravedlivě a opakovaně říct, jestli se student zlepšuje — je ve výuce chirurgie notoricky těžké a časově náročné. Kdyby to zvládla umělá inteligence, uvolnila by školitelům hodiny času.
Jak si multimodální model vede
Multimodální model si představte jako ChatGPT, který umí nejen číst text, ale také se dívat na obrázky a video. V tomto případě dostal záznam rukou při šití a měl vrátit známku. V čem je silný, je opakovatelnost: na stejný záznam odpoví pokaždé stejně. To u lidských hodnotitelů zdaleka není samozřejmost — dva lektoři často dají stejnému výkonu různé známky a i jeden člověk se může při druhém hodnocení mírně rozcházet sám se sebou.
Jenže konzistence je jen polovina úkolu. Druhá, podstatnější polovina je rozpoznat změnu: když student trénuje týdny, jeho stehy by měly být hodnoceny čím dál lépe. A právě tady modely podle studie selhávají. Vykazují nulovou citlivost k tréninkem podmíněnému posunu v technice — jinými slovy, mezi výkonem začátečníka a stejného studenta po intenzivním výcviku nevidí rozdíl.
Proč modelům pokrok uniká
Klíčové omezení autoři vidí ve vizuální stránce. Hodnocení chirurgické zručnosti nestojí na jednom snímku, ale na jemných detailech pohybu — na tom, jak ruka drží nástroj, jak plynule a jistě váže uzel, kolik zbytečných pohybů dělá, jak šetrně manipuluje s tkání. Právě tyhle mikronáznaky dělí začátečníka od pokročilého. Multimodální modely je ale nedokážou správně interpretovat, obzvlášť když jde o sekvenci v čase, nikoli statický obrázek.
Je to podobné, jako když si prohlížíte dvě fotografie stromu: poznáte, že jde o stejný strom, ale že od jara o pár centimetrů povyrostl, z fotek nevyčtete. Zkušený chirurg tenhle „růst“ u studenta vidí — model ho zatím ne.
Kam se výzkum posouvá
Studie přitom není krokem zpět, ale spíš poctivým zmapováním terénu. Experti v ní sloužili jako referenční standard, vůči kterému se přesnost a rozlišovací schopnost modelů měřily. A protože se ukázalo, kde přesně modely narážejí, posouvá se další práce k vývoji specializovaných benchmarků zaměřených na analýzu videa a sekvenčních úkonů — tedy právě na to, co obecným modelům dnes chybí.
Jinými slovy: nestačí model, který „vidí“. Je potřeba model, který vidí pohyb a jeho kvalitu v čase. To je jiná disciplína než rozpoznat objekt na fotce.
Evropský a český kontext
Pro českého čtenáře má tahle studie reálný dopad. Lékařské fakulty u nás — v Praze, Brně, Plzni nebo Hradci Králové — stále více hledají nástroje pro objektivní hodnocení praktických dovedností studentů. Multimodální modely se nabízejí jako levné a dostupné řešení: žádný drahý specializovaný hardware, stačí nahrát video.
Jenže evropská regulace tady nehraje na efektivitu. Podle EU AI Act spadají systémy, které hodnotí výsledky učení v odborném vzdělávání, mezi vysoce rizikové aplikace. To znamená povinnost lidského dohledu, dokumentace a posuzování shody ještě před nasazením. Studie z Cureus přitom přesně ukazuje, proč tenhle opatrný přístup dává smysl: systém, který nepozná zlepšení studenta, nemůže rozhodovat o jeho postupu samostatně. Školitel tu zatím zůstává nenahraditelný.
Co si z toho vzít
Závěr je vlastně povzbudivý a střízlivý zároveň. Multimodální modely dnes spolehlivě zvládnou jednorázové, statické hodnocení — konzistentně, bez únavy a levně. To se hodí tam, kde jde o opakovaný screening nebo kalibraci. Ale tam, kde je podstatou zhodnotit vývoj dovednosti v čase, zatím nenahradí lidské oko ani lidský úsudek.
Pro výuku chirurgie to znamená realistické očekávání: AI může být trpělivý asistent, který odvede opakovatelnou rutinu, ale posouzení pokroku — tu nejcennější zpětnou vazbu — si prozatím nechá lidský školitel. A podle dat z pilotní studie k tomu má zatím dobrý důvod.
Co přesně znamená „multimodální“ jazykový model?
Znamená to model, který kromě textu zpracovává i další vstupy — nejčastěji obrázky, video nebo zvuk. V této studii model „viděl“ záznam rukou při šití a na jeho základě vracel textové hodnocení. Obyčejný jazykový model by si poradil jen s popisem výkonu, ne se samotným vizuálním záznamem.
Nahradí AI časem chirurgy, nebo jen zkoušející?
Tahle studie se netýká samotného operování, ale hodnocení při výcviku. AI dnes neumí ani spolehlivě posoudit, zda se student chirurgie zlepšuje, natož nahradit operatéra. Reálně jde o podpůrný nástroj pro objektivní hodnocení dovedností — s tím, že lidský dohled a úsudek zůstávají klíčové.
Jsou podobné nástroje už v Česku dostupné?
Veřejné nástroje jako ChatGPT, Gemini nebo Claude umí analyzovat obrázky a video, ale nejsou certifikované pro hodnocení ve zdravotnickém ani odborném vzdělávání. Podle EU AI Act by takové nasazení pro hodnocení výsledků učení spadalo mezi vysoce rizikové aplikace, což vyžaduje lidský dohled a posouzení shody. Na českých fakultách se zatím jedná spíše o výzkum než o rutinní praxi.