Obrázek
Nový benchmark odhaluje slabinu AI: modely stále často špatně čtou obraz
Umělá inteligence dnes dokáže popsat fotografii, přečíst dokument nebo navrhnout úpravy grafiky. Nový benchmark ale ukazuje, že mezi „vidět obrázek“ a skutečně mu porozumět zůstává překvapivě velká mezera. Ani nejlepší testované multimodální modely nepřekročily hranici 60 procent úspěšnosti.
AI může znít přesvědčivě, i když se dívá špatně
Multimodální modely, tedy systémy pracující s textem i obrazem, se běžně používají k popisu fotografií, analýze tabulek, čtení smluv nebo hledání informací na obrazovce.