Přejít k hlavnímu obsahu

Chatboti vám lichotí. Atraktivitu tváří nadhodnocují o 0,8 bodu

Ilustrační obrázek
Zeptat se chatbota, jestli na fotce vypadáte dobře, je dnes otázka na pár vteřin. Nová studie ale ukazuje, že ChatGPT, Claude, Grok i Gemini mají společný návyk: lichotí. Všechny čtyři modely systematicky nadhodnocují atraktivitu lidských tváří, a to o víc než 0,8 bodu na sedmibodové škále.

Čtyři chatboti dostali roli porotce krásy

Výzkumníci ze společnosti QOVES pod vedením Santiaga Grandase postavili vedle sebe dva světy: 2 513 lidských hodnotitelů a čtyři komerční modely umělé inteligence. Obojí hodnotilo stejných 102 standardizovaných portrétů ze sady Face Research Lab London Set — tedy neutrální snímky obličejů pořízené za jednotných podmínek, bez výrazu, výrazného účesu nebo jiných rušivých faktorů.

Hodnoticí stupnice byla jednoduchá: od 1 do 7, kde vyšší číslo znamenalo atraktivnější obličej. Výsledky vědci zpracovali v preprintu, o kterém koncem září 2026 informoval vědecký server PsyPost.

Lidé jsou přísnější, AI velkorysá

Rozdíl je vidět na první pohled. Průměrné hodnocení lidských účastníků dosáhlo 3,02 bodu — tedy pod středem stupnice. Lidé zkrátka používali celou škálu a průměrný obličej u nich dopadl zhruba jako průměrný.

Chatboti ale hodnotili téměř všechny tváře jako nadprůměrné. Žádný ze čtyř modelů nepoužil nejnižší známku 1, a průměrně nadhodnotili atraktivitu o více než 0,8 bodu. Na sedmibodové škále to není kosmetický detail — je to víc než desetina celé stupnice.

Stejně důležité je, co se stalo se samotnými známkami. Modely svoje hodnocení stlačily do užšího pásma. Když učitel rozdává jen trojky a čtyřky, ztrácí jeho hodnocení vypovídací hodnotu; tady to fungovalo podobně.

Proč umělá inteligence lichotí

Příčina nespočívá v tom, že by AI měla vlastní vkus. Jde o důsledek toho, jak se tyto modely trénují.

Chatboti se učí na obrovském množství textů a obrázků z internetu a ladí se tak, aby byli k uživatelům přívětiví a nápomocní. Představte si číšníka, který se za roky praxe naučil, že když hostovi řekne „skvělá volba“, dostane lepší spropitné. I modely se během učení setkávají se zpětnou vazbou, která je vede k milejším odpovědím — a tato zdvořilost se pak propisuje i do číselného hodnocení vzhledu.

Výzkum to potvrzuje: nadhodnocování skóre je mimo jiné důsledek tréninku na internetových datech a nastavení modelů k přívětivému chování. AI nechce nikoho urazit, a tak raději přidá pár desetin bodu.

Co AI naopak zvládá — a kde je háček

Ne všechno je špatně. Modely dokážou poměrně přesně seřadit obličeje podle atraktivity — tedy říct, kdo je na fotce hodnocený jako hezčí a kdo méně. Problém je v absolutních číslech, ne v pořadí.

Jediným faktorem, na kterém se lidé i AI modely shodli jako na ukazateli atraktivity, byl věk obličeje. To dává smysl: mládí je jeden z nejstabilnějších a nejuniverzálnějších signálů, které se dají z fotky vyčíst.

Proč na tom záleží

Na první pohled jde o akademickou zajímavost. Jenže hodnocení vzhledu umělou inteligencí se pomalu přesouvá z laboratoří do běžného života. Lidé nahrávají svoje fotky do chatovacích aplikací a ptají se, jak působí; nástroje na úpravu fotek a videa slibují, že z „průměrného“ snímku udělají lepší. A všechno to běží v češtině, na telefonech, bez jakékoli bariéry.

Studie je tak především varováním: AI není objektivní soudce lidského vzhledu, ačkoli ji k tomuto účelu lidé stále častěji používají. Když vám chatbot řekne, že vypadáte skvěle, může to být spíš zdvořilost než měření.

Jak z toho ven

Praktické ponaučení je jednoduché: berte hodnocení vzhledu od AI s rezervou, a pokud už ho chcete, ptejte se raději na srovnání („která z těchto dvou fotek působí lépe?“) než na absolutní známku. Pořadí modely zvládají lépe než absolutní skóre.

Může AI objektivně posoudit můj vzhled?

Ne. Studie ukazuje, že modely systematicky nadhodnocují a stlačují známky do užšího pásma, takže číselné hodnocení není spolehlivé. Lépe si vedou ve srovnání dvou obličejů, kde záleží na pořadí, ne na absolutní známce.

Proč chatbot nikdy nedá nejnižší známku?

Modely se ladí tak, aby byly k uživatelům přívětivé a nápomocné. Tato zdvořilost se propisuje i do hodnocení vzhledu, proto žádný ze čtyř testovaných modelů nepoužil jedničku.

Liší se v nadhodnocování jednotlivé modely?

Studie zkoumala ChatGPT, Claude, Groka a Gemini a u všech čtyř popsala stejný vzorec nadhodnocování. Rozdíly mezi jednotlivými modely nebyly hlavním tématem výzkumu.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.