Přejít k hlavnímu obsahu
Obrázek
Ilustrační obrázek

Nový benchmark odhaluje slabinu AI: modely stále často špatně čtou obraz

Umělá inteligence dnes dokáže popsat fotografii, přečíst dokument nebo navrhnout úpravy grafiky. Nový benchmark ale ukazuje, že mezi „vidět obrázek“ a skutečně mu porozumět zůstává překvapivě velká mezera. Ani nejlepší testované multimodální modely nepřekročily hranici 60 procent úspěšnosti.

AI může znít přesvědčivě, i když se dívá špatně

Multimodální modely, tedy systémy pracující s textem i obrazem, se běžně používají k popisu fotografií, analýze tabulek, čtení smluv nebo hledání informací na obrazovce.

16. 8. 2026 Miriam Česáková
Obrázek
Ilustrační obrázek pro jarvis-ai.cz

Roboti, kteří sami mapují staveniště. JLG do nich vkládá peníze

Stavební firmy ročně ztrácejí peníze na zpožděných projektech, špatně vyfakturovaných pracích a vadách, kterých si všimnou až moc pozdě. Americký gigant JLG — výrobce zdvihacích plošin, které znáte z každé větší stavby — teď sází na startup, jehož roboti si staveniště sami objedou, nafotí a pomocí vizuální AI z toho vyrobí živou mapu postupu prací. Nejde o sci-fi, ale o konkrétní investici, která ukazuje, kam se posouvá automatizace ve stavebnictví.
16. 8. 2026 Daniel Česák
Obrázek
Ilustrační obrázek

Je to skutečný AI agent, nebo jen přelepená automatizace? Pět otázek, které to prozradí

Nálepka „AI agent" dnes zdobí web skoro každého dodavatele podnikového softwaru. Před podpisem smlouvy je proto důležitější než marketingový název zjistit, co systém skutečně dělá, jak pracuje s daty a za co přesně platíte. Analytici z Gartneru pro situaci, kdy se obyčejná pravidlová automatizace přebalí do podoby autonomního agenta, používají termín „agent washing". Následující kontrolní seznam pomůže odhalit rozdíl ještě před nákupem a nasazením do firemních procesů.
16. 8. 2026 Miriam Česáková
Obrázek
Gemini Omni generuje a upravuje video konverzací

Gemini Omni umí upravit video obyčejnou větou. Google ho spouští i do YouTube Shorts

Google podle oznámení Google DeepMind z 20. května 2026 v rámci konference Google I/O 2026 představil propojení dvou oblastí, které dosud běžely odděleně: modelu, který pracuje s instrukcemi, a modelu, který tvoří video. Nový Gemini Omni má podle popisu Googlu z textu, fotky, audia i videa — přičemž audio může sloužit jako vstupní reference — generovat video a také ho upravovat obyčejnou konverzací.
16. 8. 2026 Daniel Česák
Obrázek
Ilustrační obrázek

Čínská Z.ai uvolní 700miliardový model zdarma. V programování se snaží držet krok s Claude i GPT

Čínská společnost Z.ai (dříve Zhipu AI) oznámila model GLM-5.3 určený přímo pro programování. Nejzajímavější na něm ale není jen deklarovaný výkon — je to cenovka. Podle oznámení společnosti mají být váhy modelu se zhruba 700 miliardami parametrů brzy zdarma ke stažení, a to ve chvíli, kdy podle zveřejněných informací hlavní čínský konkurent DeepSeek zdražil své API až na čtyřnásobek. Z dostupných informací tak vyplývá spíše obchodní strategie než běžné oznámení dalšího jazykového modelu.
16. 8. 2026 Daniel Česák
Subscribe to AI novinky
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.