Přejít k hlavnímu obsahu

Obrázky v ChatGPT jsou až o polovinu rychlejší. Nově stačí načrtnout, co chcete

Ilustrační obrázek
OpenAI nasadilo do ChatGPT novou generaci obrazového modelu ChatGPT Images 2.5. Generování je oproti předchozí verzi až o polovinu rychlejší, obrázek lépe drží tvar, když do něj zasahujete, a nová funkce Sketch umožní místo dlouhého popisu jednoduše načrtnout, co chcete. Není to jen kosmetická aktualizace — mění se tím celý způsob, jakým se obrazové modely ovládají.

Konec hádání, co si pod promptem představit

Když jste dosud chtěli z obrazového modelu dostat konkrétní scénu, museli jste ji umět slovně popsat. „Člověk stojí vlevo, produkt uprostřed na podstavci, nad ním velký nadpis, v pozadí jemný modrý přechod.“ A pak jste čekali, jestli si model z půl odstavce textu domyslí to, co jste měli v hlavě. Často ne.

Přesně tuhle nepříjemnou fázi se OpenAI snaží zkrátit. Dobře napsaný prompt samozřejmě nezmizí, ale v řadě situací je pár čar na obrazovce přesnějších než padesát slov. Přirovnal bych to k práci grafika: zadání „udělej to hezky“ je k ničemu, ale hrubý náčrt rozložení sdělí přesně to podstatné.

Sketch: náčrt místo zdlouhavého popisu

Nová funkce Sketch funguje přesně tak, jak název napovídá. Základní rozložení scény jednoduše nakreslíte — kam přijde postava, kam produkt, kam text — a ChatGPT podle náčrtu vytvoří hotový obrázek. Model si tak vezme váš hrubý záměr jako kostru a doplní detaily, které byste jinak museli vypsat slovo od slova.

Proč na tom záleží? Protože popisovat vizuální kompozici slovy je zkrátka neohrabané. Jazyk je lineární, obrázek prostorový. Když chcete tři prvky na konkrétních místech, náčrt to vyjádří za pár vteřin, zatímco textové zadání se snadno zvrtne v nepřehledný odstavec, kde si model dva požadavky odporují. Sketch vrací do hry to, co u obrazových modelů dosud chybělo — přímou, vizuální kontrolu nad kompozicí.

Úpravy, které už nerozbijí obličej

Druhá velká změna se týká úprav. Starší modely měly známý neduh: chtěli jste změnit bundu, nápis nebo pozadí a spolu s tím se nečekaně proměnil obličej, tvar předmětu nebo část scény, která měla zůstat beze změny. Images 2.5 má podobné zásahy zvládat podstatně přesněji — při úpravě jednoho detailu už by nemělo docházet k tichému přepisování zbytku obrázku.

S tím souvisí i nové nástroje pro práci s obrazem. Přibyly šablony třeba pro letáky nebo produktové fotografie a do hry vstupují i komentáře: konkrétní místo v obrázku označíte a řeknete, co přesně se tam má změnit, místo abyste model nechali znovu hádat z celého zadání. Sdílet lze nově rovnou i prompt, ze kterého obrázek vznikl, takže si někdo jiný vezme stejné zadání a vytvoří vlastní variantu.

Rychlost a čísla, která za tím stojí

OpenAI tvrdí, že generování je oproti Images 2.0 až o 50 procent rychlejší. Firma má pro rychlost dobrý důvod: podle jejích vlastních údajů vznikají pomocí ChatGPT a obrazových modelů více než tři miliardy obrázků týdně. To není číslo, které byste chtěli řešit pomalým modelem.

Rychlost u generování obrázků není luxus, ale pracovní nástroj. Obrázky vznikají iterativně — vygenerujete, podíváte se, opravíte, vygenerujete znovu. Když jeden pokus trvá o polovinu kratší dobu, celý tvůrčí cyklus se viditelně zkrátí a vy se míň zdráháte experimentovat. Přesně tenhle efekt u nové verze čekám nejvíc.

Flare a Sunburst: dva modely pro vývojáře

Pro API OpenAI představilo hned dva modely. GPT-Image-2.5 Flare má být běžnou volbou tam, kde je potřeba generovat větší množství obrázků a nechce se čekat — míří na obsah pro sociální sítě, produktové služby nebo rychlé vizuální návrhy. Druhý model, GPT-Image-2.5 Sunburst, cílí spíš na přesnost, tedy na reklamní grafiku či produktové snímky, kde je klíčové, aby se při opakovaných zásazích nerozpadla původní kompozice.

Je to logické rozdělení: rychlost a kvalita se u generování obrázků často chovají jako protichůdné požadavky a ne každý případ potřebuje obojí na maximum. Vývojář si vybere podle toho, jestli potřebuje objem, nebo preciznost.

Co to znamená pro českého uživatele

ChatGPT je v Česku běžně dostupný a funguje česky, obrazové modely najdete v placených tarifech (Plus a výš, od zhruba 20 dolarů měsíčně). Praktický dopad novinek je ale u nás možná ještě zajímavější než u rodilých angličtinářů: funkce Sketch a připínané komentáře snižují nároky na přesnou slovní formulaci, což ocení každý, kdo s anglickým promptem občas bojuje. Místo aby člověk hledal správný výraz pro „produkt mírně natočený doleva s odleskem“, jednoduše to naznačí na plátně.

Šablony pro letáky a produktové fotografie pak cílí na skupinu, která z obrazových modelů může těžit okamžitě — malé firmy, e-shopy a živnostníci, kteří si dělají grafiku sami. Žádné čekání na grafika kvůli akčnímu letáku do výlohy. Zůstává samozřejmě otázka kontroly výsledku a textu v češtině, kde si obrazové modely obecně ne vždy poradí s diakritikou a delšími nápisy — tam zůstává lidská revize nutná.

Kam tím OpenAI míří

Širší trend je jasný: od textových promptů se pole obrazových modelů posouvá k přímé vizuální interakci. Kreslení náčrtů, připínání poznámek přímo do obrázku a výběr ze šablon mají společného jmenovatele — dát uživateli kontrolu, která se obejde bez zdlouhavého popisování. Není to poprvé, co OpenAI přepsalo vlastní obrazový model, a zřetelně se v tom učí z toho, kde uživatelé nejčastěji naráželi.

Pro běžného čtenáře z toho plyne jedno praktické doporučení: pokud jste obrazové generování zkoušeli před pár měsíci a odradila vás pomalost nebo to, že úpravy rozbíjely zbytek obrázku, stojí za to dát Images 2.5 druhou šanci. Rozdíl v ovládání je totiž tentokrát podstatnější než jen o stupeň ostřejší obrázky.

Je nová funkce Sketch dostupná i ve verzi ChatGPT zdarma?

Obrazové generování je součástí placených tarifů ChatGPT (Plus a vyšších). OpenAI podrobnosti o případném omezeném přístupu pro bezplatné účty neupřesnilo, proto se vyplatí sledovat, jak se funkce postupně uvolňuje napříč tarify.

Poradí si Images 2.5 s českým textem uvnitř obrázku?

Modely rozumí českým promptům, ale u delších nápisů přímo v obrázku, a hlavně u diakritiky, obrazové modely obecně chybují. U letáků a reklam je proto rozumné text vkládat a kontrolovat ručně.

Čím se liší modely Flare a Sunburst pro API?

Flare je naladěný na rychlost a velké objemy, Sunburst na přesnost a zachování kompozice při opakovaných úpravách. Jde o dvě verze určené vývojářům, koncoví uživatelé v ChatGPT pracují s jednotným modelem Images 2.5.

Diskuze

Zatím žádné komentáře — buďte první, kdo se podělí o svůj názor.
X

Nezmeškejte novinky!

Přihlaste se k odběru novinek a aktualit.