OpenAI nasadila do ChatGPT nový obrázkový model Images 2.5. Slibuje ostřejší detaily, přirozenější světlo, generování až o polovinu rychlejší než u předchozí verze a především úpravy, které nenaruší zbytek obrázku. K tomu přidává kreslení náčrtů přímo v aplikaci, šablony pro plakáty nebo reklamní předměty a sdílení promptu spolu s hotovým snímkem. Vývojáři dostali v rozhraní API dva nové modely s názvy Flare a Sunburst. Podle OpenAI vzniknou v ChatGPT Images a v obrazových modelech v rozhraní API každý týden více než tři miliardy obrázků.
Podoba z fotky konečně vydrží
Nejvíce práce si OpenAI dala s věrností předloze. Nahrajete vlastní fotografii, požádáte o jiné prostředí, jiný výtvarný styl nebo jinou kompozici a výsledek by měl stále vypadat jako vy, nikoli jako váš vzdálený příbuzný. Osvětlení a textury působí přirozeněji. Charakteristické rysy tváře se do nové scény přenesou mnohem spolehlivěji.
Právě na tomto úkolu dříve modely nejčastěji selhávaly. Novinář serveru Axios, který novinku testoval ještě před uvedením, popisuje, že rozdíl je vidět hlavně na lidech a domácích mazlíčcích. Do ChatGPT nahrál fotku kočky Raven a nechal si poradit, do jakých žánrů ji přenést. Model nabídl detektivku ve stylu film noir, vitráž i renesanční portrét. Ve svém výpisu si přitom sám vytkl, že musí zachovat kočičí zcela netečný výraz. Z téže fotografie pak vytvořil vtipný anatomický diagram, na kterém oči popsal jako zrak plný opovržení, mozek jako orgán pro detekci pamlsků a ocas jako projev lhostejnosti.

Druhá významná oprava se týká úprav. Starší modely měly zlozvyk, že spolu s vyžádanou změnou bundy nebo nápisu nepozorovaně překreslily i obličej, tvar předmětu nebo kus pozadí. Model Images 2.5 podle OpenAI zasáhne jen do vybraného místa a okolí ponechá beze změny. Zvládá to i u složitějších objektů a rušných pozadí. Pro firmy, které model využívají přes rozhraní API, to znamená možnost vyměnit jediný prvek, například produkt, pozadí nebo text v reklamě. Kompozice a firemní vizuální styl okolo přitom zůstanou zcela zachovány.
S tím souvisí chování v dlouhých konverzacích. Model si pamatuje dřívější změny a každou další úpravu staví na tom, co už vzniklo, takže kvalita postupně neupadá. Kdo někdy v ChatGPT upravoval obrázek až k desáté verzi a sledoval, jak se z fotografie stává rozmazaná kaše, tuto novinku určitě ocení.
Místo dlouhého popisu stačí pár čar
Nová funkce Sketch umožňuje uživatelům kreslit přímo v prostředí ChatGPT. Načrtnete rozvržení místnosti, obrys oblečení nebo jen jednoduchý nákres, přidáte popis stylu a model z toho vytvoří hotový obrázek. Funkce se aktivuje napsáním "@Sketch" a OpenAI zdůrazňuje, že výtvarný talent k tomu nikdo mít nemusí. Vysvětlovat slovy, že postava má být vlevo, produkt uprostřed a nápis nahoře, zabere půl odstavce. Nakreslit to trvá několik sekund a výsledek je přesnější.
Šablony, komentáře v obrázku a sdílené prompty
Pro uživatele, kteří vědí, co chtějí, ale nechtějí začínat od nuly, přibyly šablony pro nejběžnější formáty. Vyberete si například plakát nebo reklamní předměty a doplníte, jaké informace se mají do grafiky dostat, jaké výtvarné prvky se mají použít a v jakém stylu.
Komentáře fungují tak, že píšete přímo do obrázku a označíte místo, kterého se úprava týká. Testující novinář to zkoušel na návrhu tetování pro kamarádku. Nahrál fotku jejího stávajícího tetování na ruce s popisem, co k němu chce přidat, a ChatGPT vrátil čtyři varianty vykreslené vedle původní kresby. Kamarádka požádala o světlejší části, zakroužkovala místo, kde chtěla konkrétní změnu, a nakonec zvolila kompromis mezi dvěma verzemi. Když o to požádala, model jí ještě našel místní tatéry, kteří se na podobný styl specializují.
Hotový obrázek se dá sdílet spolu s promptem, ze kterého vznikl. Ostatní uživatelé si tak mohou vzít stejné zadání a aplikovat ho na vlastní fotografie.
Nápisy, průhledná pozadí a složitá rozvržení
Model také lépe rozumí složitějším výtvarným instrukcím. Obrázky, které obsahují reálné informace, mají věcně přesnější obsah. Zlepšila se přesnost infografik i jejich rozvržení a systém zvládá také náročnější kompozice včetně průhledného pozadí. Věrněji drží požadovaný výtvarný styl, takže se výsledek při zpřesňování zadání neodchýlí jiným směrem.
Kdo vytváří sérii grafik pro jednu kampaň, návrhy uživatelského rozhraní nebo obrázky do prezentací s pevnou strukturou, tomu tato novinka ušetří nejvíce opakované práce. Test na logu ale ukázal, že zázraky se nedějí hned. Zadáním bylo logo pro pokrytí olympiády v roce 2028, které smí využít firemní znak, ale nesmí obsahovat slovo olympiáda ani pět kruhů, protože si organizátoři na své značky dávají velký pozor. První pokus byl slabý. Až po doporučení, aby model umístil slunce za obrys města, přišlo něco použitelného. Výsledek pak ChatGPT na požádání aplikoval na tričko, termohrnek, tašku a odznaky.
Flare pro rychlost, Sunburst pro náročnou práci
Model Images 2.5 je od svého uvedení dostupný ve všech úrovních ChatGPT, v ChatGPT Work a v Codexu, a to na počítači, mobilu i webu.
V rozhraní API stojí za pozornost dvě odnože. GPT-Image-2.5 Flare přináší stejná vylepšení kvality, úprav i rychlosti a OpenAI ho doporučuje jako výchozí volbu. Dává totiž lepší obrázky než GPT-Image-2 při poloviční latenci. Model GPT-Image-2.5 Sunburst míří na náročnější zakázky, kde se hodí vyšší přesnost napříč úpravami a uživatelům nevadí delší generování.
Firmy, které modely dostaly dříve, chválí hlavně to, že systém pochopí, co měnit nemá. Podle týmu Manus dodává Flare v jejich měřeních kvalitní obrázky dvakrát až čtyřikrát rychleji než GPT-Image-2 a hodí se pro značkové materiály, prezentace i weby. Nové modely zařazuje do svého studia Firefly také společnost Adobe.
Bezpečné generování
Vyšší realističnost má svou odvrácenou stranu. Bez pojistek by model dokázal vyrábět přesvědčivější podvržené snímky reálných lidí, míst a událostí, ať už politické, sexuální nebo jinak citlivé. Ochrany proto fungují ve čtyřech úrovních. Zadání prochází kontrolou ještě před samotným generováním. Vstupní obrázky navíc posuzuje bezpečnostní model, který se dívá na text i obraz společně, a hotový výsledek se před zobrazením znovu kontroluje.
V automatickém testu s cíleně závadnými zadáními propustil Sunburst asi jedno procento snímků, které měly být zablokované. U verze Flare to bylo přibližně 1,4 procenta a u loňské verze Images 2.0 kolem 1,6 procenta. Nejvýrazněji se posunula sexuální kategorie, kde nechtěné výstupy klesly ze dvou procent na půl procenta u Sunburstu.
V oblasti biologických a kybernetických rizik ani jeden z modelů nepřekročil hranici vysoké nebezpečnosti. OpenAI přesto z opatrnosti zachází s modelem tak, jako kdyby ji překročil, a aplikuje na všechny vstupy a výstupy obrazovou obdobu své biologické bezpečnostní politiky.
Původ obrázků řeší firma dvojitě. V souborech zůstávají metadata podle standardu C2PA a k nim se přidal neviditelný vodoznak SynthID od Google DeepMind, který funguje v ChatGPT, Codexu i v rozhraní API. Sama OpenAI píše, že jedno univerzální řešení neexistuje.



