Po týdnech úniku informací a pozorování na LM Areně OpenAI vydalo ChatGPT Images 2.0 dne 21. dubna 2026. Základní model, gpt-image-2, je dostupný v ChatGPT, v Codexu a přes API. Pokud je pro vás cena důležitější než výkon, porovnejte nejlepší bezplatné generátory AI obrázků.

Jde o první obrazový model OpenAI s vestavěným uvažováním, první, který umí vykreslovat hustý text v japonštině, korejštině, čínštině, hindštině a bengálštině, a první, který dokáže před nakreslením jediného pixelu prohledávat web. Navíc posouvá generování AI obrázků za fázi „nástěnky s inspirací" do oblasti, kde výsledky lze skutečně používat jako produkční podklady.

Co je skutečně nové

ChatGPT Images 2.0 nahrazuje obrazový pipeline GPT-4o, který poháněl ChatGPT poslední rok. Znalostní cutoff je prosinec 2025, takže model správně vykresluje aktuální loga značek, produktové designy, geografické mapy a nedávné kulturní reference, se kterými si starší model neporadil nebo uvíznul na verzi z roku 2024.

OpenAI ho označuje za interaktivní kreativní engine, ne za jednorázový generátor. To je podstatné, protože uvažování, vyhledávání na webu a generování obrázků nyní běží v jedné smyčce a model dokáže výstup upřesnit ve více průchodech v rámci jednoho požadavku, aniž byste museli začínat od nuly.

Konkrétní vylepšení:

  • Rozlišení až 2K (2 048 pixelů na šířku) na výstup
  • Poměry stran od 3:1 do 1:3, plynule, bez pevně daných předvoleb
  • 8 konzistentních obrázků z jednoho promptu se sdílenými postavami, osvětlením a stylem
  • Funkční QR kódy, které načte jakýkoli fotoaparát telefonu
  • Vyhledávání na webu při generování
  • Vlastní ověření před výstupem
  • Export s průhledným pozadím pro přímé začlenění do pipeline
  • Ostrý malý text, prvky rozhraní, ikonografie a husté kompozice

Kódová označení LM Areny „maskingtape" a „gaffertape" se ukázala být ranými testovacími variantami. „Duct tape" byl okamžitou variantou. „Packingtape" byl build s režimem uvažování.

Proč bylo vykreslování textu tak obtížné

Od vydavatele

Každý AI model v jedné aplikaci

Fello AI přináší GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 a další v jedné nativní aplikaci pro Mac a iPhone.

Stáhnout hned!

Tři roky nakládal každý velký obrazový model s textem jako s určitou texturou. Model se naučil, „jak vypadají písmena", aniž by chápal, co konkrétní slova znamenají jako glyfy. Proto GPT-4o, Midjourney V7 i DALL-E 3 produkovaly plakáty se zkomoleným textem „WELCOOMM" místo „WELCOME" a proto husté layouty (jídelní lístky, infografiky, obaly produktů) skončily jako nesmysl.

Žena používající nástroje ChatGPT pro obrázky vygenerovaná pomocí GPT-Image-2.0.

ChatGPT Images 2.0 pracuje s textem jako s prvkem první třídy. Recenzenti ho testovali na jídelních lístcích, konferenčních visačkách, obalech produktů a redakčních layoutech. Model zachovává typografii, kerning, hierarchii a správné pravopisné znění. Nadpisy zůstávají ostré ve 2K. Malé popisky jsou čitelné. Kódy SKU, data, ceny a štítky odpovídají promptu, místo aby se automaticky opravovaly na zdánlivě smysluplný nesmysl.

Tato změna posouvá generování AI obrázků od „dost dobré pro nástěnku s náladou" k „dost dobré pro skutečný výstup".

Jídelní lístek restaurace vygenerovaný celý pomocí GPT-Image-2.0

Režim uvažování

ChatGPT Images 2.0 nabízí dva režimy.

Okamžitý režim generuje rychle s důrazem na rychlost. Zahrnuje veškerá vylepšení vykreslování textu a vícejazyčné podpory. Tento režim dostávají všichni uživatelé jako výchozí.

Režim uvažování přidává před generováním průchod uvažováním. Model může prohledávat web, analyzovat materiály, které nahrajete (PDF, snímky obrazovky, pravidla značky), promyslet layout před kreslením, vygenerovat až 8 konzistentních výstupů a zkontrolovat vlastní výstupy ještě před jejich vrácením. U složitého promptu to může trvat až dvě minuty, zatímco okamžitý režim odpoví za sekundy.

To umožňuje stránkové mangové sekvence, víceobrázkové storyboardy a kompletní infografiky, které od spuštění zaplavují sociální sítě. Průchod uvažováním je také důvod, proč prompt jako „navrhni 4 snímky prezentace vysvětlující kvantové tunelování" skutečně vytvoří 4 koherentní snímky s konzistentním designem, místo 4 nesouvisejících obrázků, které mají jen společné téma.

Fotorealistická rýže s hráškem na novinách zdůrazňující texturu a osvětlení vygenerovaná pomocí GPT-Image-2.0

Režim uvažování je část spuštění, kterou nikdo příliš neočekával. Jde v podstatě o model uvažování se štětcem.

Funkční QR kódy a proč na nich záleží

QR kódy vypadají jako kouzelnický trik, dokud nepochopíte, co dokazují. QR kód je přesné matematické kódování. Jeden špatný čtverec a kód nelze naskenovat. Každý předchozí obrazový model produkoval obrázky ve tvaru QR kódu, které ve skutečnosti nefungovaly.

ChatGPT Images 2.0 generuje funkční QR kódy, protože průchod uvažováním v režimu uvažování před kreslením skutečně kódování vypočítá. Model navíc dokáže QR nastylovat barvami značky, vložit logo do středu a umístit ho do plně navrženého plakátu. Marketingové týmy, které dříve potřebovaly generátor QR kódů, designéra a layoutový nástroj pro jeden reklamní podklad, nyní vše zvládnou jedním promptem.

Signalizuje to také, co architektura zvládne za hranicemi obrázků. Vše, co vyžaduje přesnost místo jen přibližnosti, vědecké diagramy, technická schémata, přesné mapy, se stává reálným.

Rozlišení a poměry stran

SpecifikaceGPT Image 1 (GPT-4o)ChatGPT Images 2.0
Maximální rozlišení1024 x 10242048 x 2048 (2K)
Poměry stran1:1, 2:3, 3:23:1 až 1:3 (plynule)
Obrázků na prompt1Až 8
Přístup na webNeAno (uvažování)
Vlastní ověřeníNeAno (uvažování)
Znalostní cutoffříjen 2024prosinec 2025
Průhledná pozadíOmezenoAno

Rozsah 3:1 až 1:3 pokrývá široké bannery, prezentační snímky, plakáty, Stories, miniatury i svislé formáty TikToku, vše ze stejného modelu bez nutnosti zvětšování nebo ořezu. Odpadá tak zdlouhavý postup „vygeneruj čtvercový obrázek, ořízni v Photoshopu, ztratíš polovinu kompozice", který byl standardem od dob DALL-E 2.

GPT-Image-2.0 umožňuje generovat obrázky v mnohem širších poměrech stran

Vícejazyčný text

OpenAI výslovně zmínilo japonštinu, korejštinu, čínštinu, hindštinu a bengálštinu jako jazyky s výrazným pokrokem. Recenzenti to ověřili a výsledky vypadají jako nativní text, ne jako nesmyslné znaky, které produkovaly všechny předchozí obrazové modely.

Hlubší změnou je práce se smíšenými písmy. Model dokáže vykreslit japonský plakát s latinskými názvy produktů, arabský jídelní lístek se západními cenami nebo čínský filmový titulek přes anglický název. Layouty se smíšenými písmy byly ve všech komerčních obrazových modelech dosud nefunkční.

Pro neanglofonní trhy jde o první AI obrazový model použitelný pro produkci mimo latinskou abecedu. Bengálská, hindská a devanágarská typografie byly v DALL-E 3 a Midjourney prakticky nepoužitelné.

Ceny a API

API pro gpt-image-2 je dostupné. Ceny jsou založeny na tokenech:

Typ tokenuCena
Vstupní tokeny obrázků$8 za milion
Výstupní tokeny obrázků$30 za milion

Výsledná cena za obrázek závisí na úrovni kvality a rozlišení. Odhadované ceny za obrázek při standardním rozlišení 1024 x 1024:

Úroveň kvalityCena za obrázek
Nízká~$0.006
Střední~$0.053
Vysoká~$0.211

Výstupy ve 2K stojí více v poměru k dalším tokenům. Jsou k dispozici dvě rozhraní API: Image API (ID modelu gpt-image-2) pro jednorázové generování a úpravy, a Responses API s generováním obrázků jako vestavěným nástrojem. Vývojáři, kteří chtějí, aby jejich aplikace sledovala produkční verzi ChatGPT, mohou použít alias chatgpt-image-latest, který se automaticky aktualizuje.

Některé účty API budou před zpřístupněním endpointů potřebovat ověření organizace OpenAI.

Dostupnost podle předplatného

Úroveň uživateleStandardníRežim uvažování
Bezplatný ChatGPTAnoNe
ChatGPT PlusAnoAno
ChatGPT ProAnoAno (nejvyšší limity)
ChatGPT BusinessAnoAno
ChatGPT EnterpriseAnoAno
Uživatelé CodexuAnoAno
API (gpt-image-2)AnoAno

Spuštění v mobilní verzi probíhá prostřednictvím nejnovější aktualizace aplikace ChatGPT. DALL-E zůstává v ChatGPT k dispozici, ale je nyní prezentováno jako sekundární volba pro uživatele se stávajícími knihovnami promptů nebo specifickými stylovými potřebami, kde se DALL-E osvědčuje.

Srovnání s konkurencí

Praktické srovnání od VentureBeat, TechCrunch a TechRadar ukazuje toto:

SchopnostChatGPT Images 2.0Midjourney V8Nano Banana ProFlux 2
FotorealismusVýbornýVýbornýVelmi dobrýVýborný
Vykreslování textuNejlepší ve tříděDobrýVelmi dobrýDobrý
Vícejazyčný textNejlepší ve tříděOmezenýDobrýOmezený
Uvažování před generovánímAnoNeNeNe
Vyhledávání na webuAnoNeNeNe
Konzistence více obrázkůAž 8OmezenáAž 4Omezená
Maximální rozlišení2K2K (zvětšeno)~1,5K2K
Přístup přes APIAnoNeAnoAno

ChatGPT Images 2.0 vede v přesnosti textu, vícejazyčné podpoře a pracovních postupech s uvažováním. Midjourney má stále navrch u určitých stylizovaných estetik, zvláště malířského a ilustrativního stylu, kde vyniká jeho starší dataset laděný na preference. Nano Banana Pro je v fotorealismu blíže, než se čekalo, a stále vítězí na čistou rychlost. Flux zůstává nejsilnější open source volbou pro týmy, které potřebují vlastní hostování. Pokud si nejste jistí, zda je výsledek skutečný, zde je návod, jak poznat, zda byl obrázek vygenerován AI.

Výsledky Image Areny

Den po spuštění zveřejnil Arena.ai výsledky žebříčku a jsou přesvědčivé. GPT-Image-2 obsadil 1. místo ve všech kategoriích Image Areny s největšími náskoky, jaké kdy platforma zaznamenala:

KategorieSkóre GPT-Image-2Náskok před 2. místem
Text-to-Image (celkově)1512+242 před Nano-banana-2
Úprava jednoho obrázku1513+125 před Nano-banana-pro
Úprava více obrázků1464+90 před Nano-banana-2

Náskok +242 bodů v kategorii Text-to-Image je největší mezera, jakou Arena kdy zaznamenala. Pro srovnání: aktualizace modelů obvykle posunou žebříček o 30 až 60 bodů.

GPT-Image-2 také ovládl všech 7 podkategorií Text-to-Image a porazil svého přímého předchůdce GPT-Image-1.5 s výraznými náskoky:

  • Product, Branding & Commercial Design: +277 bodů
  • 3D Imaging & Modeling: +274 bodů
  • Cartoon, Anime & Fantasy: +296 bodů
  • Photorealistic & Cinematic Imagery: +247 bodů
  • Art: +197 bodů
  • Portraits: +296 bodů
  • Text Rendering: +316 bodů

Skok +316 bodů v kategorii Text Rendering je hlavní číslo a potvrzuje, co recenzenti říkali neformálně. Model se v oblasti textu nezlepšil jen postupně. Posunul celý strop.

Modely, které porazil: Nano-banana-2, varianty Nano-Banana-Pro, MAI-Image-2, Reve-V1.5 a Grok-Imagine-Image.

Co model stále neumí

Ne vše je vyřešeno. Recenzenti upozornili na několik nedostatků:

  • Výběrové úpravy oblasti jsou nepřesné. Při maskování konkrétní oblasti a požadavku na změnu může úprava přesahovat mimo masku. Pro přesné práce je zatím spolehlivější psaný prompt popisující požadovanou změnu než prostorový výběr.
  • Režim uvažování je pomalý. Dvě minuty u složitého promptu jsou pro produkci přijatelné, ale pro běžné prozkoumávání to nevyhovuje. Většina uživatelů zůstane pro každodenní prompty v okamžitém režimu.
  • Vysoce stylizovaná ilustrace. Malířská estetika Midjourney má stále navrch u redakční ilustrace a knižních obalů, kde záleží více na náladě než na přesnosti.
  • Živé video a animace. Jde o model pro statické obrázky. Pohyb řeší samostatně Sora.
  • Konzistence vizuální identity značky v dlouhých sezeních. Osm obrázků z jednoho promptu je konzistentních. Dvacet obrázků z více sezení se stále odchyluje.

Případy použití

Pracovní postupy, které OpenAI zdůraznil a které recenzenti většinou již otestovali:

  • Marketingové kreativy: bannerové reklamy, grafika pro sociální sítě, produktové mockupy ve více formátech z jediného promptu
  • Infografiky a prezentace: plnohodnotné vizuály s hustými informacemi, přesným malým textem, grafy a popisky dat
  • Storyboardy a prototypování her: konzistentní sekvence postav v 8 snímcích se sdíleným osvětlením a kontinuitou póz
  • Mangové a komiksové stránky: vícepanelové layouty s konzistentními postavami a čitelnými bubliny
  • Vzdělávací diagramy, mapy, vědecké ilustrace: přesné popisky, geografické prvky, měřítko
  • Mockupy uživatelských rozhraní a produktů: čitelný text rozhraní a realistické rozestupy komponent
  • Brandované QR kódy: kódy, které skutečně fungují, vložené do plně navržených plakátů
  • Lokalizované kreativy: plakáty, reklamy a obaly produktů v cílovém jazyce pro mezinárodní trhy
  • Redakční a knižní obaly: layouty s hustou typografií v nelatinském písmu

Pro agentury to sloučí tři nebo čtyři nástroje (generátor obrázků, layoutová aplikace, typografický editor, generátor QR kódů) do jednoho promptu. Pro individuální tvůrce je to rozdíl mezi tím, zda designéra potřebujete, nebo ne.

Proč Codex Labs byl spuštěn ve stejný den

OpenAI také 21. dubna spustilo Codex Labs, technický tréninkový a integrační servis pro organizace přijímající Codex. Spuštění ve stejný den není náhoda. Oba produkty signalizují stejný posun: OpenAI přechází od obecných chatovacích asistentů ke specializovaným agentům, kteří vlastní celé pracovní postupy. ChatGPT Images 2.0 vlastní smyčku vizuálního tvoření. Codex vlastní inženýrskou smyčku. Codex Labs je poradenské rameno, které pomáhá podnikům vše skutečně nasadit.

Tento vzorec, nasazení silného specializovaného modelu a pak služeb, které ho dostanou do produkce, uplatňují Anthropic a Google poslední rok. Že OpenAI dohání podnikovou stranu, je strategicky možná důležitější než samotný obrazový model.

Jak to vyzkoušet

Kompletní návod s formulemi promptů a případy použití pro učitele, studenty, marketéry a kancelářské pracovníky najdete v našem kompletním průvodci, jak používat ChatGPT Images 2.0.

  1. V ChatGPT nebo Codexu: otevřete nový chat a zadejte prompt. Bezplatní uživatelé mají k dispozici okamžitý režim. Uživatelé Plus a Pro mohou přepnout na model s uvažováním pro uvažování, vyhledávání na webu,….
  2. Na mobilu: aktualizujte na nejnovější verzi aplikace ChatGPT. Generátor obrázků nyní standardně používá Images 2.0.
  3. Přes API: použijte ID modelu gpt-image-2, nebo chatgpt-image-latest, pokud chcete alias sledující produkční verzi. Stejná struktura endpointů jako u gpt-image-1.
  4. Ve Fello AI: ChatGPT, Claude 4.6, Gemini 3 a DeepSeek v jedné lehké nativní aplikaci pro Mac, iPhone a iPad. Podpora GPT-Image-2 bude přidána v nadcházejících dnech. Vyzkoušejte Fello AI.

Závěrečné hodnocení

Úniky informací tento model podceňovaly. Předvydávací zvěsti se soustředily na vykreslování textu a poměry stran, které sice splnily, co slíbily. Nikdo ale nepředpovídal, že OpenAI připojí k obrazovému pipeline plnohodnotný model uvažování a zároveň vydá vyhledávání na webu, vlastní ověření, funkční QR kódy a konzistenci 8 obrázků. Tuto konzistenci jsme prakticky ověřili v sadě AI cestovních fotografií z devíti destinací vygenerovaných z jediné zdrojové selfie.

Poprvé obrazový model negeneruje jen pixely. Plánuje, zkoumá, navrhuje a opravuje. To je jiná kategorie nástroje a přetvoří pracovní postupy každého týmu, který vytváří vizuální obsah.