Po týdnech úniku informací a pozorování na LM Areně OpenAI vydalo ChatGPT Images 2.0 dne 21. dubna 2026. Základní model, gpt-image-2, je dostupný v ChatGPT, v Codexu a přes API. Pokud je pro vás cena důležitější než výkon, porovnejte nejlepší bezplatné generátory AI obrázků.
Jde o první obrazový model OpenAI s vestavěným uvažováním, první, který umí vykreslovat hustý text v japonštině, korejštině, čínštině, hindštině a bengálštině, a první, který dokáže před nakreslením jediného pixelu prohledávat web. Navíc posouvá generování AI obrázků za fázi „nástěnky s inspirací" do oblasti, kde výsledky lze skutečně používat jako produkční podklady.
Co je skutečně nové
ChatGPT Images 2.0 nahrazuje obrazový pipeline GPT-4o, který poháněl ChatGPT poslední rok. Znalostní cutoff je prosinec 2025, takže model správně vykresluje aktuální loga značek, produktové designy, geografické mapy a nedávné kulturní reference, se kterými si starší model neporadil nebo uvíznul na verzi z roku 2024.
OpenAI ho označuje za interaktivní kreativní engine, ne za jednorázový generátor. To je podstatné, protože uvažování, vyhledávání na webu a generování obrázků nyní běží v jedné smyčce a model dokáže výstup upřesnit ve více průchodech v rámci jednoho požadavku, aniž byste museli začínat od nuly.
Konkrétní vylepšení:
- Rozlišení až 2K (2 048 pixelů na šířku) na výstup
- Poměry stran od 3:1 do 1:3, plynule, bez pevně daných předvoleb
- Až 8 konzistentních obrázků z jednoho promptu se sdílenými postavami, osvětlením a stylem
- Funkční QR kódy, které načte jakýkoli fotoaparát telefonu
- Vyhledávání na webu při generování
- Vlastní ověření před výstupem
- Export s průhledným pozadím pro přímé začlenění do pipeline
- Ostrý malý text, prvky rozhraní, ikonografie a husté kompozice
Kódová označení LM Areny „maskingtape" a „gaffertape" se ukázala být ranými testovacími variantami. „Duct tape" byl okamžitou variantou. „Packingtape" byl build s režimem uvažování.
Proč bylo vykreslování textu tak obtížné
Tři roky nakládal každý velký obrazový model s textem jako s určitou texturou. Model se naučil, „jak vypadají písmena", aniž by chápal, co konkrétní slova znamenají jako glyfy. Proto GPT-4o, Midjourney V7 i DALL-E 3 produkovaly plakáty se zkomoleným textem „WELCOOMM" místo „WELCOME" a proto husté layouty (jídelní lístky, infografiky, obaly produktů) skončily jako nesmysl.

ChatGPT Images 2.0 pracuje s textem jako s prvkem první třídy. Recenzenti ho testovali na jídelních lístcích, konferenčních visačkách, obalech produktů a redakčních layoutech. Model zachovává typografii, kerning, hierarchii a správné pravopisné znění. Nadpisy zůstávají ostré ve 2K. Malé popisky jsou čitelné. Kódy SKU, data, ceny a štítky odpovídají promptu, místo aby se automaticky opravovaly na zdánlivě smysluplný nesmysl.
Tato změna posouvá generování AI obrázků od „dost dobré pro nástěnku s náladou" k „dost dobré pro skutečný výstup".

Režim uvažování
ChatGPT Images 2.0 nabízí dva režimy.
Okamžitý režim generuje rychle s důrazem na rychlost. Zahrnuje veškerá vylepšení vykreslování textu a vícejazyčné podpory. Tento režim dostávají všichni uživatelé jako výchozí.
Režim uvažování přidává před generováním průchod uvažováním. Model může prohledávat web, analyzovat materiály, které nahrajete (PDF, snímky obrazovky, pravidla značky), promyslet layout před kreslením, vygenerovat až 8 konzistentních výstupů a zkontrolovat vlastní výstupy ještě před jejich vrácením. U složitého promptu to může trvat až dvě minuty, zatímco okamžitý režim odpoví za sekundy.
To umožňuje stránkové mangové sekvence, víceobrázkové storyboardy a kompletní infografiky, které od spuštění zaplavují sociální sítě. Průchod uvažováním je také důvod, proč prompt jako „navrhni 4 snímky prezentace vysvětlující kvantové tunelování" skutečně vytvoří 4 koherentní snímky s konzistentním designem, místo 4 nesouvisejících obrázků, které mají jen společné téma.

Režim uvažování je část spuštění, kterou nikdo příliš neočekával. Jde v podstatě o model uvažování se štětcem.
Funkční QR kódy a proč na nich záleží
QR kódy vypadají jako kouzelnický trik, dokud nepochopíte, co dokazují. QR kód je přesné matematické kódování. Jeden špatný čtverec a kód nelze naskenovat. Každý předchozí obrazový model produkoval obrázky ve tvaru QR kódu, které ve skutečnosti nefungovaly.
ChatGPT Images 2.0 generuje funkční QR kódy, protože průchod uvažováním v režimu uvažování před kreslením skutečně kódování vypočítá. Model navíc dokáže QR nastylovat barvami značky, vložit logo do středu a umístit ho do plně navrženého plakátu. Marketingové týmy, které dříve potřebovaly generátor QR kódů, designéra a layoutový nástroj pro jeden reklamní podklad, nyní vše zvládnou jedním promptem.
Signalizuje to také, co architektura zvládne za hranicemi obrázků. Vše, co vyžaduje přesnost místo jen přibližnosti, vědecké diagramy, technická schémata, přesné mapy, se stává reálným.
Rozlišení a poměry stran
| Specifikace | GPT Image 1 (GPT-4o) | ChatGPT Images 2.0 |
|---|---|---|
| Maximální rozlišení | 1024 x 1024 | 2048 x 2048 (2K) |
| Poměry stran | 1:1, 2:3, 3:2 | 3:1 až 1:3 (plynule) |
| Obrázků na prompt | 1 | Až 8 |
| Přístup na web | Ne | Ano (uvažování) |
| Vlastní ověření | Ne | Ano (uvažování) |
| Znalostní cutoff | říjen 2024 | prosinec 2025 |
| Průhledná pozadí | Omezeno | Ano |
Rozsah 3:1 až 1:3 pokrývá široké bannery, prezentační snímky, plakáty, Stories, miniatury i svislé formáty TikToku, vše ze stejného modelu bez nutnosti zvětšování nebo ořezu. Odpadá tak zdlouhavý postup „vygeneruj čtvercový obrázek, ořízni v Photoshopu, ztratíš polovinu kompozice", který byl standardem od dob DALL-E 2.

Vícejazyčný text
OpenAI výslovně zmínilo japonštinu, korejštinu, čínštinu, hindštinu a bengálštinu jako jazyky s výrazným pokrokem. Recenzenti to ověřili a výsledky vypadají jako nativní text, ne jako nesmyslné znaky, které produkovaly všechny předchozí obrazové modely.
Hlubší změnou je práce se smíšenými písmy. Model dokáže vykreslit japonský plakát s latinskými názvy produktů, arabský jídelní lístek se západními cenami nebo čínský filmový titulek přes anglický název. Layouty se smíšenými písmy byly ve všech komerčních obrazových modelech dosud nefunkční.



Pro neanglofonní trhy jde o první AI obrazový model použitelný pro produkci mimo latinskou abecedu. Bengálská, hindská a devanágarská typografie byly v DALL-E 3 a Midjourney prakticky nepoužitelné.


Ceny a API
API pro gpt-image-2 je dostupné. Ceny jsou založeny na tokenech:
| Typ tokenu | Cena |
|---|---|
| Vstupní tokeny obrázků | $8 za milion |
| Výstupní tokeny obrázků | $30 za milion |
Výsledná cena za obrázek závisí na úrovni kvality a rozlišení. Odhadované ceny za obrázek při standardním rozlišení 1024 x 1024:
| Úroveň kvality | Cena za obrázek |
|---|---|
| Nízká | ~$0.006 |
| Střední | ~$0.053 |
| Vysoká | ~$0.211 |
Výstupy ve 2K stojí více v poměru k dalším tokenům. Jsou k dispozici dvě rozhraní API: Image API (ID modelu gpt-image-2) pro jednorázové generování a úpravy, a Responses API s generováním obrázků jako vestavěným nástrojem. Vývojáři, kteří chtějí, aby jejich aplikace sledovala produkční verzi ChatGPT, mohou použít alias chatgpt-image-latest, který se automaticky aktualizuje.
Některé účty API budou před zpřístupněním endpointů potřebovat ověření organizace OpenAI.
Dostupnost podle předplatného
| Úroveň uživatele | Standardní | Režim uvažování |
|---|---|---|
| Bezplatný ChatGPT | Ano | Ne |
| ChatGPT Plus | Ano | Ano |
| ChatGPT Pro | Ano | Ano (nejvyšší limity) |
| ChatGPT Business | Ano | Ano |
| ChatGPT Enterprise | Ano | Ano |
| Uživatelé Codexu | Ano | Ano |
| API (gpt-image-2) | Ano | Ano |
Spuštění v mobilní verzi probíhá prostřednictvím nejnovější aktualizace aplikace ChatGPT. DALL-E zůstává v ChatGPT k dispozici, ale je nyní prezentováno jako sekundární volba pro uživatele se stávajícími knihovnami promptů nebo specifickými stylovými potřebami, kde se DALL-E osvědčuje.
Srovnání s konkurencí
Praktické srovnání od VentureBeat, TechCrunch a TechRadar ukazuje toto:
| Schopnost | ChatGPT Images 2.0 | Midjourney V8 | Nano Banana Pro | Flux 2 |
|---|---|---|---|---|
| Fotorealismus | Výborný | Výborný | Velmi dobrý | Výborný |
| Vykreslování textu | Nejlepší ve třídě | Dobrý | Velmi dobrý | Dobrý |
| Vícejazyčný text | Nejlepší ve třídě | Omezený | Dobrý | Omezený |
| Uvažování před generováním | Ano | Ne | Ne | Ne |
| Vyhledávání na webu | Ano | Ne | Ne | Ne |
| Konzistence více obrázků | Až 8 | Omezená | Až 4 | Omezená |
| Maximální rozlišení | 2K | 2K (zvětšeno) | ~1,5K | 2K |
| Přístup přes API | Ano | Ne | Ano | Ano |
ChatGPT Images 2.0 vede v přesnosti textu, vícejazyčné podpoře a pracovních postupech s uvažováním. Midjourney má stále navrch u určitých stylizovaných estetik, zvláště malířského a ilustrativního stylu, kde vyniká jeho starší dataset laděný na preference. Nano Banana Pro je v fotorealismu blíže, než se čekalo, a stále vítězí na čistou rychlost. Flux zůstává nejsilnější open source volbou pro týmy, které potřebují vlastní hostování. Pokud si nejste jistí, zda je výsledek skutečný, zde je návod, jak poznat, zda byl obrázek vygenerován AI.




Výsledky Image Areny
Den po spuštění zveřejnil Arena.ai výsledky žebříčku a jsou přesvědčivé. GPT-Image-2 obsadil 1. místo ve všech kategoriích Image Areny s největšími náskoky, jaké kdy platforma zaznamenala:
| Kategorie | Skóre GPT-Image-2 | Náskok před 2. místem |
|---|---|---|
| Text-to-Image (celkově) | 1512 | +242 před Nano-banana-2 |
| Úprava jednoho obrázku | 1513 | +125 před Nano-banana-pro |
| Úprava více obrázků | 1464 | +90 před Nano-banana-2 |
Náskok +242 bodů v kategorii Text-to-Image je největší mezera, jakou Arena kdy zaznamenala. Pro srovnání: aktualizace modelů obvykle posunou žebříček o 30 až 60 bodů.
GPT-Image-2 také ovládl všech 7 podkategorií Text-to-Image a porazil svého přímého předchůdce GPT-Image-1.5 s výraznými náskoky:
- Product, Branding & Commercial Design: +277 bodů
- 3D Imaging & Modeling: +274 bodů
- Cartoon, Anime & Fantasy: +296 bodů
- Photorealistic & Cinematic Imagery: +247 bodů
- Art: +197 bodů
- Portraits: +296 bodů
- Text Rendering: +316 bodů
Skok +316 bodů v kategorii Text Rendering je hlavní číslo a potvrzuje, co recenzenti říkali neformálně. Model se v oblasti textu nezlepšil jen postupně. Posunul celý strop.
Modely, které porazil: Nano-banana-2, varianty Nano-Banana-Pro, MAI-Image-2, Reve-V1.5 a Grok-Imagine-Image.
Co model stále neumí
Ne vše je vyřešeno. Recenzenti upozornili na několik nedostatků:
- Výběrové úpravy oblasti jsou nepřesné. Při maskování konkrétní oblasti a požadavku na změnu může úprava přesahovat mimo masku. Pro přesné práce je zatím spolehlivější psaný prompt popisující požadovanou změnu než prostorový výběr.
- Režim uvažování je pomalý. Dvě minuty u složitého promptu jsou pro produkci přijatelné, ale pro běžné prozkoumávání to nevyhovuje. Většina uživatelů zůstane pro každodenní prompty v okamžitém režimu.
- Vysoce stylizovaná ilustrace. Malířská estetika Midjourney má stále navrch u redakční ilustrace a knižních obalů, kde záleží více na náladě než na přesnosti.
- Živé video a animace. Jde o model pro statické obrázky. Pohyb řeší samostatně Sora.
- Konzistence vizuální identity značky v dlouhých sezeních. Osm obrázků z jednoho promptu je konzistentních. Dvacet obrázků z více sezení se stále odchyluje.
Případy použití
Pracovní postupy, které OpenAI zdůraznil a které recenzenti většinou již otestovali:
- Marketingové kreativy: bannerové reklamy, grafika pro sociální sítě, produktové mockupy ve více formátech z jediného promptu
- Infografiky a prezentace: plnohodnotné vizuály s hustými informacemi, přesným malým textem, grafy a popisky dat
- Storyboardy a prototypování her: konzistentní sekvence postav v 8 snímcích se sdíleným osvětlením a kontinuitou póz
- Mangové a komiksové stránky: vícepanelové layouty s konzistentními postavami a čitelnými bubliny
- Vzdělávací diagramy, mapy, vědecké ilustrace: přesné popisky, geografické prvky, měřítko
- Mockupy uživatelských rozhraní a produktů: čitelný text rozhraní a realistické rozestupy komponent
- Brandované QR kódy: kódy, které skutečně fungují, vložené do plně navržených plakátů
- Lokalizované kreativy: plakáty, reklamy a obaly produktů v cílovém jazyce pro mezinárodní trhy
- Redakční a knižní obaly: layouty s hustou typografií v nelatinském písmu
Pro agentury to sloučí tři nebo čtyři nástroje (generátor obrázků, layoutová aplikace, typografický editor, generátor QR kódů) do jednoho promptu. Pro individuální tvůrce je to rozdíl mezi tím, zda designéra potřebujete, nebo ne.
Proč Codex Labs byl spuštěn ve stejný den
OpenAI také 21. dubna spustilo Codex Labs, technický tréninkový a integrační servis pro organizace přijímající Codex. Spuštění ve stejný den není náhoda. Oba produkty signalizují stejný posun: OpenAI přechází od obecných chatovacích asistentů ke specializovaným agentům, kteří vlastní celé pracovní postupy. ChatGPT Images 2.0 vlastní smyčku vizuálního tvoření. Codex vlastní inženýrskou smyčku. Codex Labs je poradenské rameno, které pomáhá podnikům vše skutečně nasadit.
Tento vzorec, nasazení silného specializovaného modelu a pak služeb, které ho dostanou do produkce, uplatňují Anthropic a Google poslední rok. Že OpenAI dohání podnikovou stranu, je strategicky možná důležitější než samotný obrazový model.




Jak to vyzkoušet
Kompletní návod s formulemi promptů a případy použití pro učitele, studenty, marketéry a kancelářské pracovníky najdete v našem kompletním průvodci, jak používat ChatGPT Images 2.0.
- V ChatGPT nebo Codexu: otevřete nový chat a zadejte prompt. Bezplatní uživatelé mají k dispozici okamžitý režim. Uživatelé Plus a Pro mohou přepnout na model s uvažováním pro uvažování, vyhledávání na webu,….
- Na mobilu: aktualizujte na nejnovější verzi aplikace ChatGPT. Generátor obrázků nyní standardně používá Images 2.0.
- Přes API: použijte ID modelu
gpt-image-2, nebochatgpt-image-latest, pokud chcete alias sledující produkční verzi. Stejná struktura endpointů jako ugpt-image-1. - Ve Fello AI: ChatGPT, Claude 4.6, Gemini 3 a DeepSeek v jedné lehké nativní aplikaci pro Mac, iPhone a iPad. Podpora GPT-Image-2 bude přidána v nadcházejících dnech. Vyzkoušejte Fello AI.
Závěrečné hodnocení
Úniky informací tento model podceňovaly. Předvydávací zvěsti se soustředily na vykreslování textu a poměry stran, které sice splnily, co slíbily. Nikdo ale nepředpovídal, že OpenAI připojí k obrazovému pipeline plnohodnotný model uvažování a zároveň vydá vyhledávání na webu, vlastní ověření, funkční QR kódy a konzistenci 8 obrázků. Tuto konzistenci jsme prakticky ověřili v sadě AI cestovních fotografií z devíti destinací vygenerovaných z jediné zdrojové selfie.
Poprvé obrazový model negeneruje jen pixely. Plánuje, zkoumá, navrhuje a opravuje. To je jiná kategorie nástroje a přetvoří pracovní postupy každého týmu, který vytváří vizuální obsah.