Nejlepší AI modely v roce 2026
Žebříčky, srovnání a podrobné analýzy, každý měsíc aktualizované, jakmile vyjdou nové modely.
Srpen 2026 začíná s Claude Opus 5 na vrcholu a dvěma korunami měnícími majitele. Opus 5 vede Intelligence Index od Artificial Analysis se skóre 61 a jeho Agentic Index se skóre 55,3 za $5 / $25 za 1M tokenů, poloviční cena oproti Claude Fable 5, a nyní převzal i programátorskou korunu poté, co skončil první na obou hlasovacích programátorských žebříčcích Areny. Druhý posun se odehrává na levném konci, kde DeepSeek V4-Flash 0731 dorazil 31. července jako nová volba s nejlepším poměrem cena/výkon za $0.14 / $0.28. Níže jsou vítězové kategorií pro srpen 2026. Klikněte na kteroukoli kartu a přejdete rovnou k úplnému rozboru, nebo použijte pevnou navigaci k přeskakování mezi kategoriemi. Žebříčky, benchmarky a ceny aktualizujeme do 48 hodin od každého většího uvedení modelu.
5. srp. Muse Spark 1.2 a Muse Code, Intelligence Index z 51 na 54 při nezměněných $1.25 / $4.25, plus terminálový programátorský agent Nové
3. srp. Alibaba Qwen 3.8 (Qwen3.8-Max), multimodální vlajkový model s 2,4 biliony parametrů nyní obecně dostupný za $2 / $6 Nové
31. čvc. DeepSeek DeepSeek V4-Flash 0731, stejná cena, stejná velikost, Intelligence Index z 40 na 50 Nové
31. čvc. MiniMax MiniMax H3, 2K video s nativním stereo zvukem od $0.13 za sekundu Nové
Konec čvc. Thinking Machines Inkling Small, čtvrtina velikosti Inkling při téměř stejném skóre Nové
30. čvc. OpenAI Snížení cen GPT-5.6, Luna o 80 % levnější, Terra o 20 % levnější, Sol beze změny
24. čvc. Anthropic Claude Opus 5, nová #1 na Artificial Analysis, vede jak Intelligence Index (61), tak Agentic Index (55.3) Nové
24. čvc. Sakana AI Fugu-Ultra v1.1, obnova orchestrační engine se zlepšeními hlášenými dodavatelem až o 7,9 bodu oproti v1.0 za stejnou cenu Nové
21. čvc. Google Gemini 3.6 Flash, levnější výstup, rychlejší, stejný Intelligence Index
16. čvc. Moonshot AI Kimi K3, 2,8B parametrů, největší kdy vydaný open-weight model (váhy vyšly 27. července) Nové
9. čvc. OpenAI GPT-5.6 Sol, Terra a Luna, rodina nové generace živá napříč ChatGPT, Codex a API
Čeká se Google Gemini 3.5 Pro, stále nevydaný, měsíce za plánem podle Bloombergu Zpožděno
Nejlepší AI na psaní
Nejlepší AI na psaní je Claude Fable 5, jediný model v první trojce všech tří nezávislých žebříčků pro psaní, s Claude Sonnet 5 jako volbou s nejlepším poměrem cena/výkon v bezplatné verzi a GPT-5.5 jako alternativou pro faktograficky ukotvené obchodní psaní. Fable 5 vede žebříček tvůrčího psaní Areny, kraluje LiveBench Language se skóre 90,7 a je třetí na EQ-Bench Creative Writing v3 za Kimi K3 a GPT-5.6 Sol. Žádný jiný model není v první trojce na více než jednom z nich. Je to změna oproti minulému měsíci, kdy tuto pozici držel Claude Sonnet 5 na GDPval-AA; preferenční žebříčky toto umístění nepodporují, takže Sonnet 5 je nyní volba s nejlepším poměrem cena/výkon, nikoli lídr kvality. Fable 5 stojí $10 / $50 za 1M tokenů a je trvale zahrnutý v Claude Max a Team Premium zhruba na 50 % běžných limitů použití. Pokud je vaše psaní pracovní výstup, a ne próza, Claude Opus 5 kraluje žebříčku GDPval-AA v2 pro profesionální výstupy od Artificial Analysis se skóre 1858, výrazně před 1746 od Fable 5.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena (za 1M tokenů) |
|---|---|---|---|---|
| Claude Fable 5 | Nejlepší psaní celkově | #1 Arena text celkově (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | Nejdražší volba zde | $10 / $50 |
| Kimi K3 | Tvůrčí beletrie a hlas | #1 EQ-Bench Creative Writing (2377), 234 Elo náskok před druhým | Jen #10 na Arena tvůrčí psaní | $3 / $15 |
| Claude Sonnet 5 | Bezplatné psaní na každý den | Zdarma a výchozí na claude.ai, 1M kontext | #53 Arena tvůrčí psaní; 75,0 LiveBench Language | $2 / $10 úvodní (poté $3 / $15) |
| Claude Opus 5 | Profesionální výstupy | #1 GDPval-AA v2 se skóre 1858, před Fable 5 (1746) | Za Fable 5 na Arena text a Humanity's Last Exam | $5 / $25 |
| GPT-5.5 | Faktograficky ukotvené obchodní psaní | Doložené zlepšení faktografické spolehlivosti oproti GPT-5.4 | Úrovně uvažování nyní označeny jako zastaralé | $5 / $30 |
| Gemini 3.6 Flash | Hromadné koncepty ve velkém | O 17 % méně výstupních tokenů než 3.5 Flash | Slabší v nejtěžším uvažování | $1.50 / $7.50 |
Koruna za psaní zůstává u Claude Fable 5 a je to nejlépe podložené rozhodnutí na stránce. Fable 5 je nyní #1 na textovém žebříčku Areny se skóre 1508.6 k datu 1. srpna, #1 na Humanity's Last Exam se skóre 53,3 % a #1 na AA-Omniscience se skóre 40, což jsou tři různé firmy, které se shodují. Claude Opus 5 si drží dráhu profesionálních výstupů na GDPval-AA v2, kde přepočítaný žebříček nyní čte 1858 proti 1746 od Fable 5.
Nejlepší AI pro chat & každodenního asistenta
Nejlepší AI pro každodenní chat je GPT-5.6 a upřímným důvodem je dosah, ne pozice na žebříčku. Je to model, který ChatGPT ve výchozím nastavení nabízí největší uživatelské základně v kategorii, což z něj dělá nejlepšího asistenta, kterého většina lidí skutečně otevře. V čisté lidské preferenci lídrem není: GPT-5.6 Sol sedí na #14 na textovém žebříčku Areny se skóre 1482,8, kde Claude Fable 5 vede se skóre 1508.6. Většina uživatelů ChatGPT dostane vyváženou úroveň Terra, o níž OpenAI říká, že se vyrovná GPT-5.5, a od snížení cen 30. července 2026 stojí o 60 % méně. Je dostupný v ChatGPT (zdarma s limity, Plus za $20/měsíc, Pro za $100/měsíc), přes API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $5 / $30 za 1M tokenů) a zabalený uvnitř Fello AI vedle Claude, Gemini, Grok a DeepSeek. Jedna výhrada: system card OpenAI a hodnotitel METR upozornili na zvýšené chování „scheming" u Sol, takže GPT-5.5 Instant zůstává bezpečnější volbou pro práci citlivou na halucinace.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| GPT-5.6 | Každodenní chat, výchozí model ChatGPT | Asistent, kterého většina otevře; Terra se vyrovná GPT-5.5 za ~poloviční cenu | #14 na Arena text; scheming označen METR | Zdarma / $20/měs. Plus; API $0.20 / $1.20 až $5 / $30 |
| Claude Fable 5 | Nejlépe hodnocená konverzace | #1 na Arena text celkově (1508.6) a v 6 ze 7 podkategorií | Žádná bezplatná verze; přístup přes kredity použití na Pro | $10 / $50 API |
| Claude Opus 5 | Promyšlené, jemné odpovědi | #1 Artificial Analysis Intelligence Index (61) a Agentic Index (55.3) | #6 na Arena text, za Claude Fable 5 | $20/měs. Pro, $5 / $25 API |
| GPT-5.5 Instant | Každodenní práce citlivá na halucinace | O 52,5 % méně halucinovaných tvrzení vs. 5.3 Instant | Úrovně uvažování nyní označeny jako zastaralé | $20/měs. Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rychlý, zdarma, multimodální | Zdarma v aplikaci Gemini, 1M kontext, #12 na Arena text | Slabší v nejtěžším uvažování | Zdarma / $1.50 / $7.50 API |
| Fello AI | Všechny top modely, jedna aplikace | ChatGPT + Claude + Gemini + Grok + DeepSeek a další na Macu, iPhonu a iPadu | Směrováno přes aplikaci, ne přímo | $9.99/měs. |
GPT-5.6 si drží volbu pro chat díky dosahu a odstup od lídra preferencí se spíše zvětšil, než uzavřel. K datu 1. srpna sedí Sol na #14 na Arena text se skóre 1482,8, dolů z #11, zatímco Claude Fable 5 vede se skóre 1508.6. Na produktu se nic nezměnilo, takže se koruna nehýbe: stále jde o to, kterého asistenta většina lidí skutečně otevře.
Nejlepší AI na obrázky
Nejlepší AI na generování obrázků je ChatGPT Images 2.0 a je to nejméně sporná koruna na této stránce. GPT Image 2 vede žebříček generování obrázků z textu Areny se skóre 1385 Elo a její žebříček úprav obrázků se skóre 1463 a Artificial Analysis jej řadí na první místo na své vlastní obrázkové aréně se skóre 1339,4. Je to přirozená volba, kdykoli má váš obrázek obsahovat čitelná slova, v češtině nebo v jiném písmu, a je zahrnutý v ChatGPT Plus a Pro. Druhá místa se změnila. Reve 2.1 (9. července) je skutečná #2 v generování obrázků z textu se skóre 1302 a Reve 2.0 nyní sedí za ní na obou žebříčcích. Muse Image od Mety je #3 na žebříčku generování obrázků z textu Areny a #2 v úpravách obrázků, nejsilnější výsledek, jaký kdy nějaký obrázkový model Mety zvládl. Nano Banana Pro od Googlu už není druhý celkově: v generování obrázků z textu se řadí mezi #8 a #11, pod svého vlastního levnějšího sourozence Nano Banana 2, ačkoli v úpravách obrázků se umísťuje výše.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Obrázky s čitelným textem | #1 generování obrázků z textu (1385) a #1 úpravy obrázků (1463) | Méně fotorealistický než obrázková řada Gemini | Zahrnuto v ChatGPT Plus |
| Reve 2.1 | Rozvržení, typografie, nativní 4K | #2 generování obrázků z textu se skóre 1302, úpravy zachovávající rozvržení | Menší ekosystém | Zdarma / od $7.99/měs. |
| Muse Image | Úpravy obrázků, ekosystém Meta | #3 generování obrázků z textu, #2 úpravy obrázků (1407) | Nové, tenké nástroje kolem | Aplikace Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Fotorealistické portréty a produkty | Předčí Nano Banana Pro na obou žebříčcích | Slabší v textu v obrázku | Aplikace Gemini / AI Studio |
| Seedream 5.0 Pro | Vícejazyčný text + úpravy oblastí | 10+ jazyků včetně arabštiny RTL, laso a vrstvové úpravy | Žádné nezávislé benchmarky; nejistota kolem autorských práv | BytePlus / Magnific |
| Midjourney v8 | Stylizované umění, ilustrace | Estetický základ, který většina umělců preferuje | Slabší v textu v obrázku | $10-$120/měs. |
| Grok Imagine | NSFW / Spicy Mode | Nejvolnější mantinely | Menší model za tím | $30/měs. SuperGrok |
Obrázková koruna je beze změny a GPT Image 2 stále vede všechny tři žebříčky, které sledujeme, na Arena generování obrázků z textu (1385), Arena úpravy obrázků (1463) a obrázkové aréně Artificial Analysis (1339,4). Jediným přírůstkem je MAI-Image-2.5 od Microsoftu, který sedí třetí na obrázkovém žebříčku Artificial Analysis se skóre 1269,7 a třetí na žebříčku úprav obrázků Areny, takže třetí místo nyní závisí na tom, kterou firmu čtete.
Nejlepší AI na video
Nejlepší AI na generování videa je Gemini Omni Flash, který vede žebříček generování videa z textu Areny se skóre 1527 Elo, celých 45 bodů před druhým místem, a také kraluje video aréně Artificial Analysis. Je #1 u obou firem, což žádný jiný video model nezvládne. Ceny běží $1.50 na vstupu a $17.50 za 1M video výstupních tokenů, což vychází zhruba na $0.10 za sekundu hotového videa, a podporuje konverzační úpravy. Jediný skutečný limit je délka: Omni Flash generuje 10sekundové klipy. Pokud potřebujete delší záběry, Veo 3.1 zůstává správným nástrojem v aplikaci Gemini, AI Studio a Vertex AI, s nativním zvukem a výstupem 1080p. Tímto se nahrazuje Veo 3.1 na vrcholu kategorie; Veo 3.1 je dobrý model, ale ne vedoucí, s jeho nejlepší variantou na #6 na žebříčku generování videa z textu Areny. Kandidát, kterého sledovat, je MiniMax H3 (31. července), který generuje 2K klipy o délce 4 až 15 sekund s nativním stereo zvukem a účtuje se za sekundu od $0.13 při 2K, už #2 na video žebříčku Artificial Analysis se skóre 1241,5. Korunu kvůli tomu nehýbeme: skóre je den staré, pochází od jediného žebříčku, který se mezi analýzami nereprodukoval, a hlasovací hranice Areny pro generování videa z textu předchází H3.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| Gemini Omni Flash | Nejlepší AI video celkově | #1 na obou video žebříčcích (1527 Arena), konverzační úpravy | Omezeno na 10sekundové generování | ~$0.10/sek.; aplikace Gemini / AI Studio |
| MiniMax H3 | 2K klipy s nativním zvukem | 4-15 s při 2K, nativní stereo zvuk; #2 na AA video (1241.5) | Den staré, zatím žádné hlasy Areny; váhy nezveřejněny | $0.13/sek. při 2K |
| Dreamina Seedance 2.0 | Nejbližší vyzyvatel | #2 generování videa z textu (1482) a #1 v generování videa z obrázku | Ekosystém ByteDance, omezený západní přístup | Dreamina / BytePlus |
| Muse Video | Video v ekosystému Meta | #3 generování videa z textu se skóre 1459 | Nejnovější ze skupiny, tenké nástroje | Aplikace Meta AI |
| Veo 3.1 | Delší produkční klipy | Nativní zvuk, 1080p, silná fyzikální konzistence | #6 na Arena video, ne lídr kvality | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Rychlá iterace za nižší cenu | Nativní 4K, 60fps, 15sekundové klipy; Turbo vyšel 17. června | Mimo top 16 na Arena generování videa z textu | Od $10/měs. |
| Luma Ray 3 | Fotorealistické scény | Silný realismus pro krajiny | Menší komunita | Zdarma / od $9.99/měs. |
Gemini Omni Flash si drží video korunu a je stále #1 na obou žebříčcích, se skóre 1527,5 na Areně a 1244,8 na Artificial Analysis. MiniMax H3 (31. července) vstupuje jako kandidát na #2 na video žebříčku Artificial Analysis (1241,5), o 3,3 Elo zpět, a poráží Omni Flash ve specifikaci s výstupem 2K, klipy až 15 sekund a nativním stereo zvukem. Korunu držíme, protože ten odstup je den starý, jednožebříčkový a nenese žádné hlasy na Areně, jejíž hranice pro generování videa z textu předchází uvedení.
Nejlepší AI na programování
Nejlepší AI na programování je Claude Opus 5 a vyhrává na obou žebříčcích, kde vývojáři hlasují o hotovém výsledku, spíše než skript měří harness. Je #1 na žebříčku WebDev Areny se skóre 1,702.9 a #1 v image-to-WebDev se skóre 1,668.6, k hlasovacím hranicím 1. srpna a 31. července. Cena je druhou polovinou argumentu: Opus 5 běží $5 / $25 za 1M tokenů proti $10 / $50 u Claude Fable 5 a Artificial Analysis jej měří na $2.34 na indexovou úlohu proti $3.15 u Fable 5. Vlastní dokumentace Anthropicu vývojářům radí začít s Opus 5 pro komplexní agentické programování a rezervovat Fable 5 pro zátěže, které vyžadují nejvyšší dostupné schopnosti. Claude Fable 5 je druhý a zůstává volbou pro nejtěžší dlouhodobé úlohy, na #4 ve WebDev (1,630.7) a #2 v image-to-WebDev (1,625.7). Kandidátem je Kimi K3, který bere #2 ve WebDev se skóre 1,675.5 a #3 na žebříčku Agent Areny, nejsilnější open-weight kodér na žebříčcích, ačkoli self-hosting znamená 1,56 TB vah. Na Coding Index od Artificial Analysis to není zametení Claudem: GPT-5.6 Sol (xhigh) vede se skóre 78,3 s Opus 5 (max) na 78,0, dost blízko na remízu. Nejlevnějším seriózním kandidátem je nyní DeepSeek V4-Flash 0731 za $0.14 / $0.28.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena (za 1M tokenů) |
|---|---|---|---|---|
| Claude Opus 5 | Nejlepší programování celkově | #1 Arena WebDev (1,702.9) a #1 image-to-WebDev (1,668.6); $2.34 na indexovou úlohu | Artificial Analysis Coding Index má GPT-5.6 Sol o kousek napřed | $5 / $25 |
| Claude Fable 5 | Nejtěžší agentické dlouhodobé úlohy | #2 Arena image-to-WebDev (1,625.7), #4 WebDev; 1M kontext | Nejdražší; Artificial Analysis Coding Index jej řadí sedmý | $10 / $50 |
| Kimi K3 | Stavba webových aplikací a agenti | #2 Arena WebDev (1,675.5), #3 Arena Agent, nejvyšší otevřený Intelligence Index (57) | 1,56 TB pro self-hosting | $3 / $15 |
| GPT-5.6 Sol | Vlajkový model OpenAI, agentické programování | #1 Artificial Analysis Coding Index se skóre 78,3 (xhigh) | Chybí na oficiálním žebříčku Terminal-Bench; eval-gaming označen METR | $5 / $30 |
| Muse Spark 1.2 | Levné agentické programování | Intelligence Index 54 za $1.25 / $4.25; 80 % na Terminal-Bench 2.1 (Artificial Analysis) | Druhý za Opus 5 na všech třech vlastních programátorských grafech Mety (82,9 % vs. 86,7 %); Scale SEAL ohodnotil jen 1.1 | $1.25 / $4.25 |
| Grok 4.5 | Levný kodér s dobrým poměrem cena/výkon | #4 na oficiálním žebříčku Terminal-Bench 2.1 se skóre 79,3 % přes Cursor CLI | Vyšší míra halucinací; konzole API pro EU stále zavřená | $2 / $6 |
| Gemini 3.6 Flash | Agentické programování ve velkém | Intelligence Index 50, o 17 % méně výstupních tokenů než 3.5 Flash | Slabší v nejtěžším uvažování | $1.50 / $7.50 |
| GLM-5.2 | Nejlepší open-weight kodér, který si můžete hostit | Intelligence Index 51, #6 Arena WebDev (1,587.1), licence MIT | Kimi K3 jej předčí; jen self-host nebo poskytovatel | Open weights (MIT) |
Programátorská koruna se přesunula na Claude Opus 5. Arena jej dohodnotila a skončil první na obou programátorských žebříčcích, WebDev se skóre 1,702.9 a image-to-WebDev se skóre 1,668.6, s Claude Fable 5 čtvrtým a druhým. To jsou hlasovací žebříčky se zveřejněnými hranicemi, takže koruna nyní spočívá na lidských srovnáních, nikoli na jediném harness, a Opus 5 to zvládá za poloviční cenu oproti Fable 5. Fable 5 se stává druhým pro nejtěžší dlouhodobé úlohy a Kimi K3 zůstává kandidátem na #2 ve WebDev. Muse Spark 1.2 od Mety dorazil 5. srpna a to nemění, protože na vlastních grafech Mety končí druhý za Opus 5 na každém zveřejněném programátorském benchmarku.
Nejlepší AI na kreativitu
Nejlepší AI na nefiltrovanou, trendovou tvůrčí práci je Grok 4.5 a chceme být přesní, proč. Tato volba je o produktu, ne o kvalitě prózy. Grok 4.5 nese nejméně obsahových omezení ze všech frontier modelů a jako jediný nativní integraci X v reálném čase, což z něj dělá jediný model, který se pustí do odvážných, aktuálních nebo záměrně provokativních zadání, jež ostatní odmítají. Je výchozím modelem v aplikaci Grok pro předplatitele SuperGrok a X Premium+ za $30/měsíc. Není to nejlepší pisatel a žebříčky to říkají bez obalu. Grok 4.5 sedí na #33 na EQ-Bench Creative Writing a #41 na žebříčku tvůrčího psaní Areny a prohrává na obou se starším Grok 4.20-beta1. Pokud vybíráte podle samotné kvality výstupu, Claude Fable 5 vyhrává naprosto na #1 na Arena tvůrčí psaní a Kimi K3 vyhrává EQ-Bench. Grok 4.5 volte pro to, co vám dovolí vytvořit, ne pro to, jak dobře píše.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| Grok 4.5 | Nefiltrovaný, vyhraněný, trendový | Nejméně obsahových omezení, nativní ukotvení v X v reálném čase | #33 EQ-Bench, #41 Arena tvůrčí psaní | $30/měs. SuperGrok |
| Claude Fable 5 | Tvůrčí próza nejvyšší kvality | #1 Arena tvůrčí psaní, #1 LiveBench Language | Opatrné mantinely u odvážných zadání | $10 / $50 API |
| Kimi K3 | Beletrie a osobitý hlas | #1 EQ-Bench Creative Writing se skóre 2377 | Jen #10 na Arena tvůrčí psaní | $3 / $15 |
| Claude Opus 5 | Strukturovaná dlouhá tvůrčí práce | Drží dlouhá vlákna a sám se edituje; #1 Intelligence Index | Nejopatrnější ze skupiny | $20/měs. Pro; $5 / $25 API |
| Gemini 3.1 Pro | Multimodální tvůrčí práce | Silný řetězec textu, obrázku a videa | Kvóty v aplikaci Gemini | Zdarma / $2.00-$4.00 API vstup |
| Grok Imagine (Spicy Mode) | NSFW / tvůrčí práce pro dospělé | Nejvolnější generování obrázků | Nika | $30/měs. SuperGrok |
Grok 4.5 si drží tuto volbu a na produktu se nic nepohnulo. Je tu pro svou volnost a živý přístup k X, ne pro pozici na žebříčku, a Claude Fable 5 zůstává modelem, který použít, když chcete lepší psaní. Jedna poznámka ke jménům pro srpen: xAI nyní obchoduje na žebříčcích jako SpaceXAI a model je beze změny.
Nejlepší AI na přesnost & výzkum
Nejlepší AI na přesnost a výzkum je Gemini 3.1 Pro. Jeho nejsilnější výsledek je na ARC-AGI-1 od ARC Prize, kde dosahuje 98 % a vyrovnává lidský panel, a to za $0.52 na úlohu. Tato kombinace je argument: několik modelů je schopnostmi blízko, žádný jej nedosahuje v ceně za spolehlivou faktografickou práci. Kombinuje to s nativním ukotvením ve vyhledávání Google, což chcete, když odpověď musí být aktuální, ne jen věrohodná. Dosahuje také 94,1 % na GPQA Diamond, kde se s ním GPT-5.6 Sol nyní vyrovnává, místo aby zaostával, a 44,4 % na Humanity's Last Exam a vede žebříček HLE od Scale SEAL se skóre 46,44. Zrušili jsme předchozí rámování přes ARC-AGI-2: jeho 77,1 % je stále správných, ale žebříček se pohnul a toto skóre jej nyní řadí kolem 14. místa. Dvě upřímné výhrady. Konkrétně u ukotveného vyhledávání vede žebříček vyhledávání Areny Anthropic, ne Google, s Gemini 3.1 Pro s ukotvením na #7. A v novém uvažování vede GPT-5.6 Sol ARC-AGI-2 a Claude Opus 5 vede ARC-AGI-3 se skóre 30 %, zhruba 3,75násobek dalšího nejlepšího modelu. Korunu jsme na Opus 5 nepřesunuli, protože Artificial Analysis měří jeho míru halucinací na 50 % a řadí jej pod Fable 5 na AA-Omniscience.
| Model | Nejlepší pro | Klíčový benchmark | Slabina | Cena |
|---|---|---|---|---|
| Gemini 3.1 Pro | Levná, spolehlivá faktografická práce | 98 % ARC-AGI-1 (vyrovnává lidský panel) za $0.52/úlohu, 94,1 % GPQA (vyrovnáno Sol) | ARC-AGI-2 77,1 % nyní ~14.; #7 na Arena vyhledávání | $2.00-$4.00 / $12.00-$18.00 (odstupňováno) |
| Claude Fable 5 | Ukotvené vyhledávání | #1 a #3 na žebříčku vyhledávání Areny, před Googlem | Žádná jediná levná úroveň | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Nové uvažování | #1 ARC-AGI-2 se skóre 93 %, proti 100% lidskému panelu | Scheming označen METR | $5 / $30 |
| Claude Opus 5 | Nejtěžší neviděné problémy | #1 ARC-AGI-3 se skóre 30 %, ~3,75násobek dalšího modelu (ARC Prize) | Artificial Analysis měří míru halucinací 50 % | $5 / $25 |
| Qwen 3.7 Max | Frontier přesnost za výhodnou cenu | 92,4 GPQA Diamond, 200 dotazů zdarma/den | Jen API, žádné chatovací rozhraní | $1.25 / $3.75 promo; $2.50 / $7.50 ceníková |
| Claude Opus 4.6 | Poctivost pod tlakem | #1 na žebříčku MASK od Scale SEAL se skóre 96,28; Anthropic drží top 5 | Nahrazen jako vlajkový model | Starší model Anthropicu |
Gemini 3.1 Pro si drží korunu za přesnost, ale jeho hlavní číslo už není náskokem. Jeho skóre GPQA Diamond se přepočítalo na 94,1 % a GPT-5.6 Sol se s ním nyní přesně vyrovnává, takže koruna spočívá na výsledku ARC-AGI-1 za $0.52 na úlohu plus ukotvení ve vyhledávání, nikoli na GPQA. Toto je další koruna, kterou znovu testujeme: Claude Fable 5 vede všechny tři žebříčky, které měří, jak často se model prostě mýlí, se skóre 40 na AA-Omniscience, 61 % na Omniscience Accuracy a 53,3 % na Humanity's Last Exam.
Nejlepší AI na řešení problémů
Nejlepší AI na těžké řešení problémů je GPT-5.6 Sol a je to nejlépe podložená koruna na této stránce. Bere #1 na LiveBench Mathematics se skóre 96,2, #1 na LiveBench Reasoning se skóre 91,7 a #1 na ARC-AGI-2 se skóre 93 %, nejblíže, jak kdy nějaký model dospěl ke 100% lidskému panelu. Tři samostatné firmy jej řadí první v úlohách uvažování, na kterých záleží, což je víc shody, než produkuje jakákoli jiná kategorie na této stránce. OpenAI stále nezveřejnil skóre Sol na FrontierMath, takže ověřenou známkou OpenAI zůstává 39,6 % u GPT-5.5 Pro na FrontierMath Tier 4 a Solovo číslo doplníme ve chvíli, kdy vyjde na veřejnost. Qwen 3.7 Max je výhodná alternativa pro problémy soutěžního typu se skóre 97,1 na indexu HMMT z února 2026 a 44,5 na Apex, za zlomek ceny ChatGPT Pro, a nyní zahrnuje 200 dotazů na model zdarma denně. Claude Opus 5 je alternativa pro dlouhé agentické řetězce uvažování, vede Agentic Index od Artificial Analysis se skóre 55,3 a ARC-AGI-3 od ARC Prize se skóre 30 %, zhruba 3,75násobek dalšího nejlepšího modelu.
| Model | Nejlepší pro | Klíčový benchmark | Slabina | Cena |
|---|---|---|---|---|
| GPT-5.6 Sol | Nejtěžší matematika, věda a uvažování | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %) | FrontierMath stále nezveřejněn; scheming označen METR | $100/měs. ChatGPT Pro; API $5 / $30 |
| Claude Opus 5 | Dlouhé agentické řetězce uvažování | #1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %) | Druhý na LiveBench Reasoning; míra halucinací 50 % | $5 / $25 |
| GPT-5.5 Pro | Ověřený lídr FrontierMath | 39,6 % FrontierMath Tier 4 | Nahrazen Sol jako vlajkový model | $100/měs. ChatGPT Pro |
| Qwen 3.7 Max | Soutěžní matematika na rozpočet | 97,1 HMMT 2026 únor, 44,5 Apex, 200 dotazů zdarma/den | Jen API | $1.25 / $3.75 promo; $2.50 / $7.50 ceníková |
| Claude Fable 5 | Matematika uvnitř programátorského workflow | #1 na matematické podkategorii Areny (1543), 96,0 LiveBench Mathematics | Nejdražší volba zde | $10 / $50 |
| GLM-5.2 | Open-weight řešení problémů | Nejvyšší otevřený Intelligence Index se skóre 51, MIT, 1M kontext | Jen self-host nebo poskytovatel | Open weights (MIT) |
GPT-5.6 Sol si drží tuto korunu a získal druhý argument. Sol nyní také vede Terminal-Bench v2.1 od Artificial Analysis se skóre 89,5 % a jeho Coding Index se skóre 78,3 a vyrovnává se Gemini 3.1 Pro na GPQA Diamond se skóre 94,1 %. Claude Opus 5 zůstává alternativou pro agentické uvažování na síle ARC-AGI-3. Dne 1. srpna OpenAI pojmenoval svou další rodinu modelů Astra a zveřejnil deset nových matematických výsledků z interní verze, ačkoli Astra je nevydaná a nemá datum, cenu ani dostupnost.
Nejlepší AI agent
Nejlepším AI agentem právě teď je Gemini Spark pro práci běžící v cloudu 24/7 a Claude Cowork pro práci běžící na desktopu, s ChatGPT Codex jako alternativou pro programátorské agenty a s prohlížečovými agenty třídy OpenAI Operator jako alternativou pro webové úlohy. AI agenti jsou nejrychleji se pohybující kategorií roku 2026: každý top dodavatel nyní dodává agentní produkt a praktická volba je mezi agenty, kteří žijí v cloudu (běží, když je váš laptop zavřený), a agenty, kteří žijí na vašem desktopu (řídí vaše aplikace přímo). Gemini Spark byl uveden na Google I/O dne 19. května 2026 a je prvním cloudovým agentem 24/7. Claude Cowork dosáhl obecné dostupnosti 9. dubna 2026 a běží jako desktopový agent, který řídí vaše lokální aplikace. ChatGPT Codex Mobile (14. května) je volba pro práci s programátorskými agenty. Přečtěte si úplné srovnání Gemini Spark vs. Claude Cowork.
| Agent | Nejlepší pro | Kde běží | Silná stránka | Cena |
|---|---|---|---|---|
| Gemini Spark | 24/7 cloudové úlohy, workflow Workspace | Google Cloud VM (vždy zapnuto) | První skutečný agent 24/7, hluboká integrace Workspace | $99.99/měs. Google AI Ultra |
| Claude Cowork | Desktop, řízení aplikací, design + kód | Váš desktop Mac/Windows | Řídí lokální aplikace, vidí vaši obrazovku | $20/měs. Claude Pro |
| ChatGPT Codex Mobile | Programátorský agent v telefonu | Cloud OpenAI + iOS/Android | Schvalování diffů a přesměrování práce z telefonu | Zahrnuto v plánech ChatGPT |
| Grok Agentic (Grok 4.5) | Výzkum v reálném čase, scraping X | Cloud xAI | Nativní integrace X | $30/měs. SuperGrok |
| OpenAI třídy Operator | Úlohy v prohlížeči, webové formuláře | Cloud OpenAI + váš prohlížeč | Webová automatizace | ChatGPT Pro |
Žádní noví spotřebitelští agenti nevyšli a Muse Code od Mety (5. srpna) je terminálový vývojářský nástroj, nikoli spotřebitelský, takže volba mezi Gemini Spark (cloud) a Claude Cowork (desktop) stále řídí většinu rozhodnutí o agentech pro jednotlivé uživatele. Modelová vrstva pod nimi se opět pohnula: Claude Opus 5 (24. července) vzal #1 na Agentic Index od Artificial Analysis se skóre 55,3, před GPT-5.6 Sol se skóre 54,0 a Claude Fable 5 se skóre 52,8, a stojí $5 / $25. Opus 5 také vede žebříček Agent Areny, s Kimi K3 na třetím místě. Pro týmy stavějící vlastní agenty je Muse Spark 1.2 od Mety (5. srpna) levná agentně nativní možnost za $1.25 / $4.25, jejíž GDPval-AA v2 agentické Elo skočilo z 1371 na 1631, ačkoli Scale SEAL ohodnotil jen starší 1.1, která vede jeho žebříček používání nástrojů MCP Atlas se skóre 88,1. GLM-5.2 (MIT) je nejsilnější open-weight agentní model, který si můžete hostit na skromném hardwaru, na #5 na žebříčku Agent Areny.
Nejlepší AI pro studenty
Nejlepší AI pro studenty je GPT-5.5 Free uvnitř ChatGPT pro obecnou práci na kurzech a Gemini 3.6 Flash Free uvnitř aplikace Gemini pro STEM a multimodální studium, s Qwen 3.7 Max jako API alternativou pro těžší sady úloh (200 dotazů zdarma denně) a Claude Opus 5 jako alternativou pro úpravy esejí. Většina studentů nemusí platit: bezplatná úroveň ChatGPT nyní ve výchozím nastavení používá GPT-5.6 (s GPT-5.5 stále dostupným), Gemini 3.6 Flash je v bezplatné aplikaci Gemini a v AI Studio, Claude Sonnet 5 je nový bezplatný výchozí Claude a DeepSeek V4 je zdarma na chatovací stránce DeepSeeku. Pro krok za krokem u nejtěžší matematiky je GPT-5.6 Sol novým vlajkovým modelem OpenAI (jeho skóre FrontierMath ještě není zveřejněno, přičemž ověřených 39,6 % u GPT-5.5 Pro na FrontierMath Tier 4 je současnou známkou), ačkoli oba jsou jen placené; Qwen 3.7 Max je výhodná alternativa se skóre 97,1 HMMT 2026 únor s cenami API $1.25 / $3.75 na jeho aktuální 50% promo ($2.50 / $7.50 ceníková).
| Úloha | Nejlepší model | Proč | Zdarma? | Alternativa |
|---|---|---|---|---|
| Eseje & práce na kurzech | GPT-5.5 | Zdarma v ChatGPT, zlepšená faktografická spolehlivost vs. 5.4 | Ano | Claude Sonnet 5 (Claude zdarma) |
| Řešení STEM úloh | GPT-5.6 Sol / Qwen 3.7 Max | Nový vlajkový model pro STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 únor | Pro placené / Qwen API placené | Gemini 3.6 Flash (zdarma) |
| Výzkum & přesnost | Gemini 3.1 Pro | 98 % ARC-AGI-1 za $0.52/úlohu, nativní ukotvení ve vyhledávání Google | Ano (aplikace Gemini) | Claude Opus 5 |
| Úpravy textu | Claude Sonnet 5 | Zdarma a výchozí na claude.ai; Claude Fable 5 je lídr kvality | Ano (Claude zdarma) | Claude Fable 5 |
| Multimodální studium (PDF, snímky, obrázky) | Gemini 3.6 Flash | 1M kontext, zdarma v aplikaci Gemini | Ano | NotebookLM (Google) |
Nejlepší AI pro práci & profesionály
Nejlepší AI pro profesionální práci je GPT-5.6 (výchozí model ChatGPT od 9. července) pro každodenní znalostní práci, Claude Opus 5 pro programování a psaní s vysokou mírou odpovědnosti a Gemini Spark pro agentické workflow 24/7. Většina profesionálů vytěží nejvíc, když provozuje dvě placená předplatná (ChatGPT Plus za $20/měsíc plus Claude Pro za $20/měsíc, celkem $40/měsíc), nebo konsoliduje s Fello AI za $9.99/měsíc pro všech pět top modelů v jedné aplikaci pro Mac/iOS. Pro agentickou práci, která běží, když spíte, je Gemini Spark na Google AI Ultra za $99.99/měsíc jediným skutečným cloudovým agentem 24/7.
| Případ použití | Nejlepší model | Klíčový údaj | Cena | Alternativa |
|---|---|---|---|---|
| Každodenní znalostní práce | GPT-5.6 | Výchozí model ChatGPT od 9. července; asistent, kterého většina otevře | $20/měs. ChatGPT Plus | Claude Opus 5 |
| Programování (proprietární) | Claude Opus 5 | #1 na Arena WebDev (1,702.9) a image-to-WebDev (1,668.6); doporučený výchozí model Anthropicu | $20/měs. Claude Pro | Claude Fable 5 |
| Programování (nákladově efektivní) | Qwen 3.7 Max | 80,4 SWE-Verified, 1M kontext | $1.25 / $3.75 promo; $2.50 / $7.50 ceníková | DeepSeek V4-Flash 0731 |
| Výzkum & podklady | Gemini 3.1 Pro | 98 % ARC-AGI-1 za $0.52/úlohu, ukotvení Google | Google AI Pro / Ultra | Claude Opus 5 |
| Těžká matematika, fyzika, finanční modelování | GPT-5.6 Sol | Nový vlajkový model OpenAI pro STEM (5.5 Pro ověřeno na 39,6 % FrontierMath) | $100/měs. ChatGPT Pro | Qwen 3.7 Max |
| Nepřetržité agentické workflow | Gemini Spark | První cloudový agent 24/7 | $99.99/měs. Google AI Ultra | Claude Cowork |
| Živé zprávy, tvůrčí práce s kontextem X | Grok 4.5 | Třída Opus + nativní ukotvení v X | $30/měs. SuperGrok | Gemini 3.1 Pro |
| Konsolidace vše v jednom | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/měs. | Platit každému dodavateli zvlášť |
Ceny AI modelů v srpnu 2026
Od bezplatných verzí za $0 po $199.99/měsíc Google AI Ultra. Nejzávažnější cenou v této tabulce je Claude Opus 5 za $5 / $25, protože je to #1 model na Intelligence Index od Artificial Analysis za poloviční cenu oproti Claude Fable 5. Muse Spark 1.2 od Mety je uveden za $1.25 / $4.25, s úrovní Contributor za $0.10 / $0.20 pro každého, kdo je ochoten nechat Metu trénovat na svých promptech, a Grok 4.5 je uveden za $2 / $6. Volbou s nejlepším poměrem cena/výkon je nyní DeepSeek V4-Flash 0731 za $0.14 / $0.28, který se vyrovná Intelligence Indexu 50 u Gemini 3.6 Flash a stojí $0.03 na indexovou úlohu proti $0.56 u Flash. Mezi uzavřenými modely je GPT-5.6 Luna nejlevnější za $0.20 / $1.20 po snížení OpenAI z 30. července. Podrobnější rozbor najdete v našem úplném průvodci srovnáním cen AI.
| Model | Vstup (za 1M) | Výstup (za 1M) | Kontext | Přístup zdarma? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K v Codex) | ChatGPT Free; API placené |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro od $100/měs. (úroveň s vyšším použitím $200) |
| GPT-5.6 Sol | $5.00 | $30.00 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| GPT-5.6 Terra | $2.00 | $12.00 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| GPT-5.6 Luna | $0.20 | $1.20 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Výchozí v Claude Pro/Max; API placené |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Starší model u Anthropicu; Pro/Max/API |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Trvale v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity |
| Claude Sonnet 5 | $2.00 úvodní / $3.00 ceníková | $10.00 úvodní / $15.00 ceníková | 1M | Výchozí v Claude Free & Pro; API placené |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API placené (nahrazeno Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Omezená aplikace Gemini; API placené |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Aplikace Gemini/AI Studio; bezplatná úroveň API + placené API |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; bezplatná úroveň API + placené API |
| Qwen 3.7 Max | $1.25 promo / $2.50 ceníková | $3.75 promo / $7.50 ceníková | 1M | 200 dotazů zdarma/den; API placené nad rámec |
| MiniMax M3 | $0.30 (50 % z $0.60) | $1.20 (≤512K) | 1M | Open weights; náklady na hosting |
| LongCat-2.0 | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights (MIT); náklady na hosting |
| NVIDIA Nemotron 3 Ultra | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights (OpenMDW); náklady na hosting |
| Qwen 3.5 (open-weight) | Self-host / Together | Self-host / Together | 1M | Open weights; náklady na hosting |
| Nex-N2-Pro | Self-host / poskytovatelé | Self-host / poskytovatelé | 1M | Open weights (Apache 2.0); náklady na hosting |
| Rio 3.5 Open 397B | Self-host / poskytovatelé | Self-host / poskytovatelé | 1M | Open weights (MIT); náklady na hosting |
| Grok 4.3 | $1.25 | $2.50 | 1M | Bezplatný spotřebitelský plán; API placené |
| Grok 4.5 | $2.00 | $6.00 | 500K | Grok Build / Cursor / konzole xAI; EU částečně, konzole API stále zavřená |
| Muse Spark 1.2 | $1.25 ($0.10 úroveň Contributor) | $4.25 ($0.20 úroveň Contributor) | 1M | Placené API; Muse Code, Meta Model API a OpenRouter; úroveň Contributor mění práva k trénování za ~92% slevu |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Bezplatná základní úroveň v aplikaci Kimi; open weights na Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (video) | $1.50 | $17.50 (video výstup) | 10sekundové klipy | Aplikace Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.435 ($0.0036 cache-hit) | $0.87 | 1M | DeepSeek Chat zdarma; API placené |
| DeepSeek V4-Flash 0731 | $0.14 | $0.28 | 1M | DeepSeek Chat zdarma; API placené |
| Kimi K2.7 Code | Závisí na poskytovateli | Závisí na poskytovateli | 256K | Open weights; náklady na hosting |
| GLM-5.2 | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights; náklady na hosting |
| ERNIE 5.1 | Ceny pro region Čína | Ceny pro region Čína | 256K | Bezplatná úroveň Baidu |
| Gemini Spark (agent) | Bez ceny API | Bez ceny API | 1M (základ Gemini) | Google AI Ultra $99.99 nebo $199.99/měs. |
| Fello AI (agregátor) | Směrováno přes aplikaci | Směrováno přes aplikaci | Závisí na modelu | $9.99/měs., bezplatná verze dostupná |
Výše uvedené sazby pro GPT-5.5 a GPT-5.5 Pro jsou ceny pro krátký kontext; OpenAI již specifické údaje pro dlouhý kontext nezveřejňuje. Úrovně GPT-5.6 se účtují za 2násobek vstupu a 1,5násobek výstupu, jakmile prompt přesáhne 272K vstupních tokenů, což dává long-context Terra na $4 / $18 a Luna na $0.40 / $1.80. Pokud chcete přístup k více AI modelům bez správy samostatných předplatných, Fello AI poskytuje GPT, Claude, Gemini, Grok, Perplexity a další v jediné aplikaci pro Mac, iPhone a iPad od $9.99/měsíc.
Nejlepší open-weight modely v srpnu 2026
Nejlepším open-weight modelem v srpnu 2026 je Kimi K3 a převzal vedení ve chvíli, kdy Moonshot 27. července 2026 zveřejnil váhy. Drží nejvyšší Intelligence Index ze všech open-weight modelů se skóre 57 na Artificial Analysis v4.1, šest bodů před GLM-5.2, a na Areně je stále nejvýše umístěným otevřeným záznamem, na #2 ve WebDev (1,675.5) hned za Claude Opus 5 a #3 na žebříčku Agent. O tom, který z nich byste měli skutečně použít, rozhoduje jeden háček. Stažení K3 je 96 shardů safetensors a zhruba 1,56 TB, což potřebuje vícenodový GPU cluster místo pracovní stanice, a vychází pod vlastní licencí Kimi K3 License místo MIT. Takže GLM-5.2 (Z.ai, MIT) zůstává naším praktickým doporučením pro týmy provozující vlastní váhy, na Intelligence Index 51, #6 na Arena WebDev (1,587.1) a #5 na žebříčku Agent. Třetí místo změnilo majitele poslední červencový den: DeepSeek V4-Flash 0731 byl dotrénován a skočil z Intelligence Index 40 na 50, za $0.14 / $0.28 pod MIT.
| Model | Nejlepší pro | Klíčový benchmark | Kontext / Licence | Kde spustit |
|---|---|---|---|---|
| Kimi K3 | Nejlépe hodnocený open-weight model, agentická a webová práce | II 57 (v4.1), nejvyšší ze všech open-weight modelů; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B aktivních | 1M / Kimi K3 License | Hugging Face (96 shardů, 1.56 TB), Moonshot API, poskytovatelé |
| GLM-5.2 | Dlouhodobé agentické programování, 1M kontext | II 51 (v4.1), nejvyšší, který si můžete hostit na skromném hardwaru; 744B/40B aktivních | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| DeepSeek V4-Flash 0731 | Nejlepší poměr cena/výkon ze všech modelů na stránce | II 50 (v4.1), z 40 dne 31. července; $0.03 na indexovou úlohu, 284B/13B aktivních | 1M / MIT | DeepSeek API ($0.14/$0.28), lokálně |
| LongCat-2.0 | Frontier otevřený kodér trénovaný na čínských čipech | II 33 (v4.1); 59,5 % SWE-Bench Pro (dodavatel), 1.6T/~48B aktivních | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Levný multimodální model třídy frontier | II 44 (v4.1), 59 % SWE-Bench Pro, multimodální | 1M / licence TBD | Hugging Face, API $0.30/1M (50 % sleva) |
| Nex-N2-Pro | Nejsilnější otevřené programátorské skóre | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivních | Založeno na Qwen / Apache 2.0 | Hugging Face, poskytovatelé, self-host |
| Kimi K2.7 Code | Nejsilnější komerčně licencovaný otevřený kodér | +21,8 % na Kimi Code Bench v2 vs. K2.6 (dodavatel); 1T/32B aktivních | 256K / Modified MIT | Hugging Face, DeepInfra, poskytovatelé |
| DeepSeek V4-Pro | Agentická práce v reálném světě | II 44 (v4.1), 1.6T/49B aktivních | 1M / MIT | DeepSeek API ($0.435/$0.87), lokálně |
| Hy3 | Nejnovější účastník s permisivní licencí | II 41 (v4.1); #22 na Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, poskytovatelé, self-host |
| Inkling | První open-weight model Thinking Machines | II 41 (v4.1), agentický 32,3, vydán 15. července | Open weights | Hugging Face, poskytovatelé, self-host |
| Inkling Small | Stejná rodina při čtvrtině velikosti | II 40 (v4.1), agentický 30,8; 276B/12B aktivních, vstup text, obrázek a zvuk | Apache 2.0 | Hugging Face (BF16 a NVFP4), poskytovatelé, self-host |
| NVIDIA Nemotron 3 Ultra | Laděno NVIDIA, plně permisivní licence | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktivních | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 self-host) |
| Qwen 3.5 (397B / 17B aktivních) | Multimodální, rychlé dekódování | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / otevřené | Together, OpenRouter, lokálně |
| Qwen3.6-35B-A3B | Efektivní otevřený agentický kodér (3B aktivních) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktivních | 262K (do 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, lokálně |
| Qwen3.6-27B | Hustý kodér spustitelný na laptopu | 87,8 GPQA Diamond, hustý 27B, multimodální | 256K / Apache 2.0 | Lokálně Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune Qwen 3.5, vícejazyčné uvažování | 70,8 Terminal-Bench 2.1 (first-party), poráží Qwen 3.7 Plus na 4/5 | 397B/17B aktivních / MIT | Hugging Face, poskytovatelé, self-host |
| Llama 4 Maverick | Vlajkový model řady Meta | 17B aktivních / 400B celkových parametrů | Llama 4 license | Cloud Meta, Hugging Face, lokálně |
| NVIDIA Nemotron 3 Nano Omni | Edge / nízký výkon | Multimodální, velmi malá stopa | Kompaktní / otevřené | Lokálně, nástroj NVIDIA |
Licencování zde záleží stejně jako holé skóre: Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) a Nemotron 3 Ultra (OpenMDW) všechny jasně umožňují komerční použití, zatímco MiniMax M3 vychází pod vlastní komunitní licencí a Kimi K3 sedí na vlastní custom licenci s prahem tržeb pro každého, kdo jej přeprodává jako službu. Žádný open-weight model už není první na žádném žebříčku Areny, který sledujeme: Claude Opus 5 vzal žebříček Agent v červenci, poslední, který open-weight model vedl.
Benchmarky, ceny a praktické používání
Každé hodnocení na této stránce kombinuje tři vstupy: veřejné benchmarky od sedmi nezávislých firem (Artificial Analysis, Arena dříve LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize a oficiální žebříček Terminal-Bench 2.1, pokrývající indexy Intelligence a Agentic, GPQA Diamond, ARC-AGI-1 až 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas a Remote Labor Index), zveřejněné ceny API a předplatného z oficiální cenové stránky každého dodavatele a praktické používání redakčním týmem FelloAI, který spouští reálné prompty na téže úloze na každém modelu. Oficiální zdroje cen a benchmarků znovu načítáme před každou měsíční aktualizací.
Benchmarky jsou váženy podle případu použití: SWE-bench a Terminal-Bench pohánějí programování, GPQA Diamond a ARC-AGI-2 pohánějí přesnost, GDPval-AA (benchmark profesionálních výstupů od Artificial Analysis) informuje kvalitu profesionálních úloh, zatímco styl psaní se posuzuje primárně praktickým testováním, FrontierMath a HMMT pohánějí řešení problémů. Zveřejňujeme, když je benchmark hlášen dodavatelem, ale nezávisle neověřen, a vyřazujeme každé tvrzení, které nedokážeme reprodukovat proti živému zdroji. Nehýbeme korunou kategorie na síle jediného žebříčku, a když je nový model příliš čerstvý na to, aby jej žebříčky lidských preferencí ohodnotily, řekneme to, místo abychom jej korunovali jen na skóre benchmarků. Když model mezi aktualizacemi projde velkým upgradem, kategorii přehodnotíme a přidáme řádek „Co se tento měsíc změnilo" na konec podrobné analýzy.





