Beste KI-Modelle 2026
Rankings, Vergleiche und ausführliche Analysen, monatlich aktualisiert, sobald neue Modelle erscheinen.
Der August 2026 beginnt mit Claude Opus 5 an der Spitze, und zwei Kronen wechseln den Besitzer. Opus 5 führt den Intelligence Index von Artificial Analysis mit 61 und den Agentic Index mit 55,3 an, bei $5 / $25 pro 1M Tokens, halb so teuer wie Claude Fable 5, und hat jetzt auch die Programmierkrone übernommen, nachdem es auf beiden abstimmungsbasierten Coding-Boards von Arena den ersten Platz belegt hat. Der zweite Wechsel spielt sich am günstigen Ende ab: DeepSeek V4-Flash 0731 erschien am 31. Juli als neuer Preis-Leistungs-Tipp bei $0.14 / $0.28. Unten stehen die Kategoriesieger für August 2026. Klicke auf eine beliebige Karte, um direkt zur vollständigen Aufschlüsselung zu springen, oder nutze die feste Navigation, um zwischen den Kategorien zu wechseln. Rankings, Benchmarks und Preise werden innerhalb von 48 Stunden nach jedem größeren Modellstart aktualisiert.
5. Aug. Muse Spark 1.2 und Muse Code, Intelligence Index von 51 auf 54 bei unverändert $1.25 / $4.25, plus ein Terminal-Coding-Agent Neu
3. Aug. Alibaba Qwen 3.8 (Qwen3.8-Max), 2,4 Billionen Parameter starkes multimodales Flaggschiff jetzt allgemein verfügbar bei $2 / $6 Neu
31. Juli DeepSeek DeepSeek V4-Flash 0731, gleicher Preis, gleiche Größe, Intelligence Index von 40 auf 50 Neu
31. Juli MiniMax MiniMax H3, 2K-Video mit nativem Stereoton ab $0.13 pro Sekunde Neu
Ende Juli Thinking Machines Inkling Small, ein Viertel der Größe von Inkling bei nahezu gleichem Wert Neu
30. Juli OpenAI GPT-5.6 Preissenkung, Luna 80 % günstiger, Terra 20 % günstiger, Sol unverändert
24. Juli Anthropic Claude Opus 5, neue #1 auf Artificial Analysis, führt sowohl den Intelligence Index (61) als auch den Agentic Index (55.3) an Neu
24. Juli Sakana AI Fugu-Ultra v1.1, Auffrischung der Orchestrierungs-Engine mit vom Anbieter gemeldeten Zuwächsen von bis zu 7,9 Punkten gegenüber v1.0 zum gleichen Preis Neu
21. Juli Google Gemini 3.6 Flash, günstigerer Output, schneller, gleicher Intelligence Index
16. Juli Moonshot AI Kimi K3, 2,8B Parameter, das größte je veröffentlichte Open-Weight-Modell (Gewichte am 27. Juli erschienen) Neu
9. Juli OpenAI GPT-5.6 Sol, Terra und Luna, Next-Gen-Familie live in ChatGPT, Codex und der API
Ausstehend Google Gemini 3.5 Pro, weiterhin unveröffentlicht, laut Bloomberg Monate hinter dem Zeitplan Verzögert
Beste KI zum Schreiben
Die beste KI zum Schreiben ist Claude Fable 5, das einzige Modell in den Top drei aller drei unabhängigen Schreib-Boards, mit Claude Sonnet 5 als Preis-Leistungs-Tipp der Gratisversion und GPT-5.5 als Alternative für faktenbasiertes Business-Schreiben. Fable 5 führt Arenas Creative-Writing-Leaderboard an, ist mit 90,7 Spitzenreiter bei LiveBench Language und belegt Platz drei auf EQ-Bench Creative Writing v3 hinter Kimi K3 und GPT-5.6 Sol. Kein anderes Modell ist auf mehr als einem davon in den Top drei. Das ist eine Änderung gegenüber dem letzten Monat, als Claude Sonnet 5 diesen Platz bei GDPval-AA hielt; die Präferenz-Boards stützen diese Platzierung nicht, also ist Sonnet 5 jetzt der Preis-Leistungs-Tipp statt der Qualitätsführer. Fable 5 kostet $10 / $50 pro 1M Tokens und ist dauerhaft in Claude Max und Team Premium bei rund 50 % der regulären Nutzungslimits enthalten. Wenn dein Text ein Arbeits-Deliverable statt Prosa ist, holt sich Claude Opus 5 das GDPval-AA v2 Board für professionelle Deliverables von Artificial Analysis mit 1858, deutlich vor den 1746 von Fable 5.
| Modell | Am besten für | Stärke | Schwäche | Preis (pro 1M Tokens) |
|---|---|---|---|---|
| Claude Fable 5 | Bestes Schreiben insgesamt | #1 Arena Text insgesamt (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | Teuerste Option hier | $10 / $50 |
| Kimi K3 | Kreative Fiktion und Stimme | #1 EQ-Bench Creative Writing (2377), 234 Elo Vorsprung auf Platz zwei | Nur #10 auf Arena Creative Writing | $3 / $15 |
| Claude Sonnet 5 | Kostenloses Alltagsschreiben | Kostenlos und Standard auf claude.ai, 1M Kontext | #53 Arena Creative Writing; 75,0 LiveBench Language | $2 / $10 Einführung (dann $3 / $15) |
| Claude Opus 5 | Professionelle Deliverables | #1 GDPval-AA v2 mit 1858, vor Fable 5 (1746) | Hinter Fable 5 bei Arena Text und Humanity's Last Exam | $5 / $25 |
| GPT-5.5 | Faktenbasiertes Business-Schreiben | Dokumentierte Zuwächse bei faktischer Verlässlichkeit gegenüber GPT-5.4 | Reasoning-Stufen jetzt als veraltet markiert | $5 / $30 |
| Gemini 3.6 Flash | Massen-Entwürfe in großem Umfang | 17 % weniger Output-Tokens als 3.5 Flash | Schwächer beim schwersten Reasoning | $1.50 / $7.50 |
Die Schreibkrone bleibt bei Claude Fable 5, und es ist die am besten belegte Entscheidung auf der Seite. Fable 5 ist jetzt #1 auf Arenas Text-Leaderboard mit 1508.6 zum Stichtag 1. August, #1 auf Humanity's Last Exam mit 53,3 % und #1 auf AA-Omniscience mit 40, was drei verschiedene Häuser übereinstimmend bestätigen. Claude Opus 5 behält die Spur der professionellen Deliverables auf GDPval-AA v2, wo das neu justierte Board jetzt 1858 gegen die 1746 von Fable 5 liest.
Beste KI für Chat & täglichen Assistenten
Die beste KI für den täglichen Chat ist GPT-5.6, und der ehrliche Grund ist Reichweite statt Board-Position. Es ist das Modell, das ChatGPT der größten Nutzerbasis der Kategorie standardmäßig ausliefert, was es zum besten Assistenten macht, den die meisten Menschen tatsächlich öffnen können. Bei der reinen menschlichen Präferenz ist es nicht der Spitzenreiter: GPT-5.6 Sol sitzt mit 1482,8 auf #14 von Arenas Text-Leaderboard, wo Claude Fable 5 mit 1508.6 führt. Die meisten ChatGPT-Nutzer bekommen die ausgewogene Terra-Stufe, von der OpenAI sagt, sie entspreche GPT-5.5 und koste seit der Preissenkung vom 30. Juli 2026 60 % weniger. Es ist verfügbar in ChatGPT (kostenlos mit Limits, Plus zu $20/Monat, Pro zu $100/Monat), über die API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $5 / $30 pro 1M Tokens) und gebündelt in Fello AI neben Claude, Gemini, Grok und DeepSeek. Ein Vorbehalt: OpenAIs System Card und der Prüfer METR meldeten erhöhtes „Scheming"-Verhalten in Sol, sodass GPT-5.5 Instant der sicherere Tipp für halluzinationsempfindliche Arbeit bleibt.
| Modell | Am besten für | Stärke | Schwäche | Preis |
|---|---|---|---|---|
| GPT-5.6 | Täglicher Chat, ChatGPTs Standard | Der Assistent, den die meisten öffnen können; Terra entspricht GPT-5.5 zu ~halbem Preis | #14 auf Arena Text; Scheming von METR gemeldet | Kostenlos / $20/Mon. Plus; API $0.20 / $1.20 bis $5 / $30 |
| Claude Fable 5 | Am höchsten bewertete Konversation | #1 auf Arena Text insgesamt (1508.6) und in 6 von 7 Unterkategorien | Keine Gratisversion; Zugang über Nutzungscredits auf Pro | $10 / $50 API |
| Claude Opus 5 | Durchdachte, differenzierte Antworten | #1 Artificial Analysis Intelligence Index (61) und Agentic Index (55.3) | #6 auf Arena Text, hinter Claude Fable 5 | $20/Mon. Pro, $5 / $25 API |
| GPT-5.5 Instant | Halluzinationsempfindliche Alltagsarbeit | 52,5 % weniger halluzinierte Aussagen vs. 5.3 Instant | Reasoning-Stufen jetzt als veraltet markiert | $20/Mon. Plus; API $5 / $30 |
| Gemini 3.6 Flash | Schnell, kostenlos, multimodal | Kostenlos in der Gemini-App, 1M Kontext, #12 auf Arena Text | Schwächer beim schwersten Reasoning | Kostenlos / $1.50 / $7.50 API |
| Fello AI | Alle Top-Modelle, eine App | ChatGPT + Claude + Gemini + Grok + DeepSeek und mehr auf Mac, iPhone und iPad | Über die App geroutet, nicht direkt | $9.99/Mon. |
GPT-5.6 behält den Chat-Tipp aufgrund seiner Reichweite, und der Abstand zum Präferenzführer wuchs eher, als dass er sich schloss. Zum Stichtag 1. August sitzt Sol mit 1482,8 auf #14 bei Arena Text, herunter von #11, während Claude Fable 5 mit 1508.6 führt. Am Produkt änderte sich nichts, also bewegt sich die Krone nicht: Es geht weiterhin darum, welchen Assistenten die meisten Menschen tatsächlich öffnen können.
Beste KI für Bilder
Die beste KI für die Bildgenerierung ist ChatGPT Images 2.0, und es ist die unumstrittenste Krone auf dieser Seite. GPT Image 2 führt Arenas Text-zu-Bild-Board mit 1385 Elo und sein Bildbearbeitungs-Board mit 1463 an, und Artificial Analysis setzt es mit 1339,4 an die Spitze seiner eigenen Bild-Arena. Es ist die naheliegende Wahl, wann immer dein Bild lesbare Wörter enthalten soll, auf Deutsch oder in einer anderen Schrift, und es ist in ChatGPT Plus und Pro enthalten. Die Zweitplatzierten haben sich geändert. Reve 2.1 (9. Juli) ist die echte #2 bei Text-zu-Bild mit 1302, und Reve 2.0 liegt jetzt auf beiden Boards dahinter. Metas Muse Image ist #3 auf Arenas Text-zu-Bild-Board und #2 bei der Bildbearbeitung, das stärkste Abschneiden, das je ein Meta-Bildmodell geschafft hat. Googles Nano Banana Pro ist nicht mehr der Zweitplatzierte insgesamt: Bei Text-zu-Bild rangiert es zwischen #8 und #11, unter seinem eigenen günstigeren Geschwistermodell Nano Banana 2, obwohl es bei der Bildbearbeitung höher platziert.
| Modell | Am besten für | Stärke | Schwäche | Preis |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Bilder mit lesbarem Text | #1 Text-zu-Bild (1385) und #1 Bildbearbeitung (1463) | Weniger fotorealistisch als die Gemini-Bildreihe | In ChatGPT Plus enthalten |
| Reve 2.1 | Layout, Typografie, natives 4K | #2 Text-zu-Bild mit 1302, layouterhaltende Bearbeitung | Kleineres Ökosystem | Kostenlos / ab $7.99/Mon. |
| Muse Image | Bildbearbeitung, Meta-Ökosystem | #3 Text-zu-Bild, #2 Bildbearbeitung (1407) | Neu, dünnes Tooling drumherum | Meta-AI-App |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Fotorealistische Porträts und Produkte | Übertrifft Nano Banana Pro auf beiden Boards | Schwächer bei Text im Bild | Gemini-App / AI Studio |
| Seedream 5.0 Pro | Mehrsprachiger Text + Regionenbearbeitung | 10+ Sprachen inkl. Arabisch RTL, Lasso- und Ebenenbearbeitung | Keine unabhängigen Benchmarks; Urheberrechts-Wolke | BytePlus / Magnific |
| Midjourney v8 | Stilisierte Kunst, Illustration | Ästhetische Basis, die die meisten Künstler bevorzugen | Schwächer bei Text im Bild | $10-$120/Mon. |
| Grok Imagine | NSFW / Spicy Mode | Freizügigste Leitplanken | Kleineres Modell dahinter | $30/Mon. SuperGrok |
Die Bildkrone ist unverändert und GPT Image 2 führt weiterhin alle drei Boards an, die wir verfolgen, auf Arena Text-zu-Bild (1385), Arena Bildbearbeitung (1463) und Artificial Analysis' Bild-Arena (1339,4). Die eine Ergänzung ist Microsofts MAI-Image-2.5, das auf dem Bild-Board von Artificial Analysis mit 1269,7 auf Platz drei sitzt und auf Arenas Bildbearbeitungs-Board Platz drei belegt, sodass der dritte Platz jetzt davon abhängt, welches Haus du liest.
Beste KI für Video
Die beste KI für die Videogenerierung ist Gemini Omni Flash, das Arenas Text-zu-Video-Board mit 1527 Elo anführt, ganze 45 Punkte vor dem zweiten Platz, und außerdem Artificial Analysis' Video-Arena anführt. Es ist #1 bei beiden Häusern, was kein anderes Videomodell schafft. Die Preise laufen bei $1.50 Input und $17.50 pro 1M Video-Output-Tokens, was auf etwa $0.10 pro Sekunde fertiges Video hinausläuft, und es unterstützt dialogbasierte Bearbeitung. Die eine echte Grenze ist die Länge: Omni Flash generiert 10-Sekunden-Clips. Wenn du längere Aufnahmen brauchst, bleibt Veo 3.1 das richtige Werkzeug in der Gemini-App, in AI Studio und Vertex AI, mit nativem Ton und 1080p-Output. Das ersetzt Veo 3.1 an der Spitze der Kategorie; Veo 3.1 ist ein gutes Modell, aber nicht das führende, mit seiner besten Variante auf #6 von Arenas Text-zu-Video-Board. Der zu beobachtende Kandidat ist MiniMax H3 (31. Juli), das 2K-Clips von 4 bis 15 Sekunden mit nativem Stereoton generiert und pro Sekunde ab $0.13 bei 2K abgerechnet wird, bereits #2 auf dem Video-Board von Artificial Analysis mit 1241,5. Wir bewegen die Krone deswegen nicht: Der Wert ist einen Tag alt, kommt vom einzigen Board, das zwischen den Auswertungen nicht reproduziert hat, und Arenas Text-zu-Video-Abstimmungsstichtag liegt vor H3.
| Modell | Am besten für | Stärke | Schwäche | Preis |
|---|---|---|---|---|
| Gemini Omni Flash | Beste KI-Videos insgesamt | #1 auf beiden Video-Boards (1527 Arena), dialogbasierte Bearbeitung | Deckelt bei 10-Sekunden-Generierungen | ~$0.10/Sek.; Gemini-App / AI Studio |
| MiniMax H3 | 2K-Clips mit nativem Ton | 4-15 s bei 2K, nativer Stereoton; #2 auf AA Video (1241.5) | Einen Tag alt, noch keine Arena-Stimmen; Gewichte nicht veröffentlicht | $0.13/Sek. bei 2K |
| Dreamina Seedance 2.0 | Engster Herausforderer | #2 Text-zu-Video (1482) und #1 bei Bild-zu-Video | ByteDance-Ökosystem, eingeschränkter westlicher Zugang | Dreamina / BytePlus |
| Muse Video | Video im Meta-Ökosystem | #3 Text-zu-Video mit 1459 | Neuestes der Gruppe, dünnes Tooling | Meta-AI-App |
| Veo 3.1 | Längere Produktions-Clips | Nativer Ton, 1080p, starke physikalische Konsistenz | #6 auf Arena Video, nicht der Qualitätsführer | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Schnelle Iteration zu niedrigeren Kosten | Natives 4K, 60fps, 15-Sekunden-Clips; Turbo am 17. Juni erschienen | Außerhalb der Top 16 auf Arena Text-zu-Video | Ab $10/Mon. |
| Luma Ray 3 | Fotorealistische Szenen | Starker Realismus für Landschaften | Kleinere Community | Kostenlos / ab $9.99/Mon. |
Gemini Omni Flash behält die Videokrone und ist weiterhin #1 auf beiden Boards, mit 1527,5 auf Arena und 1244,8 auf Artificial Analysis. MiniMax H3 (31. Juli) tritt als Kandidat auf #2 auf dem Video-Board von Artificial Analysis (1241,5) ein, 3,3 Elo dahinter, und schlägt Omni Flash bei den Spezifikationen mit 2K-Output, Clips bis 15 Sekunden und nativem Stereoton. Wir halten die Krone, weil dieser Abstand einen Tag alt, einbrettrig ist und keine Stimmen auf Arena trägt, dessen Text-zu-Video-Stichtag vor dem Launch liegt.
Beste KI zum Programmieren
Die beste KI zum Programmieren ist Claude Opus 5, und es gewinnt auf den beiden Boards, wo Entwickler über das fertige Ergebnis abstimmen statt ein Skript ein Harness zu messen. Es ist #1 auf Arenas WebDev-Board mit 1,702.9 und #1 bei image-to-WebDev mit 1,668.6, zu den Abstimmungsstichtagen 1. August und 31. Juli. Der Preis ist die zweite Hälfte des Arguments: Opus 5 läuft mit $5 / $25 pro 1M Tokens gegen die $10 / $50 von Claude Fable 5, und Artificial Analysis misst es mit $2.34 pro Index-Aufgabe gegen die $3.15 von Fable 5. Anthropics eigene Dokumentation rät Entwicklern, für komplexes agentisches Programmieren mit Opus 5 zu beginnen und Fable 5 für Workloads zu reservieren, die die höchste verfügbare Leistung brauchen. Claude Fable 5 ist der Zweitplatzierte und bleibt der Tipp für die schwerste Long-Horizon-Arbeit, auf #4 bei WebDev (1,630.7) und #2 bei image-to-WebDev (1,625.7). Der Kandidat ist Kimi K3, das #2 bei WebDev mit 1,675.5 und #3 auf Arenas Agent-Board belegt, der stärkste Open-Weight-Coder auf den Boards, wobei Selbst-Hosting 1,56 TB Gewichte bedeutet. Auf dem Coding Index von Artificial Analysis ist es kein Claude-Durchmarsch: GPT-5.6 Sol (xhigh) führt mit 78,3 vor Opus 5 (max) mit 78,0, nah genug, um es einen Gleichstand zu nennen. Der günstigste ernsthafte Kandidat ist jetzt DeepSeek V4-Flash 0731 bei $0.14 / $0.28.
| Modell | Am besten für | Stärke | Schwäche | Preis (pro 1M Tokens) |
|---|---|---|---|---|
| Claude Opus 5 | Bestes Programmieren insgesamt | #1 Arena WebDev (1,702.9) und #1 image-to-WebDev (1,668.6); $2.34 pro Index-Aufgabe | Artificial Analysis Coding Index hat GPT-5.6 Sol eine Spur voraus | $5 / $25 |
| Claude Fable 5 | Schwerste agentische Long-Horizon-Arbeit | #2 Arena image-to-WebDev (1,625.7), #4 WebDev; 1M Kontext | Teuerstes; Artificial Analysis Coding Index setzt es auf Platz 7 | $10 / $50 |
| Kimi K3 | Web-App-Bau und Agenten | #2 Arena WebDev (1,675.5), #3 Arena Agent, höchster offener Intelligence Index (57) | 1,56 TB zum Selbst-Hosten | $3 / $15 |
| GPT-5.6 Sol | OpenAI-Flaggschiff, agentisches Programmieren | #1 Artificial Analysis Coding Index mit 78,3 (xhigh) | Fehlt auf dem offiziellen Terminal-Bench-Board; Eval-Gaming von METR gemeldet | $5 / $30 |
| Muse Spark 1.2 | Günstiges agentisches Programmieren | Intelligence Index 54 bei $1.25 / $4.25; 80 % auf Terminal-Bench 2.1 (Artificial Analysis) | Zweiter hinter Opus 5 auf allen drei von Metas eigenen Coding-Charts (82,9 % vs. 86,7 %); Scale SEAL hat nur 1.1 bewertet | $1.25 / $4.25 |
| Grok 4.5 | Günstiger Preis-Leistungs-Coder | #4 auf dem offiziellen Terminal-Bench-2.1-Board mit 79,3 % über Cursor CLI | Höhere Halluzinationsrate; EU-API-Konsole weiterhin geschlossen | $2 / $6 |
| Gemini 3.6 Flash | Agenten-Programmieren in großem Umfang | Intelligence Index 50, 17 % weniger Output-Tokens als 3.5 Flash | Schwächer beim schwersten Reasoning | $1.50 / $7.50 |
| GLM-5.2 | Bester Open-Weight-Coder, den du hosten kannst | Intelligence Index 51, #6 Arena WebDev (1,587.1), MIT-Lizenz | Kimi K3 übertrifft es; nur Selbst-Host oder Anbieter | Open weights (MIT) |
Die Programmierkrone ging an Claude Opus 5. Arena beendete die Bewertung, und es kam auf beiden Coding-Boards zuerst, WebDev mit 1,702.9 und image-to-WebDev mit 1,668.6, mit Claude Fable 5 auf Platz vier und zwei. Das sind abstimmungsbasierte Boards mit veröffentlichten Stichtagen, sodass die Krone jetzt auf menschlichen Vergleichen statt auf einem einzelnen Harness ruht, und Opus 5 schafft das zum halben Preis von Fable 5. Fable 5 wird zum Zweitplatzierten für die schwerste Long-Horizon-Arbeit, und Kimi K3 bleibt der Kandidat auf #2 bei WebDev. Metas Muse Spark 1.2 erschien am 5. August und ändert das nicht, weil es auf Metas eigenen Charts bei jedem veröffentlichten Coding-Benchmark hinter Opus 5 auf Platz zwei landet.
Beste KI für Kreativität
Die beste KI für ungefilterte, angesagte kreative Arbeit ist Grok 4.5, und wir wollen genau sein, warum. Dieser Tipp geht um das Produkt, nicht um die Prosa-Qualität. Grok 4.5 trägt die wenigsten Inhaltsbeschränkungen aller Frontier-Modelle und als Einziges die native Echtzeit-X-Integration, was es zum einen Modell macht, das sich auf kantige, aktuelle oder bewusst provokante Briefings einlässt, die die anderen ablehnen. Es ist Standard in der Grok-App für SuperGrok- und X-Premium+-Abonnenten zu $30/Monat. Es ist nicht der beste Schreiber, und die Boards sagen es unverblümt. Grok 4.5 sitzt auf #33 bei EQ-Bench Creative Writing und #41 auf Arenas Creative-Writing-Leaderboard und verliert bei beiden gegen das ältere Grok 4.20-beta1. Wenn du allein nach Output-Qualität wählst, gewinnt Claude Fable 5 klar auf #1 bei Arena Creative Writing, und Kimi K3 gewinnt EQ-Bench. Wähle Grok 4.5 für das, was es dich erschaffen lässt, nicht dafür, wie gut es schreibt.
| Modell | Am besten für | Stärke | Schwäche | Preis |
|---|---|---|---|---|
| Grok 4.5 | Ungefiltert, meinungsstark, angesagt | Wenigste Inhaltsbeschränkungen, native Echtzeit-X-Grundierung | #33 EQ-Bench, #41 Arena Creative Writing | $30/Mon. SuperGrok |
| Claude Fable 5 | Kreative Prosa höchster Qualität | #1 Arena Creative Writing, #1 LiveBench Language | Vorsichtige Leitplanken bei kantigen Briefings | $10 / $50 API |
| Kimi K3 | Fiktion und markante Stimme | #1 EQ-Bench Creative Writing mit 2377 | Nur #10 auf Arena Creative Writing | $3 / $15 |
| Claude Opus 5 | Strukturierte Langform-Kreativität | Hält lange Threads und lektoriert sich selbst; #1 Intelligence Index | Vorsichtigstes der Gruppe | $20/Mon. Pro; $5 / $25 API |
| Gemini 3.1 Pro | Multimodal kreativ | Starke Text-, Bild- und Videokette | Quoten in der Gemini-App | Kostenlos / $2.00-$4.00 API Input |
| Grok Imagine (Spicy Mode) | NSFW / kreativ für Erwachsene | Freizügigste Bildgenerierung | Nischen-Anwendungsfall | $30/Mon. SuperGrok |
Grok 4.5 behält diesen Tipp, und am Produkt bewegte sich nichts. Es ist hier für seine Freizügigkeit und seinen Live-X-Zugang, nicht für die Board-Position, und Claude Fable 5 bleibt das Modell der Wahl, wenn du das bessere Schreiben willst. Ein Namenshinweis für August: xAI firmiert auf den Leaderboards jetzt als SpaceXAI, und das Modell ist unverändert.
Beste KI für Genauigkeit & Recherche
Die beste KI für Genauigkeit und Recherche ist Gemini 3.1 Pro. Sein stärkstes Ergebnis liegt auf ARC-AGI-1 vom ARC Prize, wo es 98 % erzielt und mit dem menschlichen Panel gleichzieht, und das bei $0.52 pro Aufgabe. Diese Kombination ist das Argument: Mehrere Modelle sind bei der Leistung nah dran, keines erreicht es bei den Kosten für verlässliche faktische Arbeit. Es kombiniert das mit nativer Google-Search-Grundierung, was du willst, wenn die Antwort aktuell statt bloß plausibel sein muss. Es erzielt außerdem 94,1 % auf GPQA Diamond, wo GPT-5.6 Sol jetzt gleichzieht statt zurückzuliegen, und 44,4 % auf Humanity's Last Exam, und führt Scale SEALs HLE-Board mit 46,44 an. Wir haben die vorherige ARC-AGI-2-Rahmung fallen gelassen: Seine 77,1 % sind weiterhin korrekt, aber das Board hat sich bewegt, und dieser Wert platziert es jetzt um Platz 14. Zwei ehrliche Vorbehalte. Bei grundierter Suche speziell wird Arenas Such-Leaderboard von Anthropic angeführt, nicht von Google, wobei Gemini 3.1 Pro mit Grundierung auf #7 liegt. Und bei neuartigem Reasoning führt GPT-5.6 Sol ARC-AGI-2 an, und Claude Opus 5 führt ARC-AGI-3 mit 30 % an, rund 3,75-mal so viel wie das nächstbeste Modell. Wir haben die Krone nicht an Opus 5 gegeben, weil Artificial Analysis seine Halluzinationsrate mit 50 % misst und es auf AA-Omniscience unter Fable 5 setzt.
| Modell | Am besten für | Schlüssel-Benchmark | Schwäche | Preis |
|---|---|---|---|---|
| Gemini 3.1 Pro | Günstige, verlässliche faktische Arbeit | 98 % ARC-AGI-1 (Gleichstand mit dem menschlichen Panel) bei $0.52/Aufgabe, 94,1 % GPQA (von Sol egalisiert) | ARC-AGI-2 77,1 % rangiert jetzt ~14.; #7 auf Arena Search | $2.00-$4.00 / $12.00-$18.00 (gestaffelt) |
| Claude Fable 5 | Grundierte Suche | #1 und #3 auf Arenas Such-Leaderboard, vor Google | Keine einzelne günstige Stufe | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Neuartiges Reasoning | #1 ARC-AGI-2 mit 93 %, gegen ein 100-%-Menschen-Panel | Scheming von METR gemeldet | $5 / $30 |
| Claude Opus 5 | Schwerste unbekannte Probleme | #1 ARC-AGI-3 mit 30 %, ~3,75-mal das nächste Modell (ARC Prize) | Artificial Analysis misst eine Halluzinationsrate von 50 % | $5 / $25 |
| Qwen 3.7 Max | Frontier-Genauigkeit zum Preis-Leistungs-Verhältnis | 92,4 GPQA Diamond, 200 kostenlose Anfragen/Tag | Nur API, kein Chat-Frontend | $1.25 / $3.75 Promo; $2.50 / $7.50 Liste |
| Claude Opus 4.6 | Ehrlichkeit unter Druck | #1 auf Scale SEALs MASK-Board mit 96,28; Anthropic hält die Top 5 | Als Flaggschiff abgelöst | Legacy-Anthropic-Modell |
Gemini 3.1 Pro behält die Genauigkeitskrone, doch seine Kopfzahl ist keine Führung mehr. Sein GPQA-Diamond-Wert wurde auf 94,1 % neu justiert, und GPT-5.6 Sol zieht jetzt exakt gleich, sodass die Krone auf dem ARC-AGI-1-Ergebnis bei $0.52 pro Aufgabe plus Search-Grundierung ruht statt auf GPQA. Das ist die nächste Krone, die wir neu testen: Claude Fable 5 führt alle drei Boards an, die messen, wie oft ein Modell schlicht falsch liegt, mit 40 auf AA-Omniscience, 61 % auf Omniscience Accuracy und 53,3 % auf Humanity's Last Exam.
Beste KI zur Problemlösung
Die beste KI zur schweren Problemlösung ist GPT-5.6 Sol, und es ist die am besten belegte Krone auf dieser Seite. Es holt sich #1 auf LiveBench Mathematics mit 96,2, #1 auf LiveBench Reasoning mit 91,7 und #1 auf ARC-AGI-2 mit 93 %, das Näheste, das je ein Modell dem 100-%-Menschen-Panel gekommen ist. Drei separate Häuser setzen es bei den entscheidenden Reasoning-Aufgaben auf den ersten Platz, was mehr Übereinstimmung ist, als jede andere Kategorie auf dieser Seite erzeugt. OpenAI hat Sols FrontierMath-Wert weiterhin nicht veröffentlicht, also bleibt die verifizierte OpenAI-Marke die 39,6 % von GPT-5.5 Pro auf FrontierMath Tier 4, und wir schieben Sols Zahl in dem Moment ein, in dem sie öffentlich wird. Qwen 3.7 Max ist die Preis-Leistungs-Alternative für Aufgaben im Wettbewerbsstil mit 97,1 auf dem HMMT-Index vom Februar 2026 und 44,5 auf Apex, zu einem Bruchteil der Kosten von ChatGPT Pro, und es enthält jetzt 200 kostenlose Modellanfragen pro Tag. Claude Opus 5 ist die Alternative für lange agentische Reasoning-Ketten, führt Artificial Analysis' Agentic Index mit 55,3 und ARC Prizes ARC-AGI-3 mit 30 %, rund 3,75-mal das nächstbeste Modell.
| Modell | Am besten für | Schlüssel-Benchmark | Schwäche | Preis |
|---|---|---|---|---|
| GPT-5.6 Sol | Schwerste Mathematik, Wissenschaft und Reasoning | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %) | FrontierMath weiterhin unveröffentlicht; Scheming von METR gemeldet | $100/Mon. ChatGPT Pro; API $5 / $30 |
| Claude Opus 5 | Lange agentische Reasoning-Ketten | #1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %) | Zweiter auf LiveBench Reasoning; 50 % Halluzinationsrate | $5 / $25 |
| GPT-5.5 Pro | Verifizierter FrontierMath-Führer | 39,6 % FrontierMath Tier 4 | Von Sol als Flaggschiff abgelöst | $100/Mon. ChatGPT Pro |
| Qwen 3.7 Max | Wettbewerbsmathematik mit knappem Budget | 97,1 HMMT 2026 Feb, 44,5 Apex, 200 kostenlose Anfragen/Tag | Nur API | $1.25 / $3.75 Promo; $2.50 / $7.50 Liste |
| Claude Fable 5 | Mathematik in einem Coding-Workflow | #1 auf Arenas Mathe-Unterkategorie (1543), 96,0 LiveBench Mathematics | Teuerste Option hier | $10 / $50 |
| GLM-5.2 | Open-Weight-Problemlösung | Höchster open Intelligence Index mit 51, MIT, 1M Kontext | Nur Selbst-Host oder Anbieter | Open weights (MIT) |
GPT-5.6 Sol behält diese Krone und holte sich ein zweites Argument. Sol führt jetzt außerdem Artificial Analysis' Terminal-Bench v2.1 mit 89,5 % und seinen Coding Index mit 78,3 an, und es zieht mit Gemini 3.1 Pro auf GPQA Diamond mit 94,1 % gleich. Claude Opus 5 bleibt die Agentic-Reasoning-Alternative auf der Stärke von ARC-AGI-3. Am 1. August benannte OpenAI seine nächste Modellfamilie Astra und veröffentlichte zehn neue mathematische Ergebnisse aus einer internen Version, obwohl Astra unveröffentlicht ist und kein Datum, keinen Preis und keine Verfügbarkeit hat.
Bester KI-Agent
Der beste KI-Agent ist derzeit Gemini Spark für rund um die Uhr in der Cloud residierende Arbeit und Claude Cowork für auf dem Desktop residierende Arbeit, mit ChatGPT Codex als Alternative für Coding-Agenten und Browser-Agenten der OpenAI-Operator-Klasse als Alternative für Web-Aufgaben. KI-Agenten sind die am schnellsten bewegte Kategorie 2026: Jeder Top-Anbieter liefert jetzt ein Agenten-Produkt, und die praktische Wahl liegt zwischen Agenten, die in der Cloud leben (laufen, während dein Laptop geschlossen ist), und Agenten, die auf deinem Desktop leben (steuern deine Apps direkt). Gemini Spark startete auf der Google I/O am 19. Mai 2026 und ist der erste 24/7-Cloud-Agent. Claude Cowork erreichte am 9. April 2026 die allgemeine Verfügbarkeit und läuft als Desktop-Agent, der deine lokalen Apps steuert. ChatGPT Codex Mobile (14. Mai) ist der Tipp für Coding-Agenten-Arbeit. Lies den vollständigen Vergleich Gemini Spark vs. Claude Cowork.
| Agent | Am besten für | Wo er läuft | Stärke | Preis |
|---|---|---|---|---|
| Gemini Spark | 24/7-Cloud-Aufgaben, Workspace-Workflows | Google-Cloud-VM (immer an) | Erster echter 24/7-Agent, tiefe Workspace-Integration | $99.99/Mon. Google AI Ultra |
| Claude Cowork | Desktop, App-Steuerung, Design + Code | Dein Mac-/Windows-Desktop | Steuert lokale Apps, sieht deinen Bildschirm | $20/Mon. Claude Pro |
| ChatGPT Codex Mobile | Coding-Agent auf dem Handy | OpenAI-Cloud + iOS/Android | Diffs freigeben und Arbeit vom Handy umleiten | In ChatGPT-Plänen enthalten |
| Grok Agentic (Grok 4.5) | Echtzeit-Recherche, X-Scraping | xAI-Cloud | Native X-Integration | $30/Mon. SuperGrok |
| OpenAI Operator-Klasse | Browser-Aufgaben, Web-Formulare | OpenAI-Cloud + dein Browser | Web-Automatisierung | ChatGPT Pro |
Keine neuen Consumer-Agenten erschienen, und Metas Muse Code (5. August) ist ein Terminal-Entwickler-Tool statt eines für Consumer, sodass die Wahl zwischen Gemini Spark (Cloud) und Claude Cowork (Desktop) weiterhin die meisten Agenten-Entscheidungen für einzelne Nutzer bestimmt. Die Modellschicht darunter bewegte sich erneut: Claude Opus 5 (24. Juli) holte sich #1 auf Artificial Analysis' Agentic Index mit 55,3, vor GPT-5.6 Sol mit 54,0 und Claude Fable 5 mit 52,8, und es kostet $5 / $25. Opus 5 führt außerdem Arenas Agent-Board an, mit Kimi K3 auf Platz drei. Für Teams, die eigene Agenten bauen, ist Metas Muse Spark 1.2 (5. August) eine günstige agenten-native Option zu $1.25 / $4.25, deren GDPval-AA v2 agentisches Elo von 1371 auf 1631 sprang, obwohl Scale SEAL nur das ältere 1.1 bewertet hat, das dessen MCP-Atlas-Tool-Use-Board mit 88,1 anführt. GLM-5.2 (MIT) ist das stärkste Open-Weight-Agentenmodell, das du auf bescheidener Hardware hosten kannst, auf #5 von Arenas Agent-Board.
Beste KI für Studierende
Die beste KI für Studierende ist GPT-5.5 Free in ChatGPT für allgemeine Studienarbeit und Gemini 3.6 Flash Free in der Gemini-App für STEM und multimodales Lernen, mit Qwen 3.7 Max als API-Alternative für schwerere Aufgabensätze (200 kostenlose Anfragen pro Tag) und Claude Opus 5 als Alternative für das Lektorat von Essays. Die meisten Studierenden müssen nicht zahlen: Die kostenlose ChatGPT-Stufe verwendet jetzt standardmäßig GPT-5.6 (mit weiterhin verfügbarem GPT-5.5), Gemini 3.6 Flash ist in der kostenlosen Gemini-App und in AI Studio, Claude Sonnet 5 ist der neue kostenlose Claude-Standard, und DeepSeek V4 ist kostenlos auf DeepSeeks Chat-Seite. Für schrittweises Rechnen bei der schwersten Mathematik ist GPT-5.6 Sol OpenAIs neues Flaggschiff (sein FrontierMath-Wert ist noch nicht veröffentlicht, mit den verifizierten 39,6 % von GPT-5.5 Pro auf FrontierMath Tier 4 als aktueller Marke), obwohl beide nur bezahlt sind; Qwen 3.7 Max ist die Preis-Leistungs-Alternative mit 97,1 HMMT 2026 Februar bei API-Preisen von $1.25 / $3.75 auf seiner aktuellen 50-%-Promo ($2.50 / $7.50 Liste).
| Aufgabe | Bestes Modell | Warum | Kostenlos? | Alternative |
|---|---|---|---|---|
| Essays & Studienarbeit | GPT-5.5 | Kostenlos in ChatGPT, verbesserte faktische Verlässlichkeit vs. 5.4 | Ja | Claude Sonnet 5 (kostenloses Claude) |
| STEM-Problemlösung | GPT-5.6 Sol / Qwen 3.7 Max | Neues STEM-Flaggschiff (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 Feb | Pro bezahlt / Qwen API bezahlt | Gemini 3.6 Flash (kostenlos) |
| Recherche & Genauigkeit | Gemini 3.1 Pro | 98 % ARC-AGI-1 bei $0.52/Aufgabe, native Google-Search-Grundierung | Ja (Gemini-App) | Claude Opus 5 |
| Schreib-Lektorat | Claude Sonnet 5 | Kostenlos und Standard auf claude.ai; Claude Fable 5 ist der Qualitätsführer | Ja (Claude kostenlos) | Claude Fable 5 |
| Multimodales Lernen (PDFs, Slides, Bilder) | Gemini 3.6 Flash | 1M Kontext, kostenlos in der Gemini-App | Ja | NotebookLM (Google) |
Beste KI für Arbeit & Profis
Die beste KI für professionelle Arbeit ist GPT-5.6 (ChatGPTs Standard seit 9. Juli) für tägliche Wissensarbeit, Claude Opus 5 für Programmieren und Schreiben mit hohem Einsatz und Gemini Spark für 24/7-agentische Workflows. Die meisten Profis holen das meiste heraus, indem sie zwei bezahlte Abos betreiben (ChatGPT Plus zu $20/Monat plus Claude Pro zu $20/Monat, insgesamt $40/Monat), oder sie konsolidieren mit Fello AI zu $9.99/Monat für alle fünf Top-Modelle in einer Mac-/iOS-App. Für agentische Arbeit, die läuft, während du schläfst, ist Gemini Spark auf Google AI Ultra zu $99.99/Monat der einzige echte 24/7-Cloud-Agent.
| Anwendungsfall | Bestes Modell | Schlüsselstat | Preis | Alternative |
|---|---|---|---|---|
| Tägliche Wissensarbeit | GPT-5.6 | ChatGPTs Standard seit 9. Juli; der Assistent, den die meisten öffnen können | $20/Mon. ChatGPT Plus | Claude Opus 5 |
| Programmieren (proprietär) | Claude Opus 5 | #1 auf Arena WebDev (1,702.9) und image-to-WebDev (1,668.6); Anthropics empfohlener Standard | $20/Mon. Claude Pro | Claude Fable 5 |
| Programmieren (kosteneffizient) | Qwen 3.7 Max | 80,4 SWE-Verified, 1M Kontext | $1.25 / $3.75 Promo; $2.50 / $7.50 Liste | DeepSeek V4-Flash 0731 |
| Recherche & Briefings | Gemini 3.1 Pro | 98 % ARC-AGI-1 bei $0.52/Aufgabe, Google-Grundierung | Google AI Pro / Ultra | Claude Opus 5 |
| Schwere Mathematik, Physik, Finanzmodellierung | GPT-5.6 Sol | OpenAIs neues STEM-Flaggschiff (5.5 Pro verifiziert bei 39,6 % FrontierMath) | $100/Mon. ChatGPT Pro | Qwen 3.7 Max |
| Immer-an-Agenten-Workflows | Gemini Spark | Erster 24/7-Cloud-Agent | $99.99/Mon. Google AI Ultra | Claude Cowork |
| Live-News, X-Kontext-Kreativität | Grok 4.5 | Opus-Klasse + native X-Grundierung | $30/Mon. SuperGrok | Gemini 3.1 Pro |
| All-in-one-Konsolidierung | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/Mon. | Jeden Anbieter separat bezahlen |
KI-Modell-Preise im August 2026
Von $0-Gratisversionen bis zu $199.99/Monat Google AI Ultra. Der folgenreichste Preis auf dieser Tabelle ist Claude Opus 5 bei $5 / $25, weil es das #1-Modell auf Artificial Analysis' Intelligence Index zum halben Preis von Claude Fable 5 ist. Metas Muse Spark 1.2 wird mit $1.25 / $4.25 gelistet, mit einer Contributor-Stufe zu $0.10 / $0.20 für alle, die bereit sind, Meta auf ihren Prompts trainieren zu lassen, und Grok 4.5 wird mit $2 / $6 gelistet. Der Preis-Leistungs-Tipp ist jetzt DeepSeek V4-Flash 0731 bei $0.14 / $0.28, das Gemini 3.6 Flashs Intelligence Index von 50 erreicht und $0.03 pro Index-Aufgabe kostet gegen die $0.56 von Flash. Unter den geschlossenen Modellen ist GPT-5.6 Luna nach OpenAIs Senkung vom 30. Juli das günstigste bei $0.20 / $1.20. Für eine tiefere Aufschlüsselung siehe unseren vollständigen Leitfaden zum KI-Preisvergleich.
| Modell | Input (pro 1M) | Output (pro 1M) | Kontext | Kostenloser Zugang? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K in Codex) | ChatGPT Free; API bezahlt |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro ab $100/Mon. ($200 Stufe mit höherer Nutzung) |
| GPT-5.6 Sol | $5.00 | $30.00 | Nicht veröffentlicht | Live in ChatGPT, Codex & API (9. Juli) |
| GPT-5.6 Terra | $2.00 | $12.00 | Nicht veröffentlicht | Live in ChatGPT, Codex & API (9. Juli) |
| GPT-5.6 Luna | $0.20 | $1.20 | Nicht veröffentlicht | Live in ChatGPT, Codex & API (9. Juli) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Claude Pro/Max Standard; API bezahlt |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Legacy-Modell bei Anthropic; Pro/Max/API |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Dauerhaft in Max/Team Premium (~50 % der Nutzungslimits); Pro/Team Standard über Credits |
| Claude Sonnet 5 | $2.00 Einführung / $3.00 Liste | $10.00 Einführung / $15.00 Liste | 1M | Claude Free & Pro Standard; API bezahlt |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API bezahlt (abgelöst durch Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Eingeschränkte Gemini-App; API bezahlt |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Gemini-App/AI Studio; kostenlose API-Stufe + bezahlte API |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; kostenlose API-Stufe + bezahlte API |
| Qwen 3.7 Max | $1.25 Promo / $2.50 Liste | $3.75 Promo / $7.50 Liste | 1M | 200 kostenlose Anfragen/Tag; API bezahlt darüber hinaus |
| MiniMax M3 | $0.30 (50 % Rabatt auf $0.60) | $1.20 (≤512K) | 1M | Open weights; Hosting-Kosten fallen an |
| LongCat-2.0 | Anbieterabhängig | Anbieterabhängig | 1M | Open weights (MIT); Hosting-Kosten fallen an |
| NVIDIA Nemotron 3 Ultra | Anbieterabhängig | Anbieterabhängig | 1M | Open weights (OpenMDW); Hosting-Kosten fallen an |
| Qwen 3.5 (Open-Weight) | Selbst-Host / Together | Selbst-Host / Together | 1M | Open weights; Hosting-Kosten fallen an |
| Nex-N2-Pro | Selbst-Host / Anbieter | Selbst-Host / Anbieter | 1M | Open weights (Apache 2.0); Hosting-Kosten fallen an |
| Rio 3.5 Open 397B | Selbst-Host / Anbieter | Selbst-Host / Anbieter | 1M | Open weights (MIT); Hosting-Kosten fallen an |
| Grok 4.3 | $1.25 | $2.50 | 1M | Kostenloser Consumer-Plan; API bezahlt |
| Grok 4.5 | $2.00 | $6.00 | 500K | Grok Build / Cursor / xAI-Konsole; EU teilweise, API-Konsole weiterhin geschlossen |
| Muse Spark 1.2 | $1.25 ($0.10 Contributor-Stufe) | $4.25 ($0.20 Contributor-Stufe) | 1M | Bezahlte API; Muse Code, Meta Model API und OpenRouter; Contributor-Stufe tauscht Trainingsrechte gegen ~92 % Rabatt |
| Kimi K3 | $3.00 ($0.30 Cache-Hit) | $15.00 | 1M | Kostenlose Basis-Stufe in der Kimi-App; open weights auf Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (Video) | $1.50 | $17.50 (Video-Output) | 10-Sekunden-Clips | Gemini-App / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.435 ($0.0036 Cache-Hit) | $0.87 | 1M | DeepSeek Chat kostenlos; API bezahlt |
| DeepSeek V4-Flash 0731 | $0.14 | $0.28 | 1M | DeepSeek Chat kostenlos; API bezahlt |
| Kimi K2.7 Code | Anbieterabhängig | Anbieterabhängig | 256K | Open weights; Hosting-Kosten fallen an |
| GLM-5.2 | Anbieterabhängig | Anbieterabhängig | 1M | Open weights; Hosting-Kosten fallen an |
| ERNIE 5.1 | China-Region-Preise | China-Region-Preise | 256K | Baidu Gratisversion |
| Gemini Spark (Agent) | Nicht API-bepreist | Nicht API-bepreist | 1M (Gemini-Basis) | Google AI Ultra $99.99 oder $199.99/Mon. |
| Fello AI (Aggregator) | Über die App geroutet | Über die App geroutet | Modellabhängig | $9.99/Mon., Gratisversion verfügbar |
Die oben genannten Raten für GPT-5.5 und GPT-5.5 Pro sind Short-Context-Preise; OpenAI veröffentlicht die spezifischen Long-Context-Zahlen nicht mehr. Die GPT-5.6-Stufen werden mit dem 2-fachen Input und dem 1,5-fachen Output abgerechnet, sobald ein Prompt 272K Input-Tokens überschreitet, was Long-Context-Terra auf $4 / $18 und Luna auf $0.40 / $1.80 bringt. Wenn du Zugang zu mehreren KI-Modellen willst, ohne separate Abos zu verwalten, bietet Fello AI GPT, Claude, Gemini, Grok, Perplexity und mehr in einer einzigen App für Mac, iPhone und iPad ab $9.99/Monat.
Beste Open-Weight-Modelle im August 2026
Das beste Open-Weight-Modell im August 2026 ist Kimi K3, und es übernahm die Führung in dem Moment, in dem Moonshot am 27. Juli 2026 die Gewichte veröffentlichte. Es hält den höchsten Intelligence Index aller offenen Modelle mit 57 auf Artificial Analysis v4.1, sechs Punkte vor GLM-5.2, und auf Arena ist es weiterhin der höchstplatzierte offene Eintrag, auf #2 bei WebDev (1,675.5) hinter nur Claude Opus 5 und #3 auf dem Agent-Board. Ein Haken entscheidet, welches der beiden du tatsächlich verwenden solltest. Der K3-Download besteht aus 96 safetensors-Shards und rund 1,56 TB, was ein Multi-Node-GPU-Cluster statt einer Workstation braucht, und es kommt unter einer eigenen Kimi K3 License statt MIT. Also bleibt GLM-5.2 (Z.ai, MIT) unsere praktische Empfehlung für Teams, die eigene Gewichte betreiben, bei Intelligence Index 51, #6 auf Arena WebDev (1,587.1) und #5 auf dem Agent-Board. Der dritte Platz wechselte am letzten Julitag den Besitzer: DeepSeek V4-Flash 0731 wurde nachtrainiert und sprang von Intelligence Index 40 auf 50, bei $0.14 / $0.28 unter MIT.
| Modell | Am besten für | Schlüssel-Benchmark | Kontext / Lizenz | Wo laufen lassen |
|---|---|---|---|---|
| Kimi K3 | Höchstbewertetes open model, agentische und Web-Arbeit | II 57 (v4.1), höchster aller open models; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B aktiv | 1M / Kimi K3 License | Hugging Face (96 Shards, 1.56 TB), Moonshot API, Anbieter |
| GLM-5.2 | Langfristiges agentisches Programmieren, 1M Kontext | II 51 (v4.1), höchster, den du auf bescheidener Hardware hosten kannst; 744B/40B aktiv | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| DeepSeek V4-Flash 0731 | Bester Preis-Leistungs-Wert aller Modelle auf der Seite | II 50 (v4.1), von 40 am 31. Juli; $0.03 pro Index-Aufgabe, 284B/13B aktiv | 1M / MIT | DeepSeek API ($0.14/$0.28), lokal |
| LongCat-2.0 | Frontier-offener Coder, trainiert auf chinesischen Chips | II 33 (v4.1); 59,5 % SWE-Bench Pro (Anbieter), 1.6T/~48B aktiv | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Günstig multimodal auf Frontier-Niveau | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / Lizenz TBD | Hugging Face, API $0.30/1M (50 % Rabatt) |
| Nex-N2-Pro | Stärkster offener Coding-Wert | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktiv | Qwen-basiert / Apache 2.0 | Hugging Face, Anbieter, Selbst-Host |
| Kimi K2.7 Code | Stärkster kommerziell lizenzierter offener Coder | +21,8 % auf Kimi Code Bench v2 vs. K2.6 (Anbieter); 1T/32B aktiv | 256K / Modified MIT | Hugging Face, DeepInfra, Anbieter |
| DeepSeek V4-Pro | Agentische Arbeit in der realen Welt | II 44 (v4.1), 1.6T/49B aktiv | 1M / MIT | DeepSeek API ($0.435/$0.87), lokal |
| Hy3 | Neuester Kandidat mit permissiver Lizenz | II 41 (v4.1); #22 auf Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, Anbieter, Selbst-Host |
| Inkling | Thinking Machines' erstes open model | II 41 (v4.1), agentisch 32,3, veröffentlicht 15. Juli | Open weights | Hugging Face, Anbieter, Selbst-Host |
| Inkling Small | Gleiche Familie bei einem Viertel der Größe | II 40 (v4.1), agentisch 30,8; 276B/12B aktiv, Text, Bild und Audio Input | Apache 2.0 | Hugging Face (BF16 und NVFP4), Anbieter, Selbst-Host |
| NVIDIA Nemotron 3 Ultra | NVIDIA-abgestimmt, voll permissive Lizenz | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktiv | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 Selbst-Host) |
| Qwen 3.5 (397B / 17B aktiv) | Multimodal, schnelles Decoding | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / offen | Together, OpenRouter, lokal |
| Qwen3.6-35B-A3B | Effizienter offener agentischer Coder (3B aktiv) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktiv | 262K (bis 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, lokal |
| Qwen3.6-27B | Laptop-tauglicher dichter Coder | 87,8 GPQA Diamond, dicht 27B, multimodal | 256K / Apache 2.0 | Lokal Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Qwen-3.5-Fine-tune, mehrsprachiges Reasoning | 70,8 Terminal-Bench 2.1 (First-Party), schlägt Qwen 3.7 Plus in 4/5 | 397B/17B aktiv / MIT | Hugging Face, Anbieter, Selbst-Host |
| Llama 4 Maverick | Flaggschiff der Meta-Reihe | 17B aktiv / 400B Gesamtparameter | Llama 4 License | Meta-Cloud, Hugging Face, lokal |
| NVIDIA Nemotron 3 Nano Omni | Edge / Low-Power | Multimodal, sehr kleiner Footprint | Kompakt / offen | Lokal, NVIDIA-Tool |
Lizenzierung zählt hier ebenso wie der reine Wert: Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) und Nemotron 3 Ultra (OpenMDW) erlauben alle klar die kommerzielle Nutzung, während MiniMax M3 unter seiner eigenen Community-Lizenz kommt und Kimi K3 auf seiner eigenen Custom-Lizenz mit einer Umsatzschwelle für alle sitzt, die es als Service weiterverkaufen. Kein open model ist mehr Erster auf irgendeinem Arena-Board, das wir verfolgen: Claude Opus 5 holte sich das Agent-Board im Juli, das letzte, das ein open model anführte.
Benchmarks, Preise und Hands-on-Nutzung
Jedes Ranking auf dieser Seite kombiniert drei Eingaben: öffentliche Benchmarks von sieben unabhängigen Häusern (Artificial Analysis, Arena früher LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize und das offizielle Terminal-Bench-2.1-Board, mit Abdeckung der Intelligence- und Agentic-Indizes, GPQA Diamond, ARC-AGI-1 bis 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas und dem Remote Labor Index), veröffentlichte API- und Abo-Preise von der offiziellen Preisseite jedes Anbieters und Hands-on-Nutzung durch das FelloAI-Redaktionsteam, das echte Prompts über dieselbe Aufgabe auf jedem Modell laufen lässt. Wir holen offizielle Preis- und Benchmark-Quellen vor jedem monatlichen Update neu ein.
Benchmarks werden auf den Anwendungsfall gewichtet: SWE-bench und Terminal-Bench treiben das Programmieren, GPQA Diamond und ARC-AGI-2 treiben die Genauigkeit, GDPval-AA (Artificial Analysis' Benchmark für professionelle Deliverables) informiert die Qualität professioneller Aufgaben, während der Schreibstil primär durch Hands-on-Tests beurteilt wird, FrontierMath und HMMT treiben die Problemlösung. Wir legen offen, wenn ein Benchmark vom Anbieter gemeldet, aber nicht unabhängig verifiziert ist, und wir streichen jede Behauptung, die wir nicht gegen eine Live-Quelle reproduzieren können. Wir bewegen keine Kategoriekrone auf der Stärke eines einzelnen Leaderboards, und wo ein neues Modell zu jung ist, als dass die Human-Präferenz-Boards es bewertet hätten, sagen wir das, statt es allein auf Benchmark-Werten zu krönen. Wenn ein Modell zwischen Updates ein großes Upgrade durchläuft, ranken wir die Kategorie neu und ergänzen eine „Was sich diesen Monat geändert hat"-Zeile am unteren Ende der ausführlichen Analyse.





