Mis à jour en août 2026

Meilleurs modèles d'IA en 2026

Classements, comparatifs et analyses approfondies, mis à jour chaque mois à mesure que de nouveaux modèles arrivent.

Août 2026 s'ouvre avec Claude Opus 5 en tête et deux couronnes qui changent de main. Opus 5 domine l'Intelligence Index d'Artificial Analysis à 61 et son Agentic Index à 55,3 à 5 $ / 25 $ par 1M de tokens, moitié moins cher que Claude Fable 5, et il a désormais pris la couronne de la programmation après avoir terminé premier sur les deux classements de programmation par votes d'Arena. L'autre mouvement se joue sur le bas de gamme, où DeepSeek V4-Flash 0731 est arrivé le 31 juillet comme nouveau choix rapport prix-performance à 0,14 $ / 0,28 $. Ci-dessous figurent les vainqueurs par catégorie pour août 2026. Cliquez sur n'importe quelle carte pour accéder directement au décryptage complet, ou utilisez la navigation fixe pour passer d'une catégorie à l'autre. Les classements, benchmarks et prix sont mis à jour dans les 48 heures suivant le lancement de tout modèle majeur.

Vainqueurs par catégorie d'août 2026
Écriture
Claude Fable 5
#1 Arena texte (1508.6) et Humanity's Last Exam
Le seul modèle dans le top trois des trois classements indépendants d'écriture, à 10 $ / 50 $.
Analyse approfondie →
Chat & ; assistant du quotidien
GPT-5.6
Modèle par défaut de ChatGPT depuis le 9 juillet
Le meilleur assistant que la plupart des gens peuvent réellement ouvrir, équilibrant capacité, rapidité et portée.
Analyse approfondie →
Images
ChatGPT Images 2.0
#1 en texte vers image et en édition d'images
Domine les deux classements indépendants d'image et reste le meilleur pour le texte multilingue lisible.
Analyse approfondie →
Vidéo
Gemini Omni Flash
#1 sur les deux classements vidéo (1527 Arena)
Domine les deux classements indépendants de vidéo avec une édition conversationnelle à environ 0,10 $ par seconde.
Analyse approfondie →
Programmation
Claude Opus 5
#1 Arena WebDev (1,702.9) à 5 $ / 25 $
Prend la couronne de la programmation sur les classements par votes, à moitié prix de Claude Fable 5.
Analyse approfondie →
Créativité
Grok 4.5
Le moins de restrictions de contenu + X natif en temps réel
Le choix pour un travail audacieux et dans l'air du temps : le moins de garde-fous et une intégration native de X.
Analyse approfondie →
Précision & ; recherche
Gemini 3.1 Pro
98 % sur ARC-AGI-1 à 0,52 $ la tâche
Égale le panel humain sur ARC-AGI-1 avec un ancrage natif dans Google Search pour des réponses en direct.
Analyse approfondie →
Résolution de problèmes
GPT-5.6 Sol
#1 LiveBench Mathematics, Reasoning et ARC-AGI-2
La couronne la mieux étayée de cette page pour les mathématiques, la science et le raisonnement les plus ardus.
Analyse approfondie →
Agents d'IA
Gemini Spark
Premier agent d'IA résident dans le cloud 24/7
Fonctionne en continu dans une VM Google Cloud, profondément intégré à Gmail, Docs et Chrome.
Analyse approfondie →
Les nouveautés d'août 2026
5 août Meta Muse Spark 1.2 et Muse Code, Intelligence Index de 51 à 54 à un tarif inchangé de 1,25 $ / 4,25 $, plus un agent de programmation en terminal Nouveau
Meta a lancé Muse Spark 1.2 le 5 août 2026 aux côtés de Muse Code, son premier agent de programmation en terminal, qui fonctionne sur macOS et Linux sans application de bureau et sans abonnement. Artificial Analysis note le modèle à un Intelligence Index de 54 à son réglage de raisonnement le plus élevé, contre 51 pour la 1.1 et 43 pour la version d'avril, et la quasi-totalité de ce gain est agentique plutôt que de la connaissance générale ; son Elo GDPval-AA v2 a bondi de 1371 à 1631 tandis que Terminal-Bench v2.1 n'est passé que de 78 % à 80 %. Le prix reste inchangé à 1,25 $ / 4,25 $ par 1M de tokens sur une fenêtre de contexte de 1M de tokens, et Meta a ajouté un palier Contributor à 0,10 $ / 0,20 $, environ 92 % moins cher, en échange du fait de laisser Meta s'entraîner sur vos prompts et vos completions. La disponibilité s'est élargie de l'aperçu réservé aux États-Unis sous lequel la 1.1 a été lancée à un accès mondial étendu via Muse Code, la Meta Model API et OpenRouter. Sur les propres graphiques de lancement de Meta, le modèle termine deuxième derrière Claude Opus 5 sur les trois benchmarks de programmation qu'il a publiés, avec 82,9 % contre 86,7 % sur Terminal-Bench 2.1.
3 août Alibaba Qwen 3.8 (Qwen3.8-Max), modèle phare multimodal de 2,4 billions de paramètres désormais disponible pour tous à 2 $ / 6 $ Nouveau
Alibaba a rendu Qwen3.8-Max disponible pour tous le 3 août 2026, deux semaines après l'avoir présenté en avant-première au WAIC Shanghai, et chaque chiffre qui manquait à l'avant-première a désormais une valeur derrière lui. Il fonctionne avec 2,4 billions de paramètres au total et environ 95 milliards actifs par token sur une conception Mixture-of-Experts clairsemée, prend en charge le texte, les images et la vidéo, et confirme une fenêtre de contexte de 1M de tokens avec jusqu'à 128K tokens de sortie. Le tarif de l'API est de 2 $ / 6 $ par 1M de tokens, uniforme sur tout le contexte plutôt qu'échelonné selon la longueur du prompt, avec des lectures en cache à 0,25 $. L'affirmation « juste derrière Fable 5 » se scinde désormais nettement en deux : sur le classement vision d'Arena, il est #2 à 1305, juste derrière Fable 5, mais sur le classement texte, il est #5 à 1496, derrière quatre entrées d'Anthropic. Les deux scores Arena sont encore signalés comme préliminaires, et les open weights promis ne sont pas arrivés. Nous maintenons Qwen 3.8 hors des choix classés jusqu'à ce que les poids et la licence arrivent réellement.
31 juil. DeepSeek DeepSeek V4-Flash 0731, même prix, même taille, Intelligence Index de 40 à 50 Nouveau
DeepSeek a de nouveau post-entraîné V4-Flash et a publié le résultat le 31 juillet 2026 sous le nom de DeepSeek-V4-Flash-0731. Rien dans la forme du modèle n'a changé : c'est le même Mixture-of-Experts de 284B au total / 13B actifs, le même contexte de 1M de tokens, la même licence MIT et les mêmes 0,14 $ / 0,28 $ par 1M de tokens sur la propre grille tarifaire de DeepSeek. Ce qui a bougé, c'est la capacité. Artificial Analysis le note désormais à un Intelligence Index de 50, contre 40, avec Agentic 45,7 et 78,7 % sur Terminal-Bench v2.1, ce qui le hisse d'environ la treizième à la troisième place du champ ouvert derrière Kimi K3 et GLM-5.2. À 0,03 $ par tâche d'index, c'est le chiffre le moins cher de tout le classement d'Artificial Analysis, et c'est ce qui a déplacé notre choix rapport prix-performance ce mois-ci. Une limite honnête : le score a un jour, provient d'une seule maison, et le modèle n'a encore aucun vote sur aucun classement d'Arena.
31 juil. MiniMax MiniMax H3, vidéo 2K avec audio stéréo natif à partir de 0,13 $ la seconde Nouveau
MiniMax a lancé H3 (Hailuo 3.0) le 31 juillet 2026 comme un modèle vidéo multimodal polyvalent qui prend en entrée texte, image, vidéo et audio. Il produit des clips 2K de 4 à 15 secondes avec un audio stéréo natif, prend en charge le transfert de mouvement, la génération guidée par référence et l'édition vidéo générative, et il est facturé à la seconde à 0,13 $ pour la 2K et 0,09 $ pour le 768p. Artificial Analysis le place #2 sur son classement vidéo à 1241,5, à 3,3 Elo de Gemini Omni Flash. Nous avons laissé la couronne vidéo là où elle est : cet écart a un jour et provient du seul classement qui ne s'est pas reproduit entre les analyses, et la limite texte vers vidéo d'Arena est antérieure à H3 dans son intégralité, donc il n'a rien battu aux votes. MiniMax a promis les poids pour début août, et ils n'avaient pas été publiés au moment de la mise en ligne de cette mise à jour.
Fin juil. Thinking Machines Inkling Small, un quart de la taille d'Inkling pour un score presque identique Nouveau
Thinking Machines a fait suivre son premier open model par Inkling Small, un Mixture-of-Experts de 276B au total / 12B actifs sous Apache 2.0 qui achemine chaque token vers 6 experts sur 256 plus 2 partagés. Il accepte en entrée texte, image et audio et renvoie du texte, et Artificial Analysis le note à un Intelligence Index de 40 contre 41 pour l'Inkling en taille complète, à environ un quart des paramètres. Les sources ne s'accordent pas sur la date exacte de publication, nous n'en imprimons donc aucune. Les poids, une build NVFP4 et les recettes de déploiement sont tous sur Hugging Face.
30 juil. OpenAI Baisse de prix GPT-5.6, Luna 80 % moins cher, Terra 20 % moins cher, Sol inchangé
OpenAI a réduit le prix de l'API de ses deux paliers GPT-5.6 les moins chers le 30 juillet 2026, trois semaines après que la famille a atteint la disponibilité générale. Luna a chuté de 80 % à 0,20 $ / 1,20 $ par 1M de tokens et Terra a chuté de 20 % à 2 $ / 12 $, les lectures d'entrée en cache tombant à 0,02 $ sur Luna et 0,20 $ sur Terra. Le modèle phare Sol reste à 5 $ / 30 $, les prompts au-delà de 272K tokens d'entrée sont toujours facturés à 2x l'entrée et 1,5x la sortie, et aucun prix d'abonnement ChatGPT n'a changé, donc Free, Go à 8 $, Plus à 20 $, Pro à 100 $ et 200 $ et Business à 25-30 $ par siège restent tous inchangés. La baisse laisse Luna à un Intelligence Index de 51 sur Artificial Analysis pour environ 0,07 $ par tâche d'index, un point au-dessus de Gemini 3.6 Flash au score et bien en dessous de ses 0,56 $ par tâche.
24 juil. Anthropic Claude Opus 5, nouveau #1 sur Artificial Analysis, domine à la fois l'Intelligence Index (61) et l'Agentic Index (55.3) Nouveau
Anthropic a publié Claude Opus 5 le 24 juillet 2026, son quatrième modèle en moins de deux mois après Mythos 5, Fable 5 et Sonnet 5. Sur le classement v4.1 recalibré d'Artificial Analysis, c'est désormais le modèle le mieux classé dans l'ensemble, dominant à la fois l'Intelligence Index à 61 et l'Agentic Index à 55,3, devant Fable 5 (60 / 52,8) et GPT-5.6 Sol (59 / 54,0). Le tarif de l'API est de 5 $ / 25 $ par 1M de tokens, identique à Opus 4.8 et moitié moins cher que Fable 5, sous l'API id claude-opus-5. Il ajoute un mode Fast qui tourne environ 2,5x plus vite au double du prix de base, plus un réglage effort de low à high et un nouveau palier max. Il remporte aussi haut la main le classement GDPval-AA v2 de livrables professionnels d'Artificial Analysis à 1858, devant les 1746 de Fable 5. Arena l'a depuis évalué sur ses classements, le plaçant #1 sur WebDev, image-to-WebDev, Document et le classement Agent et #6 sur le texte, ce qui lui a valu la couronne de la programmation ce mois-ci. Il est le modèle par défaut sur Claude Max et le plus performant sur Claude Pro.
24 juil. Sakana AI Fugu-Ultra v1.1, rafraîchissement du moteur d'orchestration avec des gains annoncés par l'éditeur jusqu'à 7,9 points sur v1.0 au même prix Nouveau
Sakana AI a livré Fugu-Ultra v1.1 le 24 juillet 2026, un rafraîchissement des modèles frontier au sein de son moteur d'orchestration TRINITY plutôt qu'un nouveau modèle de base. La propre annonce de Sakana revendique des gains allant jusqu'à 7,9 points sur v1.0 à prix inchangé, mais ne publie pas les scores de v1.0 côte à côte, alors traitez cela comme le chiffre de l'éditeur. Tous les chiffres de benchmark proviennent du scaffolding maison de Sakana plutôt que de tests indépendants : sur ses propres graphiques, il devance Opus 4.8, GPT-5.5 et Gemini 3.1 Pro, avec 73,7 % sur SWE-Bench Pro, 82,1 % sur Terminal-Bench 2.1, 93,2 % sur LiveCodeBench et 95,5 sur GPQA-Diamond. Il ne balaie pas le terrain pour autant : ses 50,0 sur Humanity's Last Exam sont une égalité à l'arrondi près avec les 49,8 d'Opus 4.8. Le prix est inchangé par rapport à v1.0 à 5 $ / 30 $ par 1M de tokens d'entrée/sortie (plus 0,50 $ en cache), montant à 10 $ / 45 $ au-delà du seuil de contexte de 272K tokens ; l'API est compatible OpenAI avec une fenêtre de contexte de 1M de tokens.
21 juil. Google Gemini 3.6 Flash, sortie moins chère, plus rapide, même Intelligence Index
Gemini 3.6 Flash est le tout dernier modèle Flash de Google et celui que l'application gratuite Gemini atteint désormais. La sortie tombe à 7,50 $ par 1M de tokens contre 9,00 $ tandis que l'entrée reste à 1,50 $, la baisse ne concerne donc que la sortie. Google affirme qu'il « réduit l'utilisation de tokens de sortie de 17 % par rapport à 3.5 Flash », et jusqu'à 65 % sur le travail agentique de long horizon comme DeepSWE, si bien que l'économie réelle par tâche est plus grande que le prix affiché. Artificial Analysis note 3.6 Flash et 3.5 Flash au même Intelligence Index de 50 sur v4.1, alors traitez-le comme moins cher et plus rapide plutôt que plus intelligent. Il est arrivé aux côtés de Gemini 3.5 Flash-Lite à 0,30 $ / 2,50 $, et il est en ligne via l'API Gemini dans Google AI Studio et Android Studio, la Gemini Enterprise Agent Platform et l'application Gemini pour tous. Google a aussi annoncé Gemini 3.5 Flash Cyber, mais celui-ci n'est pas sorti : il est destiné aux gouvernements et partenaires de confiance via CodeMender sous forme de pilote à accès limité.
16 juil. Moonshot AI Kimi K3, 2,8B de paramètres, le plus grand modèle open-weight jamais publié (poids sortis le 27 juillet) Nouveau
Moonshot AI a lancé Kimi K3 à la veille du 16 juillet 2026, son nouveau modèle phare et le successeur de la lignée K2, puis a publié les open weights complets le 27 juillet 2026. La carte de modèle sur Hugging Face confirme une conception Mixture-of-Experts de 2,8 billions de paramètres avec 104 milliards de paramètres actifs par token, une fenêtre de contexte de 1 048 576 tokens et une entrée texte, image et vidéo (sans audio). Le raisonnement est toujours actif, et reasoning_effort accepte désormais low, high ou max, avec max par défaut. Artificial Analysis place K3 à un Intelligence Index de 57, le plus élevé de tous les modèles open-weight, et sur Arena, il est #3 sur le classement Agent et #2 sur WebDev derrière Claude Opus 5. Le tarif officiel de l'API est de 3 $ / 15 $ par 1M de tokens avec une entrée en cache à 0,30 $, plus 0,005 $ par appel de recherche web réussi. Le téléchargement représente 96 shards safetensors et environ 1,56 To sous une licence propre Kimi K3 License plutôt que MIT, donc l'auto-hébergement est un travail multi-nœuds ; un palier de chat de base gratuit existe dans l'application Kimi, l'usage agentique plus intensif étant facturé sur les forfaits payants.
9 juil. OpenAI GPT-5.6 Sol, Terra et Luna, famille nouvelle génération en ligne sur ChatGPT, Codex et l'API
OpenAI a ouvert sa famille GPT-5.6 à la disponibilité générale le 9 juillet 2026, mettant fin à l'aperçu fermé de deux semaines qui avait commencé le 26 juin derrière une revue de sécurité du gouvernement américain. La gamme va du moins au plus capable : Luna, un palier rapide et à faible coût ; Terra, un modèle équilibré pour le quotidien qu'OpenAI dit égaler GPT-5.5 à environ moitié coût ; et Sol, le modèle phare, réglé pour la biologie, la chimie et la cybersécurité. GPT-5.6 est désormais déployé sur ChatGPT, Codex et l'API comme modèle par défaut d'OpenAI, avec des tarifs d'API de lancement de Sol 5 $ / 30 $, Terra 2,50 $ / 15 $ et Luna 1 $ / 6 $ par 1M de tokens ; Terra et Luna ont été réduits le 30 juillet 2026 à 2 $ / 12 $ et 0,20 $ / 1,20 $. Sur les rares benchmarks publiés par OpenAI, Sol obtient 88,8 % sur Terminal-Bench 2.1 (91,9 % dans son mode « ultra » à plus grosse puissance de calcul) contre les 88,0 % de GPT-5.5, et 60,5 sur HealthBench Professional ; OpenAI a notamment retenu les habituels chiffres SWE-bench Verified, GPQA et FrontierMath, et sa fenêtre de contexte n'est toujours pas publiée officiellement. Une réserve : la propre system card d'OpenAI et l'évaluateur externe METR ont signalé un comportement de « scheming » élevé chez Sol, y compris le contournement d'un test d'ingénierie logicielle au taux le plus élevé que METR ait jamais enregistré.
En attente Google Gemini 3.5 Pro, toujours pas sorti, des mois de retard selon Bloomberg Retardé
Gemini 3.5 Pro reste le plus gros lancement en attente. Google l'a annoncé à l'I/O le 19 mai aux côtés de Gemini 3.5 Flash, mais seul Flash est sorti, et l'objectif de juin a glissé. Bloomberg a rapporté le 16 juillet 2026 que le modèle a des mois de retard et n'a pas atteint les objectifs internes de Google, l'entreprise travaillant encore à améliorer ses capacités, en particulier en programmation. C'est tout le tableau sourcé. Google n'a jamais confirmé publiquement de date de lancement, et Google n'a pas publié de spécifications finales telles que la fenêtre de contexte ou les modes de raisonnement, alors traitez les chiffres qui circulent comme non confirmés. Utilisez Gemini 3.6 Flash entre-temps ; nous ferons passer 3.5 Pro dans le classement principal dès qu'il sera en ligne.
Choix de catégorie, août 2026

Meilleure IA pour l'écriture

1
Claude Fable 5
Meilleure écriture globale
2
Kimi K3
Fiction créative
3
Claude Sonnet 5
Gratuit au quotidien

La meilleure IA pour l'écriture est Claude Fable 5, le seul modèle dans le top trois des trois classements indépendants d'écriture, avec Claude Sonnet 5 comme choix rapport qualité-prix de la version gratuite et GPT-5.5 comme alternative pour l'écriture professionnelle ancrée dans les faits. Fable 5 domine le classement d'écriture créative d'Arena, arrive en tête de LiveBench Language à 90,7 et se place troisième sur EQ-Bench Creative Writing v3 derrière Kimi K3 et GPT-5.6 Sol. Aucun autre modèle n'est dans le top trois sur plus d'un de ces classements. C'est un changement par rapport au mois dernier, où Claude Sonnet 5 occupait cette place sur GDPval-AA ; les classements de préférence ne soutiennent pas ce placement, donc Sonnet 5 est désormais le choix rapport qualité-prix plutôt que le leader en qualité. Fable 5 coûte 10 $ / 50 $ par 1M de tokens et est inclus en permanence dans Claude Max et Team Premium à environ 50 % des limites d'usage habituelles. Si votre écriture est un livrable de travail plutôt que de la prose, Claude Opus 5 domine haut la main le classement GDPval-AA v2 de livrables professionnels d'Artificial Analysis à 1858, bien devant les 1746 de Fable 5.

ModèleIdéal pourForceFaiblessePrix (par 1M de tokens)
Claude Fable 5Meilleure écriture globale#1 Arena texte global (1508.6), #1 LiveBench Language (90.7), #3 EQ-BenchL'option la plus chère ici10 $ / 50 $
Kimi K3Fiction créative et voix#1 EQ-Bench Creative Writing (2377), 234 Elo d'avance sur le deuxièmeSeulement #10 sur Arena écriture créative3 $ / 15 $
Claude Sonnet 5Écriture gratuite au quotidienGratuit et par défaut sur claude.ai, contexte 1M#53 Arena écriture créative ; 75,0 LiveBench Language2 $ / 10 $ tarif de lancement (puis 3 $ / 15 $)
Claude Opus 5Livrables professionnels#1 GDPval-AA v2 à 1858, devant Fable 5 (1746)Derrière Fable 5 sur Arena texte et Humanity's Last Exam5 $ / 25 $
GPT-5.5Écriture professionnelle ancrée dans les faitsGains documentés de fiabilité factuelle sur GPT-5.4Les paliers de raisonnement sont désormais marqués obsolètes5 $ / 30 $
Gemini 3.6 FlashBrouillons en masse à grande échelle17 % de tokens de sortie en moins que 3.5 FlashPlus faible sur le raisonnement le plus ardu1,50 $ / 7,50 $
Deuxième place et alternatives : Kimi K3 est le deuxième pour la fiction créative et remporte EQ-Bench haut la main, Claude Sonnet 5 est le deuxième au rapport qualité-prix et celui à utiliser si vous ne payez pas, Claude Opus 5 est le choix pour les livrables professionnels, et Gemini 3.6 Flash est le choix pour la rédaction de brouillons en masse.
Ce qui a changé ce mois-ci

La couronne de l'écriture reste à Claude Fable 5, et c'est le choix le mieux étayé de la page. Fable 5 est désormais #1 sur le classement texte d'Arena à 1508.6 à la date de clôture du 1er août, #1 sur Humanity's Last Exam à 53,3 % et #1 sur AA-Omniscience à 40, soit trois maisons différentes qui concordent. Claude Opus 5 conserve le couloir des livrables professionnels sur GDPval-AA v2, où le classement réajusté affiche désormais 1858 contre les 1746 de Fable 5.

Choix de catégorie, août 2026

Meilleure IA pour le chat & ; l'assistant du quotidien

1
GPT-5.6
Par défaut de ChatGPT
2
Claude Fable 5
Le mieux noté
3
Claude Opus 5
Profondeur réfléchie

La meilleure IA pour le chat du quotidien est GPT-5.6, et la raison honnête tient à la portée plutôt qu'à la position dans les classements. C'est le modèle que ChatGPT sert par défaut à la plus grande base d'utilisateurs de la catégorie, ce qui en fait le meilleur assistant que la plupart des gens peuvent réellement ouvrir. En préférence humaine pure, ce n'est pas le leader : GPT-5.6 Sol se situe #14 sur le classement texte d'Arena à 1482,8, où Claude Fable 5 domine à 1508.6. La plupart des utilisateurs de ChatGPT reçoivent le palier équilibré Terra, qu'OpenAI dit égaler GPT-5.5 et qui, depuis la baisse de prix du 30 juillet 2026, coûte 60 % de moins. Il est disponible dans ChatGPT (gratuit avec limites, Plus à 20 $/mois, Pro à 100 $/mois), via l'API (Luna 0,20 $ / 1,20 $, Terra 2 $ / 12 $, Sol 5 $ / 30 $ par 1M de tokens), et intégré dans Fello AI aux côtés de Claude, Gemini, Grok et DeepSeek. Une réserve : la system card d'OpenAI et l'évaluateur METR ont signalé un comportement de « scheming » élevé chez Sol, donc GPT-5.5 Instant reste le choix le plus sûr pour un travail sensible aux hallucinations.

ModèleIdéal pourForceFaiblessePrix
GPT-5.6Chat du quotidien, par défaut de ChatGPTL'assistant que la plupart peuvent ouvrir ; Terra égale GPT-5.5 à ~moitié coût#14 sur Arena texte ; scheming signalé par METRGratuit / 20 $/mois Plus ; API 0,20 $ / 1,20 $ à 5 $ / 30 $
Claude Fable 5La conversation la mieux notée#1 sur Arena texte global (1508.6) et dans 6 des 7 sous-catégoriesPas de version gratuite ; accès par crédits d'usage sur Pro10 $ / 50 $ API
Claude Opus 5Réponses réfléchies et nuancées#1 Artificial Analysis Intelligence Index (61) et Agentic Index (55.3)#6 sur Arena texte, derrière Claude Fable 520 $/mois Pro, 5 $ / 25 $ API
GPT-5.5 InstantTravail quotidien sensible aux hallucinations52,5 % d'affirmations hallucinées en moins vs 5.3 InstantLes paliers de raisonnement sont désormais marqués obsolètes20 $/mois Plus ; API 5 $ / 30 $
Gemini 3.6 FlashRapide, gratuit, multimodalGratuit dans l'application Gemini, contexte 1M, #12 sur Arena textePlus faible sur le raisonnement le plus arduGratuit / 1,50 $ / 7,50 $ API
Fello AITous les meilleurs modèles, une seule appChatGPT + Claude + Gemini + Grok + DeepSeek et plus sur Mac, iPhone et iPadAcheminé via l'app, pas en direct9,99 $/mois
Deuxième place et alternatives : Claude Fable 5 est le deuxième et le véritable leader de préférence, Claude Opus 5 est le deuxième pour un usage quotidien réfléchi, Gemini 3.6 Flash est le deuxième pour rapide et gratuit, et Grok 4.5 est le choix de niche pour les jours d'actualité en direct. Fello AI est le choix naturel si vous voulez les meilleurs modèles dans une seule app Mac et iOS à 9,99 $/mois plutôt que de jongler avec les abonnements.
Ce qui a changé ce mois-ci

GPT-5.6 conserve le choix chat grâce à la portée, et l'écart avec le leader de préférence s'est creusé plutôt que résorbé. À la clôture du 1er août, Sol se situe #14 sur Arena texte à 1482,8, en baisse depuis #11, tandis que Claude Fable 5 domine à 1508.6. Rien n'a changé côté produit, donc la couronne ne bouge pas : il s'agit toujours de savoir quel assistant la plupart des gens peuvent réellement ouvrir.

Choix de catégorie, août 2026

Meilleure IA pour les images

1
ChatGPT Images 2.0
Texte dans les images
2
Reve 2.1
Mise en page & ; 4K
3
Muse Image
Édition d'images

La meilleure IA pour la génération d'images est ChatGPT Images 2.0, et c'est la couronne la moins contestée de cette page. GPT Image 2 domine le classement texte vers image d'Arena à 1385 Elo et son classement d'édition d'images à 1463, et Artificial Analysis le place premier sur sa propre arène d'image à 1339,4. C'est le choix naturel chaque fois que votre image doit contenir des mots lisibles, en français ou dans une autre écriture, et il est inclus dans ChatGPT Plus et Pro. Les deuxièmes places ont changé. Reve 2.1 (9 juillet) est le vrai #2 en texte vers image à 1302, et Reve 2.0 se situe désormais derrière lui sur les deux classements. Muse Image de Meta est #3 sur le classement texte vers image d'Arena et #2 en édition d'images, la meilleure performance jamais réalisée par un modèle d'image de Meta. Nano Banana Pro de Google n'est plus le deuxième dans l'ensemble : en texte vers image, il se classe entre #8 et #11, en dessous de son propre petit frère moins cher Nano Banana 2, même s'il se place plus haut en édition d'images.

ModèleIdéal pourForceFaiblessePrix
ChatGPT Images 2.0Images avec texte lisible#1 texte vers image (1385) et #1 édition d'images (1463)Moins photoréaliste que la lignée d'image GeminiInclus dans ChatGPT Plus
Reve 2.1Mise en page, typographie, 4K natif#2 texte vers image à 1302, édition préservant la mise en pageÉcosystème plus petitGratuit / à partir de 7,99 $/mois
Muse ImageÉdition d'images, écosystème Meta#3 texte vers image, #2 édition d'images (1407)Nouveau, outillage limité autourApplication Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Portraits et produits photoréalistesSurpasse Nano Banana Pro sur les deux classementsPlus faible sur le texte dans l'imageApplication Gemini / AI Studio
Seedream 5.0 ProTexte multilingue + édition par régions10+ langues dont l'arabe RTL, édition au lasso et par calquesAucun benchmark indépendant ; incertitude sur les droits d'auteurBytePlus / Magnific
Midjourney v8Art stylisé, illustrationBase esthétique que la plupart des artistes préfèrentPlus faible sur le texte dans l'image10-120 $/mois
Grok ImagineNSFW / Spicy ModeLes garde-fous les plus permissifsUn modèle plus petit derrière30 $/mois SuperGrok
Deuxième place et alternatives : Reve 2.1 est le deuxième dans l'ensemble et le choix pour la mise en page et la typographie, Muse Image est le deuxième pour éditer une image que vous avez déjà, et Nano Banana 2 est le choix photoréaliste. Grok Imagine reste le seul modèle frontier qui autorise le contenu pour adultes en Spicy Mode.
Ce qui a changé ce mois-ci

La couronne de l'image est inchangée et GPT Image 2 domine toujours les trois classements que nous suivons, sur Arena texte vers image (1385), Arena édition d'images (1463) et l'arène d'image d'Artificial Analysis (1339,4). Le seul ajout est MAI-Image-2.5 de Microsoft, qui se situe troisième sur le classement image d'Artificial Analysis à 1269,7 et troisième sur le classement d'édition d'images d'Arena, si bien que la troisième place dépend désormais de la maison que vous lisez.

Choix de catégorie, août 2026

Meilleure IA pour la vidéo

1
Gemini Omni Flash
#1 sur les deux classements vidéo
2
MiniMax H3
2K + audio natif
3
Dreamina Seedance 2.0
Le concurrent le plus proche

La meilleure IA pour la génération de vidéo est Gemini Omni Flash, qui domine le classement texte vers vidéo d'Arena à 1527 Elo, 45 points complets devant la deuxième place, et arrive aussi en tête de l'arène vidéo d'Artificial Analysis. Il est #1 dans les deux maisons, ce qu'aucun autre modèle vidéo ne réussit. Le tarif s'établit à 1,50 $ en entrée et 17,50 $ par 1M de tokens de sortie vidéo, ce qui revient à environ 0,10 $ par seconde de vidéo finie, et il prend en charge l'édition conversationnelle. La seule vraie limite est la durée : Omni Flash génère des clips de 10 secondes. Si vous avez besoin de prises plus longues, Veo 3.1 reste le bon outil dans l'application Gemini, AI Studio et Vertex AI, avec audio natif et sortie 1080p. Cela remplace Veo 3.1 en tête de la catégorie ; Veo 3.1 est un bon modèle mais pas le leader, sa meilleure variante étant #6 sur le classement texte vers vidéo d'Arena. Le prétendant à surveiller est MiniMax H3 (31 juillet), qui génère des clips 2K de 4 à 15 secondes avec un audio stéréo natif et est facturé à la seconde à partir de 0,13 $ en 2K, déjà #2 sur le classement vidéo d'Artificial Analysis à 1241,5. Nous ne déplaçons pas la couronne pour autant : le score a un jour, provient du seul classement qui ne s'est pas reproduit entre les analyses, et la limite des votes texte vers vidéo d'Arena est antérieure à H3.

ModèleIdéal pourForceFaiblessePrix
Gemini Omni FlashMeilleure vidéo d'IA globale#1 sur les deux classements vidéo (1527 Arena), édition conversationnellePlafonne à des générations de 10 secondes~0,10 $/s ; application Gemini / AI Studio
MiniMax H3Clips 2K avec audio natif4-15 s en 2K, audio stéréo natif ; #2 sur AA vidéo (1241.5)Un jour d'existence, pas encore de votes Arena ; poids non publiés0,13 $/s en 2K
Dreamina Seedance 2.0Le concurrent le plus proche#2 texte vers vidéo (1482) et #1 en image vers vidéoÉcosystème ByteDance, accès occidental limitéDreamina / BytePlus
Muse VideoVidéo dans l'écosystème Meta#3 texte vers vidéo à 1459Le plus récent du groupe, outillage limitéApplication Meta AI
Veo 3.1Clips de production plus longsAudio natif, 1080p, forte cohérence physique#6 sur Arena vidéo, pas le leader en qualitéGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboItération rapide à moindre coût4K natif, 60fps, clips de 15 secondes ; Turbo sorti le 17 juinHors du top 16 sur Arena texte vers vidéoÀ partir de 10 $/mois
Luma Ray 3Scènes photoréalistesFort réalisme pour les paysagesCommunauté plus petiteGratuit / à partir de 9,99 $/mois
Deuxième place et alternatives : Dreamina Seedance 2.0 est le deuxième dans l'ensemble et bat en fait Omni Flash en image vers vidéo, Muse Video est troisième, et Veo 3.1 est le choix quand 10 secondes ne suffisent pas. OpenAI a retiré l'application grand public Sora 2 le 26 avril 2026 et seule l'API pour développeurs demeure, jusqu'au 24 septembre 2026.
Ce qui a changé ce mois-ci

Gemini Omni Flash conserve la couronne vidéo, et il est toujours #1 sur les deux classements, à 1527,5 sur Arena et 1244,8 sur Artificial Analysis. MiniMax H3 (31 juillet) entre en prétendant à #2 sur le classement vidéo d'Artificial Analysis (1241,5), à 3,3 Elo, et bat Omni Flash sur les spécifications avec une sortie 2K, des clips jusqu'à 15 secondes et un audio stéréo natif. Nous conservons la couronne car cet écart a un jour, provient d'un seul classement et ne porte aucun vote sur Arena, dont la limite texte vers vidéo est antérieure au lancement.

Choix de catégorie, août 2026

Meilleure IA pour la programmation

1
Claude Opus 5
#1 Arena WebDev
2
Claude Fable 5
Long horizon le plus ardu
3
Kimi K3
Apps web et agents

La meilleure IA pour la programmation est Claude Opus 5, et il gagne sur les deux classements où les développeurs votent sur le résultat fini plutôt qu'un script mesurant un harness. Il est #1 sur le classement WebDev d'Arena à 1,702.9 et #1 en image-to-WebDev à 1,668.6, sur des clôtures de votes du 1er août et du 31 juillet. Le prix est la seconde moitié de l'argument : Opus 5 tourne à 5 $ / 25 $ par 1M de tokens contre les 10 $ / 50 $ de Claude Fable 5, et Artificial Analysis le mesure à 2,34 $ par tâche d'index contre les 3,15 $ de Fable 5. La propre documentation d'Anthropic dit aux développeurs de commencer par Opus 5 pour la programmation agentique complexe et de réserver Fable 5 aux charges qui exigent la capacité la plus élevée disponible. Claude Fable 5 est le deuxième et reste le choix pour le travail de long horizon le plus ardu, à #4 sur WebDev (1,630.7) et #2 en image-to-WebDev (1,625.7). Le prétendant est Kimi K3, qui prend le #2 sur WebDev à 1,675.5 et le #3 sur le classement Agent d'Arena, le programmeur open-weight le plus fort des classements, même si l'auto-héberger signifie 1,56 To de poids. Sur le Coding Index d'Artificial Analysis, ce n'est pas un raz-de-marée Claude : GPT-5.6 Sol (xhigh) domine à 78,3 avec Opus 5 (max) à 78,0, assez proche pour parler d'égalité. Le prétendant sérieux le moins cher est désormais DeepSeek V4-Flash 0731 à 0,14 $ / 0,28 $.

ModèleIdéal pourForceFaiblessePrix (par 1M de tokens)
Claude Opus 5Meilleure programmation globale#1 Arena WebDev (1,702.9) et #1 image-to-WebDev (1,668.6) ; 2,34 $ par tâche d'indexLe Coding Index d'Artificial Analysis place GPT-5.6 Sol d'un cheveu devant5 $ / 25 $
Claude Fable 5Le travail agentique de long horizon le plus ardu#2 Arena image-to-WebDev (1,625.7), #4 WebDev ; contexte 1MLe plus cher ; le Coding Index d'Artificial Analysis le place 7e10 $ / 50 $
Kimi K3Création d'apps web et agents#2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index ouvert le plus élevé (57)1,56 To pour l'auto-héberger3 $ / 15 $
GPT-5.6 SolModèle phare d'OpenAI, programmation agentique#1 Artificial Analysis Coding Index à 78,3 (xhigh)Absent du classement officiel Terminal-Bench ; manipulation d'évaluations signalée par METR5 $ / 30 $
Muse Spark 1.2Programmation agentique bon marchéIntelligence Index 54 à 1,25 $ / 4,25 $ ; 80 % sur Terminal-Bench 2.1 (Artificial Analysis)Deuxième derrière Opus 5 sur les trois graphiques de programmation propres à Meta (82,9 % vs 86,7 %) ; Scale SEAL n'a évalué que la 1.11,25 $ / 4,25 $
Grok 4.5Programmeur bon marché au bon rapport qualité-prix#4 sur le classement officiel Terminal-Bench 2.1 à 79,3 % via Cursor CLITaux d'hallucination plus élevé ; console API de l'UE encore fermée2 $ / 6 $
Gemini 3.6 FlashProgrammation d'agents à grande échelleIntelligence Index 50, 17 % de tokens de sortie en moins que 3.5 FlashPlus faible sur le raisonnement le plus ardu1,50 $ / 7,50 $
GLM-5.2Meilleur programmeur open-weight que vous pouvez hébergerIntelligence Index 51, #6 Arena WebDev (1,587.1), licence MITKimi K3 le surclasse ; auto-hébergement ou fournisseur uniquementOpen weights (MIT)
Deuxième place et alternatives : Kimi K3 est le deuxième sur le classement WebDev d'Arena et le choix si vous voulez les open weights les plus forts, Claude Fable 5 est le deuxième pour le travail de long horizon le plus ardu, GPT-5.6 Sol est le deuxième sur le composite d'Artificial Analysis, et GLM-5.2 est le choix open-weight pour les équipes qui l'hébergent elles-mêmes. Dans les IDE, Cursor avec Claude reste l'association la plus populaire et Claude Code est le choix naturel si vous vivez dans le terminal.
Ce qui a changé ce mois-ci

La couronne de la programmation est passée à Claude Opus 5. Arena a fini de l'évaluer, et il est arrivé premier sur les deux classements de programmation, WebDev à 1,702.9 et image-to-WebDev à 1,668.6, avec Claude Fable 5 quatrième et deuxième. Ce sont des classements par votes avec des clôtures publiées, donc la couronne repose désormais sur des comparaisons humaines plutôt que sur un seul harness, et Opus 5 le fait à moitié prix de Fable 5. Fable 5 devient le deuxième pour le travail de long horizon le plus ardu, et Kimi K3 reste le prétendant à #2 sur WebDev. Muse Spark 1.2 de Meta est arrivé le 5 août et ne change rien à cela, car sur les propres graphiques de Meta, il termine deuxième derrière Opus 5 sur chaque benchmark de programmation qu'il a publié.

Choix de catégorie, août 2026

Meilleure IA pour la créativité

1
Grok 4.5
Le moins de garde-fous
2
Claude Fable 5
Prose de la plus haute qualité
3
Kimi K3
Fiction et voix

La meilleure IA pour un travail créatif sans filtre et dans l'air du temps est Grok 4.5, et nous tenons à être précis sur le pourquoi. Ce choix porte sur le produit, pas sur la qualité de la prose. Grok 4.5 porte le moins de restrictions de contenu de tous les modèles frontier et la seule intégration native de X en temps réel, ce qui en fait le seul modèle qui s'engagera sur des briefs audacieux, d'actualité ou délibérément provocateurs que les autres refusent. Il est le modèle par défaut dans l'application Grok pour les abonnés SuperGrok et X Premium+ à 30 $/mois. Ce n'est pas le meilleur rédacteur, et les classements sont sans détour à ce sujet. Grok 4.5 se situe #33 sur EQ-Bench Creative Writing et #41 sur le classement d'écriture créative d'Arena, perdant sur les deux face au plus ancien Grok 4.20-beta1. Si vous choisissez sur la seule qualité de sortie, Claude Fable 5 gagne haut la main à #1 sur Arena écriture créative, et Kimi K3 remporte EQ-Bench. Choisissez Grok 4.5 pour ce qu'il vous laisse créer, pas pour la qualité de son écriture.

ModèleIdéal pourForceFaiblessePrix
Grok 4.5Sans filtre, affirmé, dans l'air du tempsLe moins de restrictions de contenu, ancrage natif dans X en temps réel#33 EQ-Bench, #41 Arena écriture créative30 $/mois SuperGrok
Claude Fable 5Prose créative de la plus haute qualité#1 Arena écriture créative, #1 LiveBench LanguageGarde-fous prudents sur les briefs audacieux10 $ / 50 $ API
Kimi K3Fiction et voix distinctive#1 EQ-Bench Creative Writing à 2377Seulement #10 sur Arena écriture créative3 $ / 15 $
Claude Opus 5Créativité structurée de format longTient de longs fils et s'auto-édite ; #1 Intelligence IndexLe plus prudent du groupe20 $/mois Pro ; 5 $ / 25 $ API
Gemini 3.1 ProCréatif multimodalChaîne texte, image et vidéo solideQuotas dans l'application GeminiGratuit / 2,00-4,00 $ API entrée
Grok Imagine (Spicy Mode)NSFW / créatif pour adultesLa génération d'images la plus permissiveCas d'usage de niche30 $/mois SuperGrok
Deuxième place et alternatives : Claude Fable 5 est le deuxième et le bon choix si la qualité compte plus que la liberté, Kimi K3 est le choix pour la fiction, et Claude Opus 5 est le choix pour les projets créatifs qui s'étalent sur de nombreux tours. Pour le travail créatif pour adultes, Grok Imagine Spicy Mode reste la seule option de niveau frontier.
Ce qui a changé ce mois-ci

Grok 4.5 conserve ce choix, et rien n'a bougé côté produit. Il est là pour sa permissivité et son accès en direct à X, pas pour sa position dans les classements, et Claude Fable 5 reste le modèle à utiliser quand vous voulez la meilleure écriture. Une note de nom pour août : xAI cote désormais sur les classements sous le nom de SpaceXAI, et le modèle est inchangé.

Choix de catégorie, août 2026

Meilleure IA pour la précision & ; la recherche

1
Gemini 3.1 Pro
98 % ARC-AGI-1
2
Claude Fable 5
Recherche ancrée
3
GPT-5.6 Sol
Raisonnement inédit

La meilleure IA pour la précision et la recherche est Gemini 3.1 Pro. Son résultat le plus fort est sur ARC-AGI-1 d'ARC Prize, où il obtient 98 % et égale le panel humain, et il le fait à 0,52 $ la tâche. Cette combinaison est l'argument : plusieurs modèles sont proches en capacité, aucun ne l'égale sur le coût pour un travail factuel fiable. Il l'associe à un ancrage natif dans Google Search, ce que vous voulez lorsque la réponse doit être actuelle plutôt que simplement plausible. Il obtient aussi 94,1 % sur GPQA Diamond, où GPT-5.6 Sol l'égale désormais plutôt que de le suivre, et 44,4 % sur Humanity's Last Exam, et arrive en tête du classement HLE de Scale SEAL à 46,44. Nous avons abandonné le cadrage précédent sur ARC-AGI-2 : ses 77,1 % restent corrects, mais le classement a bougé et ce score le place désormais autour de la 14e place. Deux réserves honnêtes. Sur la recherche ancrée en particulier, le classement de recherche d'Arena est mené par Anthropic, pas par Google, avec Gemini 3.1 Pro ancré à #7. Et sur le raisonnement inédit, GPT-5.6 Sol domine ARC-AGI-2 et Claude Opus 5 domine ARC-AGI-3 à 30 %, environ 3,75x le modèle suivant. Nous n'avons pas déplacé la couronne vers Opus 5 car Artificial Analysis mesure son taux d'hallucination à 50 % et le place en dessous de Fable 5 sur AA-Omniscience.

ModèleIdéal pourBenchmark cléFaiblessePrix
Gemini 3.1 ProTravail factuel bon marché et fiable98 % ARC-AGI-1 (égale le panel humain) à 0,52 $/tâche, 94,1 % GPQA (égalé par Sol)ARC-AGI-2 77,1 % désormais ~14e ; #7 sur Arena recherche2,00-4,00 $ / 12,00-18,00 $ (échelonné)
Claude Fable 5Recherche ancrée#1 et #3 sur le classement de recherche d'Arena, devant GooglePas de palier bon marché unique10 $ / 50 $ (Fable 5)
GPT-5.6 SolRaisonnement inédit#1 ARC-AGI-2 à 93 %, contre un panel humain à 100 %Scheming signalé par METR5 $ / 30 $
Claude Opus 5Les problèmes inédits les plus ardus#1 ARC-AGI-3 à 30 %, ~3,75x le modèle suivant (ARC Prize)Artificial Analysis mesure un taux d'hallucination de 50 %5 $ / 25 $
Qwen 3.7 MaxPrécision frontier à prix avantageux92,4 GPQA Diamond, 200 requêtes gratuites/jourAPI uniquement, pas de front-end de chat1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste
Claude Opus 4.6Honnêteté sous pression#1 sur le classement MASK de Scale SEAL à 96,28 ; Anthropic occupe le top 5Remplacé comme modèle phareModèle legacy d'Anthropic
Deuxième place et alternatives : les modèles d'Anthropic sont le deuxième pour la recherche ancrée et balaient le classement d'honnêteté sous pression, GPT-5.6 Sol est le deuxième pour le raisonnement inédit, et Qwen 3.7 Max est le choix rapport qualité-prix à la frontière.
Ce qui a changé ce mois-ci

Gemini 3.1 Pro conserve la couronne de la précision, mais son chiffre phare n'est plus une avance. Son score GPQA Diamond a été réajusté à 94,1 % et GPT-5.6 Sol l'égale désormais exactement, si bien que la couronne repose sur le résultat ARC-AGI-1 à 0,52 $ la tâche plus l'ancrage Search plutôt que sur GPQA. C'est la prochaine couronne que nous retestons : Claude Fable 5 arrive en tête des trois classements qui mesurent la fréquence à laquelle un modèle se trompe purement et simplement, à 40 sur AA-Omniscience, 61 % sur Omniscience Accuracy et 53,3 % sur Humanity's Last Exam.

Choix de catégorie, août 2026

Meilleure IA pour la résolution de problèmes

1
GPT-5.6 Sol
Modèle phare STEM
2
Claude Opus 5
Chaînes agentiques
3
GPT-5.5 Pro
FrontierMath vérifié

La meilleure IA pour la résolution de problèmes ardus est GPT-5.6 Sol, et c'est la couronne la mieux étayée de cette page. Il prend le #1 sur LiveBench Mathematics à 96,2, le #1 sur LiveBench Reasoning à 91,7 et le #1 sur ARC-AGI-2 à 93 %, ce qui est le plus proche qu'un modèle ait jamais approché du panel humain à 100 %. Trois maisons distinctes le placent premier sur les tâches de raisonnement qui comptent, soit plus d'accord que n'en produit toute autre catégorie de cette page. OpenAI n'a toujours pas publié le score FrontierMath de Sol, donc la marque OpenAI vérifiée reste les 39,6 % de GPT-5.5 Pro sur FrontierMath Tier 4, et nous insérerons le chiffre de Sol dès qu'il sera rendu public. Qwen 3.7 Max est l'alternative rapport qualité-prix pour les problèmes de type compétition à 97,1 sur l'index HMMT de février 2026 et 44,5 sur Apex, à une fraction du coût de ChatGPT Pro, et il inclut désormais 200 requêtes de modèle gratuites par jour. Claude Opus 5 est l'alternative pour les longues chaînes de raisonnement agentique, dominant l'Agentic Index d'Artificial Analysis à 55,3 et ARC-AGI-3 d'ARC Prize à 30 %, environ 3,75x le modèle suivant.

ModèleIdéal pourBenchmark cléFaiblessePrix
GPT-5.6 SolLes mathématiques, la science et le raisonnement les plus ardus#1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %)FrontierMath toujours non publié ; scheming signalé par METR100 $/mois ChatGPT Pro ; API 5 $ / 30 $
Claude Opus 5Longues chaînes de raisonnement agentique#1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %)Deuxième sur LiveBench Reasoning ; taux d'hallucination de 50 %5 $ / 25 $
GPT-5.5 ProLeader vérifié de FrontierMath39,6 % FrontierMath Tier 4Remplacé par Sol comme modèle phare100 $/mois ChatGPT Pro
Qwen 3.7 MaxMathématiques de compétition avec un budget serré97,1 HMMT 2026 févr., 44,5 Apex, 200 requêtes gratuites/jourAPI uniquement1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif liste
Claude Fable 5Mathématiques au sein d'un flux de programmation#1 sur la sous-catégorie mathématiques d'Arena (1543), 96,0 LiveBench MathematicsL'option la plus chère ici10 $ / 50 $
GLM-5.2Résolution de problèmes open-weightIntelligence Index ouvert le plus élevé à 51, MIT, contexte 1MAuto-hébergement ou fournisseur uniquementOpen weights (MIT)
Deuxième place et alternatives : Claude Opus 5 est le deuxième et le choix naturel pour le raisonnement agentique à longue chaîne, Claude Fable 5 est le deuxième sur le classement mathématiques d'Arena, Qwen 3.7 Max est le choix rapport qualité-prix, et GLM-5.2 est le choix open-weight.
Ce qui a changé ce mois-ci

GPT-5.6 Sol conserve cette couronne, et il a gagné un second argument. Sol domine désormais aussi le Terminal-Bench v2.1 d'Artificial Analysis à 89,5 % et son Coding Index à 78,3, et il égale Gemini 3.1 Pro sur GPQA Diamond à 94,1 %. Claude Opus 5 reste l'alternative de raisonnement agentique grâce à ARC-AGI-3. Le 1er août, OpenAI a nommé sa prochaine famille de modèles Astra et a publié dix nouveaux résultats mathématiques issus d'une version interne, bien qu'Astra ne soit pas sorti et n'ait ni date, ni prix, ni disponibilité.

Choix de catégorie, août 2026

Meilleur agent d'IA

1
Gemini Spark
Cloud 24/7
2
Claude Cowork
IA de bureau
3
ChatGPT Codex
Agent de programmation

Le meilleur agent d'IA en ce moment est Gemini Spark pour le travail résident dans le cloud 24/7 et Claude Cowork pour le travail résident sur le bureau, avec ChatGPT Codex comme alternative pour les agents de programmation et les agents de navigateur de classe OpenAI Operator comme alternative pour les tâches web. Les agents d'IA sont la catégorie qui évolue le plus vite en 2026 : chaque fournisseur de premier plan propose désormais un produit d'agent, et le choix pratique se situe entre des agents qui vivent dans le cloud (tournent pendant que votre ordinateur portable est fermé) et des agents qui vivent sur votre bureau (pilotent vos apps directement). Gemini Spark a été lancé au Google I/O le 19 mai 2026 et est le premier agent cloud 24/7. Claude Cowork a atteint la disponibilité générale le 9 avril 2026 et fonctionne comme un agent de bureau qui pilote vos apps locales. ChatGPT Codex Mobile (14 mai) est le choix pour le travail d'agent de programmation. Lisez le comparatif complet Gemini Spark vs Claude Cowork.

AgentIdéal pourOù il tourneForcePrix
Gemini SparkTâches cloud 24/7, flux WorkspaceVM Google Cloud (toujours active)Premier vrai agent 24/7, intégration profonde à Workspace99,99 $/mois Google AI Ultra
Claude CoworkBureau, pilotage d'apps, design + codeVotre bureau Mac/WindowsPilote les apps locales, voit votre écran20 $/mois Claude Pro
ChatGPT Codex MobileAgent de programmation sur téléphoneCloud OpenAI + iOS/AndroidApprouver des diffs et réorienter le travail depuis le téléphoneInclus dans les forfaits ChatGPT
Grok Agentic (Grok 4.5)Recherche en temps réel, scraping de XCloud xAIIntégration native de X30 $/mois SuperGrok
OpenAI de classe OperatorTâches de navigateur, formulaires webCloud OpenAI + votre navigateurAutomatisation webChatGPT Pro
Deuxième place et alternatives : Claude Cowork est le deuxième dans l'ensemble et le choix naturel quand vous voulez l'agent sur votre machine pilotant vos apps. ChatGPT Codex Mobile est le deuxième pour les agents de programmation. Grok Agentic est le choix de niche pour la recherche en temps réel.
Ce qui a changé ce mois-ci

Aucun nouvel agent grand public n'est sorti, et Muse Code de Meta (5 août) est un outil de terminal pour développeurs plutôt qu'un outil grand public, si bien que le choix entre Gemini Spark (cloud) et Claude Cowork (bureau) guide toujours la plupart des décisions sur les agents pour les utilisateurs individuels. La couche de modèle en dessous a de nouveau bougé : Claude Opus 5 (24 juillet) a pris le #1 sur l'Agentic Index d'Artificial Analysis à 55,3, devant GPT-5.6 Sol à 54,0 et Claude Fable 5 à 52,8, et il coûte 5 $ / 25 $. Opus 5 domine aussi le classement Agent d'Arena, avec Kimi K3 en troisième. Pour les équipes qui construisent leurs propres agents, Muse Spark 1.2 de Meta (5 août) est une option agent-native bon marché à 1,25 $ / 4,25 $ dont l'Elo agentique GDPval-AA v2 a bondi de 1371 à 1631, bien que Scale SEAL n'ait évalué que l'ancienne 1.1, qui domine son classement d'usage d'outils MCP Atlas à 88,1. GLM-5.2 (MIT) est le modèle d'agent open-weight le plus fort que vous pouvez héberger sur du matériel modeste, à #5 sur le classement Agent d'Arena.

Guide d'usage, août 2026

Meilleure IA pour les étudiants

1
GPT-5.5 Free
Dissertations & ; recherche
2
Gemini 3.6 Flash
STEM + PDF
3
Claude Sonnet 5
Écriture & ; révision

La meilleure IA pour les étudiants est GPT-5.5 Free dans ChatGPT pour le travail de cours général et Gemini 3.6 Flash Free dans l'application Gemini pour les STEM et l'étude multimodale, avec Qwen 3.7 Max comme alternative par API pour les jeux de problèmes plus ardus (200 requêtes gratuites par jour) et Claude Opus 5 comme alternative pour la révision de dissertations. La plupart des étudiants n'ont pas besoin de payer : le palier gratuit de ChatGPT utilise désormais GPT-5.6 par défaut (avec GPT-5.5 toujours disponible), Gemini 3.6 Flash est dans l'application gratuite Gemini et dans AI Studio, Claude Sonnet 5 est le nouveau Claude gratuit par défaut, et DeepSeek V4 est gratuit sur le site de chat de DeepSeek. Pour le développement pas à pas des mathématiques les plus ardues, GPT-5.6 Sol est le nouveau modèle phare d'OpenAI (son score FrontierMath n'est pas encore publié, avec les 39,6 % vérifiés de GPT-5.5 Pro sur FrontierMath Tier 4 comme marque actuelle), bien que les deux soient payants uniquement ; Qwen 3.7 Max est l'alternative rapport qualité-prix à 97,1 sur HMMT 2026 février avec un tarif d'API de 1,25 $ / 3,75 $ sur sa promo actuelle de 50 % (2,50 $ / 7,50 $ tarif liste).

TâcheMeilleur modèlePourquoiGratuit ?Alternative
Dissertations & ; travail de coursGPT-5.5Gratuit dans ChatGPT, fiabilité factuelle améliorée vs 5.4OuiClaude Sonnet 5 (Claude gratuit)
Résolution de problèmes STEMGPT-5.6 Sol / Qwen 3.7 MaxNouveau modèle phare STEM (5.5 Pro : 39,6 % FrontierMath) / 97,1 HMMT 2026 févr.Pro payant / Qwen API payantGemini 3.6 Flash (gratuit)
Recherche & ; précisionGemini 3.1 Pro98 % ARC-AGI-1 à 0,52 $/tâche, ancrage natif dans Google SearchOui (application Gemini)Claude Opus 5
Révision d'écritureClaude Sonnet 5Gratuit et par défaut sur claude.ai ; Claude Fable 5 est le leader en qualitéOui (Claude gratuit)Claude Fable 5
Étude multimodale (PDF, diapositives, images)Gemini 3.6 FlashContexte 1M, gratuit dans l'application GeminiOuiNotebookLM (Google)
Deuxième place et alternatives : Claude Sonnet 5 (gratuit) est le deuxième pour l'écriture et la révision de dissertations. Gemini 3.6 Flash (gratuit) est le deuxième pour l'étude multimodale et l'ingestion de PDF. DeepSeek V4 est le deuxième pour la résolution de problèmes avec un budget strictement à coût nul.
Guide d'usage, août 2026

Meilleure IA pour le travail & ; les professionnels

1
GPT-5.6
Travail de connaissance quotidien
2
Claude Opus 5
Programmation & ; écriture
3
Gemini 3.1 Pro
Recherche & ; briefings

La meilleure IA pour le travail professionnel est GPT-5.6 (par défaut de ChatGPT depuis le 9 juillet) pour le travail de connaissance quotidien, Claude Opus 5 pour la programmation et l'écriture à enjeux élevés, et Gemini Spark pour les flux agentiques 24/7. La plupart des professionnels en tirent le meilleur parti en cumulant deux abonnements payants (ChatGPT Plus à 20 $/mois plus Claude Pro à 20 $/mois, soit 40 $/mois au total), ou en consolidant avec Fello AI à 9,99 $/mois pour les cinq meilleurs modèles dans une seule app Mac/iOS. Pour le travail agentique qui tourne pendant que vous dormez, Gemini Spark sur Google AI Ultra à 99,99 $/mois est le seul vrai agent cloud 24/7.

Cas d'usageMeilleur modèleStat cléPrixAlternative
Travail de connaissance quotidienGPT-5.6Par défaut de ChatGPT depuis le 9 juillet ; l'assistant que la plupart peuvent ouvrir20 $/mois ChatGPT PlusClaude Opus 5
Programmation (propriétaire)Claude Opus 5#1 sur Arena WebDev (1,702.9) et image-to-WebDev (1,668.6) ; le choix par défaut recommandé par Anthropic20 $/mois Claude ProClaude Fable 5
Programmation (économique)Qwen 3.7 Max80,4 SWE-Verified, contexte 1M1,25 $ / 3,75 $ promo ; 2,50 $ / 7,50 $ tarif listeDeepSeek V4-Flash 0731
Recherche & ; briefingsGemini 3.1 Pro98 % ARC-AGI-1 à 0,52 $/tâche, ancrage GoogleGoogle AI Pro / UltraClaude Opus 5
Mathématiques, physique, modélisation financière arduesGPT-5.6 SolNouveau modèle phare STEM d'OpenAI (5.5 Pro vérifié à 39,6 % FrontierMath)100 $/mois ChatGPT ProQwen 3.7 Max
Flux d'agent toujours actifsGemini SparkPremier agent cloud 24/799,99 $/mois Google AI UltraClaude Cowork
Actualité en direct, créatif avec contexte XGrok 4.5Classe Opus + ancrage natif dans X30 $/mois SuperGrokGemini 3.1 Pro
Consolidation tout-en-unFello AIChatGPT + Claude + Gemini + Grok + DeepSeek9,99 $/moisPayer chaque fournisseur séparément
Deuxième place et alternatives : pour la plupart des équipes professionnelles, Claude Opus 5 est le deuxième derrière GPT-5.6 pour le travail quotidien et désormais le leader de la programmation haut la main à 5 $ / 25 $, avec Claude Fable 5 comme deuxième pour le travail de long horizon le plus ardu. Gemini 3.1 Pro est le deuxième pour les rôles à forte recherche, et Gemini Spark est le choix unique si vous pouvez mettre un agent cloud au travail sur de longues tâches.
Comparatif de prix

Prix des modèles d'IA en août 2026

Des versions gratuites à 0 $ jusqu'à 199,99 $/mois pour Google AI Ultra. Le prix le plus déterminant de ce tableau est Claude Opus 5 à 5 $ / 25 $, car c'est le modèle #1 sur l'Intelligence Index d'Artificial Analysis à moitié coût de Claude Fable 5. Muse Spark 1.2 de Meta est affiché à 1,25 $ / 4,25 $, avec un palier Contributor à 0,10 $ / 0,20 $ pour quiconque accepte de laisser Meta s'entraîner sur ses prompts, et Grok 4.5 est affiché à 2 $ / 6 $. Le choix rapport prix-performance est désormais DeepSeek V4-Flash 0731 à 0,14 $ / 0,28 $, qui égale l'Intelligence Index de 50 de Gemini 3.6 Flash et coûte 0,03 $ par tâche d'index contre les 0,56 $ de Flash. Parmi les modèles fermés, GPT-5.6 Luna est le moins cher à 0,20 $ / 1,20 $ après la baisse d'OpenAI du 30 juillet. Pour un décryptage plus approfondi, consultez notre Guide complet du comparatif de prix de l'IA.

ModèleEntrée (par 1M)Sortie (par 1M)ContexteAccès gratuit ?
GPT-5.5$5.00$30.001M (400K dans Codex)ChatGPT Free ; API payante
GPT-5.5 Pro$30.00$180.001MChatGPT Pro à partir de 100 $/mois (palier usage supérieur à 200 $)
GPT-5.6 Sol$5.00$30.00Non publiéEn ligne sur ChatGPT, Codex & ; API (9 juillet)
GPT-5.6 Terra$2.00$12.00Non publiéEn ligne sur ChatGPT, Codex & ; API (9 juillet)
GPT-5.6 Luna$0.20$1.20Non publiéEn ligne sur ChatGPT, Codex & ; API (9 juillet)
Claude Opus 5$5.00$25.001MPar défaut sur Claude Pro/Max ; API payante
Claude Opus 4.8$5.00$25.001MModèle legacy chez Anthropic ; Pro/Max/API
Claude Fable 5$10.00$50.001MPermanent dans Max/Team Premium (~50 % des limites d'usage) ; Pro/Team Standard via crédits
Claude Sonnet 5$2.00 lancement / $3.00 liste$10.00 lancement / $15.00 liste1MPar défaut sur Claude Free & ; Pro ; API payante
Claude Sonnet 4.6$3.00$15.001MAPI payante (remplacé par Sonnet 5)
Gemini 3.1 Pro$2.00 (≤ ;200K) / $4.00 (> ;200K)$12.00 (≤ ;200K) / $18.00 (> ;200K)1MApplication Gemini limitée ; API payante
Gemini 3.6 Flash$1.50$7.501MApplication Gemini/AI Studio ; palier API gratuit + API payante
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio ; palier API gratuit + API payante
Qwen 3.7 Max$1.25 promo / $2.50 liste$3.75 promo / $7.50 liste1M200 requêtes gratuites/jour ; API payante au-delà
MiniMax M3$0.30 (50 % de remise sur $0.60)$1.20 (≤ ;512K)1MOpen weights ; coûts d'hébergement applicables
LongCat-2.0Selon le fournisseurSelon le fournisseur1MOpen weights (MIT) ; coûts d'hébergement applicables
NVIDIA Nemotron 3 UltraSelon le fournisseurSelon le fournisseur1MOpen weights (OpenMDW) ; coûts d'hébergement applicables
Qwen 3.5 (open-weight)Auto-hébergement / TogetherAuto-hébergement / Together1MOpen weights ; coûts d'hébergement applicables
Nex-N2-ProAuto-hébergement / fournisseursAuto-hébergement / fournisseurs1MOpen weights (Apache 2.0) ; coûts d'hébergement applicables
Rio 3.5 Open 397BAuto-hébergement / fournisseursAuto-hébergement / fournisseurs1MOpen weights (MIT) ; coûts d'hébergement applicables
Grok 4.3$1.25$2.501MForfait grand public gratuit ; API payante
Grok 4.5$2.00$6.00500KGrok Build / Cursor / console xAI ; UE partielle, console API encore fermée
Muse Spark 1.2$1.25 ($0.10 palier Contributor)$4.25 ($0.20 palier Contributor)1MAPI payante ; Muse Code, Meta Model API et OpenRouter ; le palier Contributor échange des droits d'entraînement contre une remise de ~92 %
Kimi K3$3.00 ($0.30 cache-hit)$15.001MPalier de base gratuit dans l'application Kimi ; open weights sur Hugging Face (Kimi K3 License)
Gemini Omni Flash (vidéo)$1.50$17.50 (sortie vidéo)Clips de 10 secondesApplication Gemini / Flow ; AI Studio + API
DeepSeek V4-Pro$0.435 ($0.0036 cache-hit)$0.871MDeepSeek Chat gratuit ; API payante
DeepSeek V4-Flash 0731$0.14$0.281MDeepSeek Chat gratuit ; API payante
Kimi K2.7 CodeSelon le fournisseurSelon le fournisseur256KOpen weights ; coûts d'hébergement applicables
GLM-5.2Selon le fournisseurSelon le fournisseur1MOpen weights ; coûts d'hébergement applicables
ERNIE 5.1Tarif région ChineTarif région Chine256KPalier gratuit de Baidu
Gemini Spark (agent)Sans tarif APISans tarif API1M (base Gemini)Google AI Ultra 99,99 $ ou 199,99 $/mois
Fello AI (agrégateur)Acheminé via l'appAcheminé via l'appSelon le modèle9,99 $/mois, version gratuite disponible

Les tarifs de GPT-5.5 et GPT-5.5 Pro ci-dessus sont des prix de contexte court ; OpenAI ne publie plus les chiffres spécifiques de contexte long. Les paliers GPT-5.6 sont facturés à 2x l'entrée et 1,5x la sortie une fois qu'un prompt dépasse 272K tokens d'entrée, ce qui place Terra en contexte long à 4 $ / 18 $ et Luna à 0,40 $ / 1,80 $. Si vous voulez accéder à plusieurs modèles d'IA sans gérer d'abonnements distincts, Fello AI propose GPT, Claude, Gemini, Grok, Perplexity et plus encore dans une seule app pour Mac, iPhone et iPad à partir de 9,99 $/mois.

Modèles open-weight

Meilleurs modèles open-weight en août 2026

Le meilleur modèle open-weight en août 2026 est Kimi K3, et il a pris la tête au moment où Moonshot a publié les poids le 27 juillet 2026. Il détient l'Intelligence Index le plus élevé de tout open model à 57 sur Artificial Analysis v4.1, six points devant GLM-5.2, et sur Arena, il reste l'entrée ouverte la mieux placée, à #2 sur WebDev (1,675.5) derrière le seul Claude Opus 5 et #3 sur le classement Agent. Un hic décide lequel des deux vous devriez réellement utiliser. Le téléchargement de K3 représente 96 shards safetensors et environ 1,56 To, ce qui nécessite un cluster GPU multi-nœuds plutôt qu'une station de travail, et il arrive sous une licence propre Kimi K3 License plutôt que MIT. Donc GLM-5.2 (Z.ai, MIT) reste notre recommandation pratique pour les équipes qui font tourner leurs propres poids, à un Intelligence Index de 51, #6 sur Arena WebDev (1,587.1) et #5 sur le classement Agent. La troisième place a changé de main le dernier jour de juillet : DeepSeek V4-Flash 0731 a été de nouveau post-entraîné et a bondi d'un Intelligence Index de 40 à 50, à 0,14 $ / 0,28 $ sous MIT.

ModèleIdéal pourBenchmark cléContexte / LicenceOù l'exécuter
Kimi K3Open model le mieux noté, travail agentique et webII 57 (v4.1), le plus élevé de tout open model ; #2 Arena WebDev, #3 Arena Agent ; 2.8T/104B actifs1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 To), Moonshot API, fournisseurs
GLM-5.2Programmation agentique de long horizon, contexte 1MII 51 (v4.1), le plus élevé que vous pouvez héberger sur du matériel modeste ; 744B/40B actifs1M / MITZ.ai, Hugging Face, OpenRouter
DeepSeek V4-Flash 0731Meilleur rapport qualité-prix de tout modèle de la pageII 50 (v4.1), depuis 40 le 31 juillet ; 0,03 $ par tâche d'index, 284B/13B actifs1M / MITDeepSeek API (0,14 $/0,28 $), local
LongCat-2.0Programmeur ouvert frontier entraîné sur des puces chinoisesII 33 (v4.1) ; 59,5 % SWE-Bench Pro (éditeur), 1.6T/~48B actifs1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de classe frontier bon marchéII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licence à déterminerHugging Face, API 0,30 $/1M (50 % de remise)
Nex-N2-ProMeilleur score de programmation ouvertII 41 (v4.1) ; 80,8 SWE-Bench Verified, 397B/17B actifsBasé sur Qwen / Apache 2.0Hugging Face, fournisseurs, auto-hébergement
Kimi K2.7 CodeMeilleur programmeur ouvert sous licence commerciale+21,8 % sur Kimi Code Bench v2 vs K2.6 (éditeur) ; 1T/32B actifs256K / Modified MITHugging Face, DeepInfra, fournisseurs
DeepSeek V4-ProTravail agentique en conditions réellesII 44 (v4.1), 1.6T/49B actifs1M / MITDeepSeek API (0,435 $/0,87 $), local
Hy3Le plus récent arrivant à licence permissiveII 41 (v4.1) ; #22 sur Arena WebDev (1,516.4)Apache 2.0Hugging Face, fournisseurs, auto-hébergement
InklingPremier open model de Thinking MachinesII 41 (v4.1), agentique 32,3, sorti le 15 juilletOpen weightsHugging Face, fournisseurs, auto-hébergement
Inkling SmallMême famille à un quart de la tailleII 40 (v4.1), agentique 30,8 ; 276B/12B actifs, entrée texte, image et audioApache 2.0Hugging Face (BF16 et NVFP4), fournisseurs, auto-hébergement
NVIDIA Nemotron 3 UltraAffiné par NVIDIA, licence entièrement permissiveII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B actifs1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 auto-hébergement)
Qwen 3.5 (397B / 17B actifs)Multimodal, décodage rapide88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / ouvertTogether, OpenRouter, local
Qwen3.6-35B-A3BProgrammeur agentique ouvert efficace (3B actifs)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B actifs262K (jusqu'à 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgrammeur dense exécutable sur portable87,8 GPQA Diamond, dense 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, raisonnement multilingue70,8 Terminal-Bench 2.1 (first-party), bat Qwen 3.7 Plus sur 4/5397B/17B actifs / MITHugging Face, fournisseurs, auto-hébergement
Llama 4 MaverickModèle phare de la lignée Meta17B actifs / 400B de paramètres au totalLlama 4 licenseCloud Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / faible consommationMultimodal, empreinte très réduiteCompact / ouvertLocal, outil NVIDIA

Ici la licence compte autant que le score brut : Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) et Nemotron 3 Ultra (OpenMDW) autorisent tous clairement l'usage commercial, tandis que MiniMax M3 arrive sous sa propre licence communautaire et Kimi K3 se place sur sa propre licence personnalisée avec un seuil de revenus pour quiconque le revend comme service. Aucun open model n'est plus premier sur aucun classement d'Arena que nous suivons : Claude Opus 5 a pris le classement Agent en juillet, le dernier qu'un open model ait dominé.

Comment nous évaluons

Benchmarks, prix et usage sur le terrain

Chaque classement de cette page combine trois éléments : des benchmarks publics de sept maisons indépendantes (Artificial Analysis, Arena anciennement LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize et le classement officiel Terminal-Bench 2.1, couvrant les index Intelligence et Agentic, GPQA Diamond, ARC-AGI-1 à 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas et le Remote Labor Index), les tarifs d'API et d'abonnement publiés sur la page de prix officielle de chaque fournisseur, et l'usage sur le terrain par l'équipe éditoriale de FelloAI qui exécute de vrais prompts sur la même tâche sur chaque modèle. Nous récupérons de nouveau les sources officielles de prix et de benchmarks avant chaque mise à jour mensuelle.

Les benchmarks sont pondérés selon le cas d'usage : SWE-bench et Terminal-Bench portent la programmation, GPQA Diamond et ARC-AGI-2 portent la précision, GDPval-AA (le benchmark de livrables professionnels d'Artificial Analysis) informe la qualité des tâches professionnelles tandis que le style d'écriture est jugé avant tout par des tests sur le terrain, FrontierMath et HMMT portent la résolution de problèmes. Nous précisons quand un benchmark est annoncé par l'éditeur mais non vérifié de façon indépendante, et nous écartons toute affirmation que nous ne pouvons pas reproduire face à une source en direct. Nous ne déplaçons pas la couronne d'une catégorie sur la force d'un seul classement, et lorsqu'un nouveau modèle est trop récent pour que les classements de préférence humaine l'aient évalué, nous le disons plutôt que de le couronner sur les seuls scores de benchmark. Lorsqu'un modèle passe par une mise à niveau majeure entre deux mises à jour, nous reclassons la catégorie et ajoutons une ligne « Ce qui a changé ce mois-ci » au bas de l'analyse approfondie.

Foire aux questions

Questions fréquentes

Quel est le meilleur modèle d'IA en ce moment en août 2026 ?
Cela dépend de la tâche. Au score global de benchmark, Claude Opus 5 (24 juillet) est #1 sur l'Intelligence Index d'Artificial Analysis à 61 et son Agentic Index à 55,3, et Arena l'a désormais évalué en tête de quatre de ses classements, dont les deux de programmation. Pour le chat du quotidien, GPT-5.6 est le modèle par défaut de ChatGPT depuis le 9 juillet et l'assistant que la plupart des gens peuvent réellement ouvrir, bien que Claude Fable 5 domine le classement texte d'Arena. Pour la programmation, Claude Opus 5 est #1 sur les classements WebDev (1,702.9) et image-to-WebDev (1,668.6) d'Arena à moitié prix de Fable 5. Pour l'écriture, Claude Fable 5 est #1 sur le classement texte d'Arena (1508.6), Humanity's Last Exam (53,3 %) et AA-Omniscience (40). Pour la précision, Gemini 3.1 Pro égale le panel humain sur ARC-AGI-1 à 98 % pour 0,52 $ la tâche. Pour les mathématiques et le raisonnement ardus, GPT-5.6 Sol est #1 sur LiveBench Mathematics, LiveBench Reasoning et ARC-AGI-2. Pour les images, ChatGPT Images 2.0 domine les deux classements, et pour la vidéo, Gemini Omni Flash domine les deux. Pour les agents, Gemini Spark est l'agent cloud 24/7 et Claude Cowork celui de bureau.
Qu'est-ce que Claude Opus 5 ?
Claude Opus 5 est le tout dernier modèle phare d'Anthropic, publié le 24 juillet 2026, et le modèle #1 actuel sur Artificial Analysis. Il domine à la fois l'Intelligence Index à 61 et l'Agentic Index à 55,3, et arrive en tête du classement GDPval-AA v2 de livrables professionnels à 1858, bien devant les 1746 de Claude Fable 5. Le tarif de l'API est de 5 $ / 25 $ par 1M de tokens, le même qu'Opus 4.8 et moitié moins cher que Fable 5, avec une fenêtre de contexte de 1M de tokens et une date de connaissances de mai 2026. ARC Prize confirme de façon indépendante l'affirmation de lancement d'Anthropic sur ARC-AGI-3, où Opus 5 obtient 30 % contre 8 % pour le modèle suivant, environ 3,75x. Arena l'a depuis évalué, le plaçant #1 sur WebDev, image-to-WebDev, Document et le classement Agent et #6 sur le texte, et c'est ce qui lui a valu la couronne de la programmation. Une chose à garder à l'esprit : Artificial Analysis mesure son taux d'hallucination à 50 %, ce qui explique pourquoi il ne détient aucune couronne de précision sur cette page.
Claude Fable 5 est-il de retour ?
Oui. Anthropic a redéployé Claude Fable 5 le 1er juillet 2026 après que le gouvernement américain a levé la restriction de contrôle des exportations qu'il avait imposée le 12 juin. Il est de nouveau disponible sur la Claude API, Claude.ai, Claude Code et Claude Cowork. Anthropic a rendu Fable 5 permanent dans les forfaits payants le 20 juillet 2026. Max et Team Premium l'incluent à environ 50 % des limites d'usage habituelles ; Pro et Team Standard y accèdent via des crédits d'usage avec un crédit de départ unique de 100 $. Le tarif de l'API est de 10 $ / 50 $ par million de tokens. Fable 5 est un modèle de classe Mythos conçu pour le travail agentique de long horizon avec un contexte de 1M de tokens, et c'est le deuxième pour la programmation derrière Claude Opus 5, à #2 sur le classement image-to-WebDev d'Arena (1,625.7) et #4 sur WebDev.
Qu'est-ce que GPT-5.6 et puis-je l'utiliser ?
Oui, depuis le 9 juillet 2026. GPT-5.6 est la famille de modèles nouvelle génération d'OpenAI, et après un aperçu fermé de deux semaines qui a débuté le 26 juin derrière une revue de sécurité du gouvernement américain, elle a atteint la disponibilité générale le 9 juillet. Il y a trois paliers, du moins au plus capable : Luna, le palier rapide et le moins cher (0,20 $ / 1,20 $ par 1M de tokens) ; Terra, un modèle équilibré pour le quotidien qu'OpenAI dit égaler GPT-5.5 (2 $ / 12 $) ; et Sol, le modèle phare réglé pour la biologie, la chimie et la cybersécurité (5 $ / 30 $). OpenAI a réduit Luna de 80 % et Terra de 20 % le 30 juillet 2026, et a laissé Sol et tous les prix d'abonnement ChatGPT intacts. Il est désormais en ligne sur ChatGPT, Codex et l'API comme modèle par défaut d'OpenAI. Une réserve : la system card d'OpenAI et l'évaluateur externe METR ont signalé un comportement de « scheming » élevé chez Sol, alors traitez-le avec prudence pour un travail factuel à enjeux élevés jusqu'à ce que les résultats indépendants se stabilisent.
Grok 4.5 est-il déjà sorti ?
Oui. xAI a publié Grok 4.5 au public le 8 juillet 2026, son premier modèle phare depuis que SpaceX a absorbé l'entreprise et est entrée en bourse sous le nom de SPCX. Elon Musk le décrit comme « un modèle de classe Opus, mais plus rapide, plus efficient en tokens et moins cher ». Il est entraîné avec Cursor et orienté vers la programmation et le travail agentique, au prix de 2 $ / 6 $ par 1M de tokens avec une fenêtre de contexte de 500K tokens. Il est en ligne sur Grok Build, Cursor sur tous les forfaits et la console xAI. L'accès dans l'UE a commencé à se déployer après une annonce du 16 juillet et reste partiel, Cursor faisant état d'une disponibilité tandis que la console API de xAI demeure fermée aux utilisateurs de l'UE. Artificial Analysis le note à un Intelligence Index de 54 sur v4.1, à égalité avec le terrain sur Terminal-Bench 2.1 (83,3 %) mais en retrait sur SWE-Bench Pro à 64,7 %, c'est donc le choix rapport qualité-prix plutôt que le leader clair des benchmarks. Grok 4.5 est aussi notre choix pour la créativité, pour des raisons de produit plutôt que de qualité, étant donné qu'il se situe #33 sur EQ-Bench Creative Writing ; pour la meilleure sortie écrite, Claude Fable 5 gagne haut la main.
Quelle IA est la meilleure pour programmer ?
Claude Opus 5 est la meilleure pour programmer, et il gagne les deux classements où les développeurs votent sur le résultat plutôt qu'un harness exécutant un script : #1 sur le classement WebDev d'Arena (1,702.9) et #1 en image-to-WebDev (1,668.6), sur des clôtures de votes du 1er août et du 31 juillet. Il tourne à 5 $ / 25 $ par 1M de tokens, moitié de Claude Fable 5, et la propre documentation d'Anthropic dit de commencer par Opus 5 pour la programmation agentique complexe. Claude Fable 5 est le deuxième pour le travail de long horizon le plus ardu à #2 image-to-WebDev et #4 WebDev, et Kimi K3 est le prétendant à #2 sur WebDev (1,675.5). Notez que le Coding Index d'Artificial Analysis n'est pas un raz-de-marée Claude : GPT-5.6 Sol (xhigh) le domine à 78,3 avec Opus 5 à 78,0, assez proche pour parler d'égalité. DeepSeek V4-Flash 0731 est le choix rapport prix-performance à 0,14 $ / 0,28 $, et GLM-5.2 (MIT) est le meilleur programmeur open-weight que vous pouvez héberger vous-même.
Quelle IA est la meilleure pour écrire ?
Claude Fable 5 est la meilleure pour écrire, et c'est le seul modèle dans le top trois des trois classements indépendants d'écriture : #1 sur Arena écriture créative, #1 sur LiveBench Language (90.7) et #3 sur EQ-Bench Creative Writing v3. Il coûte 10 $ / 50 $ par 1M de tokens. Claude Sonnet 5 est le choix rapport qualité-prix et ce que la plupart des gens devraient réellement utiliser, puisqu'il est gratuit et par défaut sur claude.ai à un tarif de lancement de 2 $ / 10 $, bien qu'il se classe #53 sur Arena écriture créative. Kimi K3 remporte EQ-Bench haut la main à 2377 si vous voulez une fiction distinctive, Claude Opus 5 arrive en tête du classement GDPval-AA v2 de livrables professionnels à 1858, GPT-5.5 est l'alternative pour l'écriture professionnelle ancrée dans les faits, et Gemini 3.6 Flash est le choix rapport prix-performance pour le contenu en masse.
Quel est le meilleur modèle d'IA open-weight en 2026 ?
Kimi K3 est le meilleur modèle open-weight en ce moment, et il l'est depuis que Moonshot a publié les poids le 27 juillet 2026. Il a l'Intelligence Index le plus élevé de tout open model à 57 sur Artificial Analysis v4.1, et sur Arena, il est #2 sur WebDev et #3 sur le classement Agent. Le hic, c'est qu'il représente 96 shards et environ 1,56 To sous une licence propre Kimi K3 License, donc GLM-5.2 (13 juin, MIT) reste le modèle que la plupart des équipes peuvent réellement héberger, à un Intelligence Index de 51 et #6 sur Arena WebDev. Le troisième est DeepSeek V4-Flash 0731, qui a bondi d'un Intelligence Index de 40 à 50 le 31 juillet sans changer de prix, de taille ni de licence, ce qui en fait le meilleur rapport qualité-prix du champ ouvert à 0,14 $ / 0,28 $ sous MIT. En toute honnêteté, il est bon de savoir qu'aucun open model n'est plus premier sur aucun classement d'Arena que nous suivons.
Quel est le modèle d'IA de classe frontier le moins cher ?
Au tarif d'API par million de tokens, GPT-5.6 Luna est désormais le modèle fermé de classe frontier le moins cher à 0,20 $ / 1,20 $, après qu'OpenAI l'a réduit de 80 % le 30 juillet 2026, et Artificial Analysis le note à un Intelligence Index de 51, un point au-dessus de Gemini 3.6 Flash. Encore moins cher, DeepSeek V4-Flash 0731 à 0,14 $ / 0,28 $ est désormais notre choix rapport prix-performance : il égale l'Intelligence Index de 50 de Gemini 3.6 Flash et coûte 0,03 $ par tâche d'index contre les 0,56 $ de Flash, sous une licence MIT que vous pouvez auto-héberger. MiniMax M3 est désormais affiché à 0,30 $ par million de tokens d'entrée avec une remise permanente de 50 %, avec LongCat-2.0 comme forte alternative MIT. Qwen 3.7 Max à 1,25 $ / 3,75 $ sur sa promo actuelle est le choix rapport qualité-prix à un Intelligence Index de 46, bien que Luna le devance désormais à la fois sur le prix et sur le score.
Quels modèles d'IA sont gratuits ?
ChatGPT Free utilise désormais GPT-5.6 par défaut (avec GPT-5.5 toujours disponible) sous des limites d'usage. Gemini Free fait tourner Gemini 3.6 Flash dans l'application Gemini et Google AI Studio. Claude Free fait tourner Claude Sonnet 5 (le nouveau par défaut) avec des limites quotidiennes. DeepSeek Chat fait tourner DeepSeek V4 gratuitement sur le site de DeepSeek. Grok a un forfait grand public gratuit limité (X Premium est un module payant). Qwen 3.5, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4 et GLM-5.2 sont open-weight et gratuits à auto-héberger. Qwen 3.7 Max est API uniquement sans front-end de chat grand public, mais Alibaba inclut désormais 200 requêtes de modèle gratuites par jour. Kimi a un palier de base gratuit dans son app, l'usage agentique plus intensif étant facturé.
Qu'est-ce que Gemini Spark et vaut-il 99,99 $/mois ?
Gemini Spark est le premier agent d'IA de Google résident dans le cloud 24/7, lancé au Google I/O le 19 mai 2026 et exclusif au forfait Google AI Ultra, que Google a restructuré pour inclure un palier d'entrée à 99,99 $/mois et un palier supérieur à 199,99 $/mois. Spark est construit sur les modèles de base Gemini avec le harness Antigravity de Google sur une VM Google Cloud, s'intègre à Gmail, Google Docs et d'autres apps Google Workspace, et peut interagir avec Chrome et le système Halo d'Android côté appareil. Il vaut la dépense pour les utilisateurs qui ont des flux répétables de longue durée (tri de la boîte de réception, synthèses de recherche, tâches planifiées). Pour des tâches ponctuelles, Claude Cowork à 20 $/mois couvre la plupart des besoins d'agent de bureau.
Qu'est-ce que Fello AI ?
Fello AI est un chatbot d'IA pour Mac, iPhone et iPad qui vous permet d'utiliser tous les meilleurs modèles d'IA comme ChatGPT, Claude, Gemini, Grok et DeepSeek dans une seule app, avec des modèles mis à jour régulièrement pour que vous ayez toujours les plus récents. Il coûte 9,99 $/mois avec une note de 4,7 étoiles sur plus de 27 000 avis.
À quelle fréquence mettez-vous cette page à jour ?
Nous mettons cette page à jour au moins une fois par mois et dans les 24-48 heures suivant le lancement de tout modèle majeur.
Articles liés
Claude vs ChatGPT : quelle IA est vraiment meilleure en 2026 ?

Claude a atteint le #1 de l'App Store début 2026, délogeant ChatGPT de la première place pour la première fois. Le déclencheur a été le refus public d'Anthropic de céder à l'exigence du Pentagone de déployer ses modèles pour des armes autonomes.

Lire la suite →
Grok vs ChatGPT : quel chatbot d'IA est vraiment meilleur en 2026 ?

Les deux chatbots viennent de passer à de nouveaux modèles phares. ChatGPT tourne désormais sous GPT-5.6 (paliers Sol, Terra, Luna) et Grok est propulsé par Grok 4.5, la version de xAI axée sur la programmation du 8 juillet.

Lire la suite →
ChatGPT vs Gemini en 2026 : quelle IA devriez-vous vraiment utiliser ?

ChatGPT est passé à GPT-5.6 comme modèle phare, tandis que Gemini 3.1 Pro reste le modèle phare payant de Google. Face-à-face sur l'écriture, la programmation, les images et le prix.

Lire la suite →
Classements de la meilleure IA de février 2026

GPT-5.2, Claude Opus 4.6 et Gemini 3.1 Pro face à face. Notre analyse approfondie mensuelle de février avec benchmarks et résultats sur le terrain.

Lire la suite →
Meilleurs modèles d'IA en janvier 2026

Gemini 3 Pro, Claude 4.5, ChatGPT (GPT-5.2), Grok 4.1 et DeepSeek classés. Notre choix mensuel de janvier 2026 sur chaque grand modèle.

Lire la suite →
Gemini Nano Banana Pro vs GPT-Image-1.5 : comparatif ultime

Notre comparatif sur le terrain original de décembre 2025 des deux principaux modèles de génération d'images, avec de vrais échantillons de sortie côte à côte.

Lire la suite →

Essayez tous les modèles.
Une seule appli superbe.

Tous les modèles de ce guide dans une seule app native : ChatGPT, Claude, Gemini, Grok et DeepSeek. Gratuit pour démarrer.

Fello AI fonctionnant sur Mac, iPad et iPhone

Note de 4,7·plus de 27 000 avis·Gratuit pour démarrer