Le 5 mai 2026, une startup basée à Miami nommée Subquadratic est sortie du mode furtif avec 29 millions de dollars de financement d’amorçage et une seule affirmation, très retentissante : elle a construit le premier LLM de pointe qui ne repose pas sur l’attention quadratique. Son modèle, SubQ, est livré avec une fenêtre de contexte de 12 millions de tokens, tourne environ 52x plus vite que FlashAttention à 1 million de tokens, et coûte environ un cinquième de ce que facturent Claude Opus ou GPT-5.5 pour des charges de travail comparables.

Si ces chiffres tiennent la route, il s’agit du changement architectural le plus important dans les modèles de langage depuis l’article fondateur sur le transformeur de 2017. Sinon, SubQ rejoint une longue liste d’expériences sous-quadratiques qui ont promis monts et merveilles et ont discrètement sous-performé à grande échelle.

Ce test détaille ce qu’est réellement SubQ, comment fonctionne son mécanisme d’attention parcimonieuse sous-quadratique (SSA), ce que montrent les benchmarks, ce dont doutent des chercheurs crédibles, et comment l’appréhender si vous développez avec l’IA aujourd’hui.

Les points clés à retenir

  • Lancé le 5 mai 2026 par Subquadratic, fondée par le PDG Justin Dangel et le directeur technique Alex Whedon (ancien responsable de l’IA générative chez Meta).
  • Tour d’amorçage de 29 M$ avec des soutiens dont Justin Mateen (cofondateur de Tinder), Javier Villamizar (ex-SoftBank Vision Fund) et des investisseurs des débuts d’Anthropic, OpenAI, Stripe et Brex.
  • Fenêtre de contexte de 12 millions de tokens dans le modèle de recherche, 1 million de tokens dans l’API de production.
  • L’architecture SSA évolue de façon linéaire avec la longueur du contexte au lieu de quadratique, réduisant le calcul d’attention d’environ 1 000x à 12M tokens.
  • Benchmarks : 95,0 % sur RULER 128K, 65,9 % sur MRCR v2 à 1M tokens, 81,8 % sur SWE-Bench Verified.
  • Trois produits en bêta privée : SubQ API, SubQ Code (agent CLI) et SubQ Search (outil de recherche à long contexte gratuit).
  • Le scepticisme est élevé. Le rapport technique complet n’a pas été publié, les poids ne sont pas ouverts, et les architectures sous-quadratiques antérieures (Mamba, RWKV, DeepSeek Sparse Attention) ont maintes fois sous-performé les transformeurs à l’échelle de pointe.

Ce qu’est réellement SubQ

De l'éditeur

Tous les modèles d'IA dans une seule app

Fello AI réunit GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 et plus dans une seule app native pour Mac et iPhone.

Téléchargez maintenant !

SubQ est un grand modèle de langage à poids fermés, entraîné sur un tout nouveau mécanisme d’attention que l’entreprise appelle attention parcimonieuse sous-quadratique, ou SSA. L’attention standard des transformeurs compare chaque token d’une séquence avec tous les autres tokens. C’est ce qui la rend puissante, et c’est aussi ce qui rend les fenêtres de contexte coûteuses. Doubler l’entrée quadruple le calcul.

La SSA remplace cela par une sélection de tokens dépendante du contenu. Pour chaque token de requête, le modèle choisit un petit sous-ensemble de positions dans la séquence qui comptent réellement, puis calcule une attention exacte uniquement sur celles-ci. Le calcul évolue de façon linéaire avec la longueur du contexte plutôt qu’avec son carré.

Ce n’est pas la même chose que l’attention parcimonieuse à motif fixe utilisée dans Longformer ou BigBird, où la parcimonie est codée en dur par position. Ce n’est pas non plus l’approche par espace d’états adoptée par Mamba ou RWKV, qui remplacent entièrement l’attention par une dynamique récurrente. La SSA conserve l’attention, mais lui fait choisir où regarder.

Subquadratic affirme que cela confère au modèle trois propriétés à la fois : un coût linéaire, un routage sensible au contenu et la capacité de récupérer des informations depuis des positions arbitraires de la séquence. Jusqu’à présent, les conceptions d’attention parcimonieuse en atteignaient généralement deux sur trois.

Comment fonctionne la SSA

L’entreprise a publié un billet technique détaillant le mécanisme et le pipeline d’entraînement. En résumé :

  1. Le pré-entraînement établit la modélisation du langage de base et les représentations à long contexte sur de très longues séquences.
  2. Le fine-tuning supervisé ajoute le suivi d’instructions et le comportement de génération de code.
  3. L’apprentissage par renforcement cible spécifiquement les modes de défaillance de la récupération à long contexte, ceux où le modèle produit une réponse d’apparence plausible qui laisse discrètement tomber le mauvais fait d’une entrée de 200 pages.

La partie infrastructure compte autant que les mathématiques. Une mise à l’échelle mémoire linéaire et un parallélisme de séquence distribué permettent à Subquadratic d’entraîner de façon stable sur des séquences d’un million de tokens ou plus, ce que la plupart des laboratoires évitent parce que le coût en mémoire GPU est brutal avec l’attention standard.

Côté matériel, les accélérations en temps réel qu’ils rapportent sont mesurées sur des Nvidia B200 en utilisant FlashAttention-2 comme référence :

Longueur de contexteAccélération SSA vs FlashAttention-2
128K tokens7,2x
256K tokens13,2x
512K tokens23,0x
1M tokens52,2x

Plus vous allez loin, plus l’écart se creuse. À 12 millions de tokens, Subquadratic affirme que le calcul d’attention chute de près de 1 000x par rapport aux transformeurs standard, c’est le chiffre phare repris partout.

Les chiffres des benchmarks

Subquadratic a publié trois résultats de benchmarks au moment du lancement. Aucun n’est à l’état de l’art sur toute la ligne, mais chacun raconte une histoire légèrement différente.

BenchmarkSubQClaude Opus 4.6Gemini 3.1 ProGPT-5.5
RULER @ 128K (récupération à long contexte)95,0 %94,8 %n/dn/d
MRCR v2 @ 1M (récupération multi-tours à 8 aiguilles)65,9 %32,2 % (communiqué) / 78,3 % (billet technique)26,3 %74,0 %
SWE-Bench Verified (code)81,8 %80,8 % (communiqué) / 87,6 % (billet technique)80,6 %n/d

Deux choses ressortent. Premièrement, RULER à 128K est essentiellement saturé, donc voir SubQ égaler Opus relève plus du fait de ne pas régresser que de gagner. Deuxièmement, les chiffres MRCR et SWE-Bench que Subquadratic utilise pour Opus diffèrent entre son communiqué de presse et son propre billet technique, ce qui est étrange et mérite d’être signalé. Quoi qu’il en soit, SubQ est derrière Opus sur MRCR si vous croyez les chiffres du billet technique, et le devance si vous croyez ceux du communiqué.

Résultats du benchmark SWE

Ce qui n’est pas contesté, c’est le coût par résultat. Sur RULER 128K, Subquadratic affirme que SubQ atteint 95,0 % de précision pour 8 $ de calcul, contre environ 2 600 $ pour qu’Opus atteigne 94,8 %. C’est une réduction des coûts de 300x à précision égale, et c’est la partie de l’histoire qui compte le plus pour quiconque déploie des charges de travail IA en production. Notre comparatif des tarifs de l’IA couvre ce à quoi ce type de bouleversement des coûts unitaires ressemble en pratique chez les grands fournisseurs.

Résultats du benchmark MRCR v2

Ce que 12 millions de tokens vous apportent réellement

Une fenêtre de 12M tokens représente environ 9 millions de mots, soit à peu près l’équivalent de 120 livres de texte dans un seul prompt. C’est assez pour contenir :

  • Une base de code entière d’une entreprise de taille moyenne, tests et documentation compris.
  • Chaque pièce d’un dossier juridique complexe.
  • Une année complète de transcriptions du support client d’un produit SaaS de milieu de gamme.
  • L’intégralité de la Bible du roi Jacques à peu près neuf fois.

L’implication pratique, si SubQ tient ses promesses, c’est que la génération augmentée par récupération (RAG) devient facultative pour un ensemble de problèmes bien plus large. Aujourd’hui, presque tout déploiement d’IA sérieux fait tourner un pipeline de récupération parce que vous ne pouvez pas faire tenir les données pertinentes dans le contexte. Embarquer, découper, reclasser, remplir, générer. L’argument de SubQ, c’est que pour beaucoup de ces charges de travail vous pouvez sauter toute cette pile et simplement y mettre les documents.

Cela n’élimine pas le RAG, mais cela en comprime le cas d’usage. Les bases de connaissances statiques, les bases de code internes et la revue documentaire ressemblent aux cibles précoces évidentes. Les données en temps réel, les informations qui évoluent vite et la personnalisation propre à chaque utilisateur ont encore besoin de récupération.

Les trois produits

Subquadratic a lancé trois produits simultanément, tous en bêta privée au 5 mai.

SubQ API est le point d’entrée pour les développeurs. Il expose le modèle de production à 1M tokens via des endpoints compatibles OpenAI avec prise en charge de l’utilisation d’outils. La fenêtre de contexte de 12M est réservée pour l’instant à la recherche et à des partenaires entreprise sélectionnés.

SubQ Code est un agent de codage CLI qui charge des bases de code entières dans le contexte et raisonne à travers elles. Subquadratic le positionne aussi comme une couche à long contexte pour les outils existants, affirmant une compatibilité avec Claude Code, Codex et Cursor. Pour connaître le coût de Cursor lui-même, consultez notre guide tarifs de Cursor. Leurs chiffres publiés annoncent une facture réduite de 25 % et une exploration 10x plus rapide quand SubQ Code se place sous ces agents. C’est l’affirmation la plus directement testable du lancement, et celle la plus susceptible soit de confirmer SubQ, soit de le démasquer.

SubQ Search est un outil de recherche à long contexte offert gratuitement aux particuliers. Subquadratic l’utilise comme un coin d’entrée-et-expansion face à Perplexity et à la recherche ChatGPT. Le modèle économique fonctionne vraisemblablement parce que le coût de l’attention à 1M+ tokens est faible sur leur pile et brutalement élevé sur celle de tous les autres.

Les tarifs de l’API n’ont pas encore été divulgués au-delà de l’affirmation générale d’être environ un cinquième du coût des grands modèles de pointe.

Pourquoi les chercheurs sont sceptiques

Quelques heures après le lancement, la communauté de recherche en IA s’est divisée. Les réserves contre SubQ ne sont pas personnelles. Elles sont historiques.

L’attention sous-quadratique est l’un des domaines les plus intensément explorés de l’apprentissage automatique. Mamba, RWKV, Hyena, RetNet, BASED, DeepSeek Sparse Attention et Kimi Linear ont tous tenté leur chance différemment sur le même problème. Chacun a démontré une mise à l’échelle linéaire sur les benchmarks. Chacun s’est heurté au même mur : les architectures purement sous-quadratiques égalent l’attention dense à petite et moyenne échelle, puis sous-performent visiblement sur les benchmarks en aval à l’échelle de pointe, ou finissent en configurations hybrides qui perdent le bénéfice de la mise à l’échelle pure.

Un billet LessWrong largement partagé sur cette lignée soutenait que presque toutes les affirmations sous-quadratiques à ce jour sont l’« amélioration incrémentale numéro 93595 de l’architecture transformeur » parce que les implémentations pratiques restent quadratiques dans les régimes qui comptent et n’améliorent l’attention que par un facteur constant.

Deux préoccupations précises ont vite fait surface.

L’ingénieur IA Will Depue a publié que SubQ est « presque à coup sûr un fine-tune à attention parcimonieuse de Kimi ou DeepSeek », ce qui signifie que le comportement impressionnant du modèle de base provient de poids open source existants et que la contribution de la SSA est la couche d’attention parcimonieuse ajoutée par-dessus. Subquadratic n’a ni nié ni confirmé cela, et n’a pas publié de poids ni de rapport technique complet.

Le commentateur IA Dan McAteer a capté l’ambiance binaire : « SubQ est soit la plus grande avancée depuis le Transformeur, soit le Theranos de l’IA. » Ce n’est pas une critique technique sérieuse, mais c’est le bon cadre pour comprendre comment le domaine interprète cela. Soit le modèle est ce que Subquadratic prétend, soit l’écart entre les benchmarks marketing et le comportement en production deviendra vite visible dès que des personnes extérieures y mettront la main.

La voie la plus claire vers la crédibilité, c’est le rapport technique, les poids ou une description détaillée de l’architecture, et des benchmarks indépendants réalisés par des laboratoires que l’entreprise ne paie pas. Subquadratic dit que les trois arrivent. Ils ne sont pas encore là.

Comment SubQ se compare aux autres modèles à long contexte

Le long contexte n’est pas un champ de bataille nouveau. Gemini livre des fenêtres de 2M tokens depuis plus d’un an. Claude a dépassé le million l’automne dernier. La comparaison intéressante porte sur le coût à contexte donné, pas sur la longueur brute du contexte.

ModèleContexte maxCoût pour 1M tokens de sortie (est.)Architecture
SubQ (production)1M tokens~1/5 du tarif de pointeAttention parcimonieuse sous-quadratique
SubQ (recherche)12M tokensrevendiqué ~1 000x moins cher à 12MAttention parcimonieuse sous-quadratique
Claude Opus 4.61M tokens75 $Transformeur dense
Gemini 3.1 Pro2M tokens30 $Attention hybride
GPT-5.5400K tokens60 $Transformeur dense
DeepSeek V3.2128K tokens1,10 $Transformeur dense avec couches parcimonieuses

Le point de comparaison n’est pas de savoir si SubQ l’emporte en précision. Sur la plupart des benchmarks, Opus ou Gemini mène toujours. Le point est de savoir si le coût par réponse correcte à long contexte est réellement 50x à 300x inférieur, car si c’est le cas, le choix change pour toute charge de travail lourde en documents ou en code.

Ce que cela signifie pour les développeurs

Pour la plupart des gens qui livrent des produits par-dessus des LLM, voici la lecture pratique.

Si les affirmations de SubQ tiennent sous des tests indépendants, trois choses changent. Le RAG devient facultatif pour de nombreux cas d’usage. Les agents de codage à l’échelle d’une base de code deviennent économiquement viables. Et la couche de sélection de modèles que des produits comme Fello AI regroupent gagne une option forte de plus, puisque la valeur d’avoir une interface Mac et iPhone unique vers chaque modèle de pointe ne fait que croître quand les modèles commencent à se spécialiser sur différents axes (coût, vitesse, contexte, raisonnement brut).

Si les affirmations de SubQ ne tiennent pas, le résultat le plus probable est que le mécanisme SSA finisse tout de même par être un composant utile dans des architectures hybrides, à l’image de la façon dont le mélange d’experts est passé du scepticisme à la pratique courante en quelques années. Le chiffre de 1 000x est revu à la baisse, celui de 50x survit probablement dans des domaines plus étroits.

La chose la plus concrète à faire aujourd’hui, c’est d’attendre le rapport technique, de lancer vos propres évaluations via SubQ Code sur une vraie base de code que vous connaissez bien, et de traiter les benchmarks marketing comme un point de départ plutôt que comme un verdict.

Tarifs et comment accéder à SubQ

Les trois produits sont en bêta privée. Subquadratic recueille les demandes d’accès via des formulaires sur son site web. L’entreprise n’a pas encore publié de page de tarifs publique. D’après les entretiens de lancement, attendez-vous à :

  • SubQ API : environ 1/5 du coût par token de Claude Opus ou GPT-5.5 à des longueurs de contexte comparables.
  • SubQ Code : sous licence par siège de développeur, avec la couche à long contexte présentée comme un réducteur de coûts prêt à l’emploi pour les équipes qui utilisent déjà Claude Code, Codex ou Cursor.
  • SubQ Search : gratuit pour les particuliers pendant la bêta.

Si vous voulez utiliser SubQ aux côtés d’autres modèles de pointe sans jongler avec des comptes séparés, un agrégateur comme Fello AI peut se placer devant plusieurs fournisseurs sur Mac, iPhone et iPad. SubQ n’est pas actuellement disponible dans Fello AI parce qu’il est en bêta privée, mais il sera ajouté dès sa sortie publique, ou plus tôt si un accès anticipé s’ouvre.

Verdict final

SubQ est le lancement de LLM le plus intéressant sur le plan architectural depuis DeepSeek V3, et c’est vrai que le chiffre de 1 000x survive ou non au contact des testeurs indépendants. Un mécanisme d’attention à mise à l’échelle linéaire qui tient sur RULER, MRCR et SWE-Bench est réellement nouveau, et l’équipe qui le porte (recherche ex-Meta, Google, Oxford, ByteDance, Cambridge) est assez crédible pour être prise au sérieux.

La lecture honnête, c’est que le marketing a de l’avance sur les preuves. L’écart se comblera dans l’une des deux directions au cours du prochain trimestre. Soit le rapport technique, les poids et les benchmarks indépendants confirment les chiffres phares, auquel cas SubQ change durablement la façon dont on bâtit l’IA à long contexte, soit l’écart devient l’histoire et SubQ rejoint la longue liste des architectures qui fonctionnaient à merveille sur le papier et décevaient en production.

Pour l’instant, SubQ mérite une surveillance attentive, une demande d’accès anticipé si vous exécutez des charges de travail à long contexte, et une bonne dose d’« attendons le rapport technique » avant de miser quoi que ce soit de sérieux dessus.

FAQ

Qu’est-ce que SubQ ?

SubQ est un grand modèle de langage lancé le 5 mai 2026 par Subquadratic, une startup IA basée à Miami. Il utilise un nouveau mécanisme d’attention appelé attention parcimonieuse sous-quadratique (SSA) et prend en charge une fenêtre de contexte de 12 millions de tokens dans sa configuration de recherche.

Qu’est-ce que l’attention parcimonieuse sous-quadratique ?

La SSA est un mécanisme d’attention qui évolue de façon linéaire avec la longueur du contexte au lieu de quadratique. Pour chaque token de requête, le modèle sélectionne un petit sous-ensemble de positions à traiter en fonction du contenu plutôt que de motifs fixes, puis calcule une attention exacte uniquement sur celles-ci.

Quelle est la taille de la fenêtre de contexte de SubQ ?

Le modèle de recherche prend en charge 12 millions de tokens, soit environ 9 millions de mots. L’API de production expose une fenêtre de contexte de 1 million de tokens.

SubQ est-il open source ?

Non. SubQ est à poids fermés et n’est pas open source. Subquadratic a dit qu’un rapport technique était à venir, mais ne s’est pas engagé à publier les poids.

Comment SubQ se compare-t-il à Claude ou GPT ?

Sur les benchmarks à long contexte comme RULER 128K, SubQ est compétitif face à Claude Opus 4.6. Sur MRCR v2 à 1M tokens, il obtient 65,9 %, derrière les 74,0 % de GPT-5.5. Le différenciateur, c’est le coût : Subquadratic revendique un coût environ 300x inférieur à précision égale sur RULER 128K, et 50x inférieur aux modèles de pointe à 1M tokens.

Puis-je utiliser SubQ aujourd’hui ?

L’accès est en bêta privée uniquement. SubQ API, SubQ Code (agent CLI) et SubQ Search (outil de recherche gratuit) nécessitent tous une demande d’accès via subq.ai. SubQ Search est le point d’entrée le plus facile.

SubQ est-il sérieux, ou du battage ?

Il est trop tôt pour le dire avec confiance. L’entreprise a publié des résultats de benchmarks et un billet technique expliquant la SSA, mais n’a pas publié de poids, de rapport technique complet ni de benchmarks indépendants. Plusieurs chercheurs, dont Will Depue, ont publiquement mis en doute que SubQ soit un fine-tune à attention parcimonieuse d’un modèle open source existant plutôt qu’une architecture entièrement nouvelle. Une vérification indépendante au cours des prochaines semaines en décidera.