Chargement…

GPT 6 Sol l'AGI ralentit ou pas ?

GPT 6 Sol l'AGI ralentit ou pas ?

10 jours après avoir promis de "ralentir la frontière", OpenAI sort 2 modèles et se compare frontalement à Anthropic. La compétition n'a pas disparu, elle a changé de terrain.

Mais on n'avait pas dit qu'on levait le pied ?

Le 12 septembre, Dario Amodei publie son essai "We Must Pace the Frontier".

Dans les heures qui suivent, Sam Altman, Elon Musk et Demis Hassabis applaudissent. 4 concurrents d'accord en un après-midi, c'est du jamais vu.

Sauf qu'il faut lire ce qui a réellement été promis :

  • pas de pause (Altman l'a précisé lui-même : "pacing" ne veut pas dire "stopping")
  • pas de seuil chiffré, pas de calendrier
  • un seul engagement concret : des évaluateurs indépendants embarqués dans les labs

10 jours plus tard, OpenAI lance GPT-6 Sol et Luna en réponse à Opus 5.5 dont je vous parlais ici. Et le billet d'annonce aligne les benchmarks face à Claude Opus 5 et Fable 5.1, tableau après tableau.

Donc non, la concurrence n'est pas finie.

Et ce n'est pas de la perf, c'est de l'optimisation

OpenAI met les scores en vitrine. Mais le vrai sujet, c'est la facture :

  • Sol passe de 4 $ / 20 $ à 2 $ / 10 $ le million de tokens (input / output) toujours en réponse à Opus 5.5 dont les prix baissent aussi
  • Luna passe de 0,20 $ / 1,20 $ à 0,10 $ / 0,50 $ en réponse à Deepseek 4.1 Flash
  • le prompt caching est amélioré, avec 90 % de remise sur les lectures en cache

Côté perf, il faut séparer les chiffres d'OpenAI (auto-déclarés, sur des benchs choisis par OpenAI) de ceux d'Artificial Analysis.

Et chez Artificial Analysis, le discours dégonfle vite. Sur l'Intelligence Index, Sol et Luna restent au niveau de GPT-5.6. Luna régresse même sur le Coding Agent Index.

Le coût par tâche est bien divisé par 2. Mais c'est la baisse de prix qui fait tout le travail : les 2 modèles consomment même un peu plus de tokens en sortie.

Même intelligence, facture divisée par 2. C'est de l'optimisation d'inférence et de la politique tarifaire, pas un saut de capacité.

Au passage, OpenAI raisonne enfin en coût par tâche plutôt qu'en coût par token.

Et je ne vais pas m'en plaindre. J'ai migré mes services en prod de Sonnet 5 vers DeepSeek V4.1-Flash, et je suis passé d'environ 30 centimes à 4 centimes par jour de process. Pour l'utilisateur, cette guerre des prix, c'est tout bénéf.

FAQ

Pourquoi OpenAI sort de nouveaux modèles alors qu'un pacte de prudence venait d'être annoncé ?

Parce que ce pacte n'a jamais promis de pause ni de calendrier précis, seulement l'ajout d'évaluateurs indépendants dans les labs. Rien n'empêchait donc OpenAI de continuer à lancer des modèles et à se comparer directement à Anthropic.

Sol et Luna sont-ils vraiment plus performants que les modèles précédents ?

Pas vraiment selon Artificial Analysis, qui les situe au même niveau que GPT-5.6, avec même une régression de Luna sur le coding. Les benchmarks mis en avant par OpenAI viennent de tests choisis par l'entreprise elle-même, à prendre avec prudence.

Alors quel est l'intérêt concret de ces nouveaux modèles ?

Leur principal atout est le prix, divisé par deux par rapport aux versions précédentes, avec en plus un prompt caching plus avantageux. Le coût par tâche baisse donc nettement, sans gain d'intelligence réel derrière.

Est-ce que ça veut dire que la course à la puissance entre labs IA est terminée ?

Non, elle continue, mais le terrain de bataille a changé : au lieu de viser des sauts de capacités spectaculaires, les labs optimisent désormais l'inférence et les tarifs pour gagner sur le rapport coût-efficacité.

Concrètement, qu'est-ce que ça change pour moi si j'utilise ces modèles en production ?

Cette guerre des prix profite directement aux utilisateurs, comme le montre l'exemple de migration vers DeepSeek V4.1-Flash qui a divisé les coûts par presque dix. Il vaut la peine de comparer régulièrement les tarifs des différents modèles plutôt que de rester fidèle à un seul fournisseur.

Comment savoir si un modèle est réellement meilleur ou juste moins cher ?

Le bon réflexe est de regarder le coût par tâche complète plutôt que le prix par token, et de croiser les benchmarks du fournisseur avec des évaluations indépendantes comme celles d'Artificial Analysis. Une baisse de facture ne signifie pas toujours un gain de performance réel.


Poursuivre la lecture

DeepSeek V4.1-Flash: petit mais fort News
#deepseek#code agentique#model

DeepSeek V4.1-Flash: petit mais fort

DeepSeek V4.1-Flash remplace discrètement le modèle Pro et promet plus de rapidité pour moins cher : la promesse tient-elle face au coût réel par tâche ?

Alexandre P.
TypeSafe veut sortir le LLM de vos if News
#jev#llm#décisions

TypeSafe veut sortir le LLM de vos if

TypeSafe AI sort du stealth avec Jev, un modèle qui ne génère plus de texte mais des décisions typées avec probabilité calibrée. Promesses folles, biais assumés : décryptage d'un positionnement qui interroge.

Alexandre P.