Chargement…

GPT 6 Astra: plus cher, plus perf ?

GPT 6 Astra: plus cher, plus perf ?

OpenAI a sorti son modèle frontière le 3 septembre et a parlé d'ère AGI. Artificial Analysis a mesuré, et la photo est nettement moins spectaculaire.

Le communiqué est agressif : "le modèle le plus intelligent et le plus aligné du monde", FrontierMath Tier 4 saturé, ARC-AGI-3 à 99,9 %, ExploitBench à 100 %. Sauf que ces chiffres viennent des tables d'OpenAI, avec le harness d'OpenAI.

Sur ARC-AGI-3, le fameux 99,9 % est obtenu avec un adaptateur propriétaire qui conserve l'état de raisonnement entre les actions, là où le harness neutre place le modèle autour de 62 %. Et sur l'Intelligence Index d'Artificial Analysis, qui reste ma référence quand je veux un chiffre que le vendeur n'a pas calibré lui-même, Astra sort à 61,2. Son prédécesseur GPT-5.6 Sol est à 60,9.

Claude Fable 5.1 est à 65,7.

Sur l'agrégat indépendant, la nouvelle génération est à l'écart de mesure de l'ancienne, et derrière la concurrence.

La question qui reste c'est : le coût par tâche.

Astra est facturé 10 $ par million de tokens en entrée et 50 $ en sortie, contre 4 $ et 20 $ pour Sol. C'est 2,5x. Artificial Analysis mesure une réduction réelle de consommation de tokens (jusqu'à 3x moins en mode max sur l'index coding agent), mais le calcul final donne quand même environ 75 % plus cher par tâche à effort maximum.

Donc vous payez une prime importante pour un modèle qui, sur l'agrégat neutre, ne bouge pas. Et il faut y ajouter les régressions documentées : environ 80 points Elo perdus sur GDPval-AA v2, plus des reculs de 2 à 3 points sur le support client, SciCode et le raisonnement long contexte.

Il y a quand même deux choses que je trouve intéressantes.

Le taux d'hallucination sur AA-Omniscience passe de 92 % à 51 % en mode max, ce qui est la vraie amélioration exploitable au quotidien.

Et côté cyber, OpenAI classe le modèle au seuil Critical de son Preparedness Framework, avec deux zero-days découverts pendant l'évaluation interne.

Ce qui explique pourquoi le modèle refuse aujourd'hui de produire des proof-of-concept, même en contexte défensif. Voilà ce que je retiens pour l'instant :

  • l'usage agentique long (computer use, Codex) semble être le seul terrain où la marche est nette
  • le rapport prix / gain ne justifie pas une migration par défaut depuis Sol ou Fable
  • la baisse d'hallucination vaut peut-être le test sur vos workflows de recherche

Je ne l'ai pas encore passé sur mes propres tâches, donc je ne vais pas trancher plus tard.

Mais quand un lancement a besoin de son propre harness pour tenir son chiffre phare, ça commence toujours par une lecture attentive des notes de bas de page.

Je le teste cette semaine.

FAQ

Astra est-il vraiment moins performant que Sol, son prédécesseur ?

Sur l'Intelligence Index d'Artificial Analysis, un agrégat neutre non calibré par OpenAI, Astra obtient 61,2 contre 60,9 pour Sol, soit une différence négligeable. Il reste en plus derrière Claude Fable 5.1, qui atteint 65,7 sur le même index.

Pourquoi le chiffre de 99,9 % sur ARC-AGI-3 est-il trompeur ?

Ce score est obtenu avec un adaptateur propriétaire d'OpenAI qui conserve l'état de raisonnement entre les actions. Avec un harness neutre, sans cet avantage technique, le modèle retombe autour de 62 %.

Astra coûte-t-il vraiment plus cher à l'usage ?

Oui, il est facturé 10 dollars par million de tokens en entrée et 50 dollars en sortie, contre 4 et 20 dollars pour Sol, soit environ 2,5 fois plus. Même avec une consommation de tokens réduite, le coût final par tâche reste environ 75 % plus élevé à effort maximum.

Y a-t-il quand même une vraie amélioration avec ce modèle ?

Le taux d'hallucination mesuré sur AA-Omniscience chute de 92 % à 51 % en mode max, ce qui constitue un gain concret pour des usages de recherche. L'usage agentique long, comme le computer use ou Codex, semble aussi être un terrain où la progression est nette.

Pourquoi le modèle refuse-t-il de générer certains contenus liés à la cybersécurité ?

OpenAI a classé Astra au seuil Critical de son Preparedness Framework après la découverte de deux zero-days pendant l'évaluation interne. Cette classification explique pourquoi le modèle refuse aujourd'hui de produire des proof-of-concept, même dans un contexte défensif.

Faut-il migrer vers Astra dès maintenant ?

Le rapport entre le prix et le gain de performance ne justifie pas une migration par défaut depuis Sol ou Fable, d'autant que des régressions sont documentées sur GDPval-AA v2, le support client et SciCode. Il vaut mieux tester le modèle sur ses propres workflows, en particulier ceux liés à la recherche où la baisse d'hallucination pourrait apporter un bénéfice réel.


Poursuivre la lecture

Claude Opus 5, même prix ! News

Claude Opus 5, même prix !

Opus 5 d'Anthropic promet l'intelligence de Fable 5 à moitié prix, même grille tarifaire qu'Opus 4.8 à l'appui : les chiffres racontent-ils vraiment la même histoire ?

Alexandre P.
GPT 5.6 muselé News
#ia#régulation#openai

GPT 5.6 muselé

Washington vient de contrôler pour la première fois l'accès à un modèle IA avant même sa sortie. Ce qui se joue avec GPT-5.6 concerne directement quiconque construit sur des API de frontier models.

Alexandre P.