OpenAI a sorti son modèle frontière le 3 septembre et a parlé d'ère AGI. Artificial Analysis a mesuré, et la photo est nettement moins spectaculaire.
Le communiqué est agressif : "le modèle le plus intelligent et le plus aligné du monde", FrontierMath Tier 4 saturé, ARC-AGI-3 à 99,9 %, ExploitBench à 100 %. Sauf que ces chiffres viennent des tables d'OpenAI, avec le harness d'OpenAI.
Sur ARC-AGI-3, le fameux 99,9 % est obtenu avec un adaptateur propriétaire qui conserve l'état de raisonnement entre les actions, là où le harness neutre place le modèle autour de 62 %. Et sur l'Intelligence Index d'Artificial Analysis, qui reste ma référence quand je veux un chiffre que le vendeur n'a pas calibré lui-même, Astra sort à 61,2. Son prédécesseur GPT-5.6 Sol est à 60,9.
Claude Fable 5.1 est à 65,7.
Sur l'agrégat indépendant, la nouvelle génération est à l'écart de mesure de l'ancienne, et derrière la concurrence.
La question qui reste c'est : le coût par tâche.
Astra est facturé 10 $ par million de tokens en entrée et 50 $ en sortie, contre 4 $ et 20 $ pour Sol. C'est 2,5x. Artificial Analysis mesure une réduction réelle de consommation de tokens (jusqu'à 3x moins en mode max sur l'index coding agent), mais le calcul final donne quand même environ 75 % plus cher par tâche à effort maximum.
Donc vous payez une prime importante pour un modèle qui, sur l'agrégat neutre, ne bouge pas. Et il faut y ajouter les régressions documentées : environ 80 points Elo perdus sur GDPval-AA v2, plus des reculs de 2 à 3 points sur le support client, SciCode et le raisonnement long contexte.
Il y a quand même deux choses que je trouve intéressantes.
Le taux d'hallucination sur AA-Omniscience passe de 92 % à 51 % en mode max, ce qui est la vraie amélioration exploitable au quotidien.
Et côté cyber, OpenAI classe le modèle au seuil Critical de son Preparedness Framework, avec deux zero-days découverts pendant l'évaluation interne.
Ce qui explique pourquoi le modèle refuse aujourd'hui de produire des proof-of-concept, même en contexte défensif. Voilà ce que je retiens pour l'instant :
- l'usage agentique long (computer use, Codex) semble être le seul terrain où la marche est nette
- le rapport prix / gain ne justifie pas une migration par défaut depuis Sol ou Fable
- la baisse d'hallucination vaut peut-être le test sur vos workflows de recherche
Je ne l'ai pas encore passé sur mes propres tâches, donc je ne vais pas trancher plus tard.
Mais quand un lancement a besoin de son propre harness pour tenir son chiffre phare, ça commence toujours par une lecture attentive des notes de bas de page.
Je le teste cette semaine.