Il s'est passé énormément de chose ces derniers jours:
- OpenAI annonce GPT 5.6 Sol mais indisponible chez nous
- Anthropic prolonge Fable 5 jusqu'au 12 juillet
SpaceXAI (anciennement xAI) vient d'annoncer Grok 4.5.
Et le plus intéressant n'est pas le modèle. C'est la manière dont ils le vendent.
Parce que d'habitude, un lancement de modèle, c'est un mur de barres vertes où le nouveau venu écrase tout le monde. SpaceXAI montre des graphiques où ils perdent.
Et je vais vous expliquer pourquoi c'est le signal le plus important de ce lancement.
Et le vendeur montre les benchmarks qu'il perd
Regardez la page officielle. Sur les cinq benchmarks de code qu'ils affichent eux-mêmes, Grok 4.5 est premier une seule fois.
Sur le reste, il est troisième ou quatrième. Derrière Fable 5 et GPT 5.5, parfois même Opus 4.8.
Voici les chiffres, tels que SpaceXAI les publie (donc auto-déclarés, on y reviendra) :
| Benchmark | Grok 4.5 | Fable 5 | GPT 5.5 | Opus 4.8 |
|---|---|---|---|---|
| DeepSWE 1.1 | 53 % | 70 % | 67 % | 59 % |
| SWE Bench Pro | 64,7 % | 80,4 % | 69,2 % | |
| Terminal Bench 2.1 | 83,3 % | 84,3 % | 83,4 % | |
| SWE Marathon | 29 % | 24 % | 26 % |
Donc sur la capacité brute, Grok 4.5 n'est pas le meilleur, et SpaceXAI ne fait aucun effort pour le cacher.
C'est un choix de communication qui n'a rien d'innocent. Montrer ses défaites, c'est ce qui rend crédible le seul chiffre qui les intéresse vraiment.
Donc quel est le vrai argument ? Le coût par tâche
Le vrai produit ici, ce n'est pas l'intelligence, c'est la facture.
Ça fait des mois que je répète la même chose sur ce blog : le prix affiché au million de tokens ne veut rien dire tout seul. Ce qui compte, c'est le coût par tâche.
Et le coût par tâche, c'est le prix du token multiplié par le nombre de tokens que le modèle crache, multiplié par le nombre de tours qu'il fait en mode agentique, plus les retries quand il se plante.
Un modèle bavard à prix cassé peut vous coûter plus cher qu'un modèle concis à prix élevé. C'est tout le sujet.
Et SpaceXAI a construit son lancement exactement là-dessus. Pas sur "on est les plus forts", mais sur "on fait le même travail pour beaucoup moins cher".
Le prix d'abord :
- Grok 4.5 : 2 $ le million de tokens en entrée, 6 $ en sortie (0,50 $ sur le cache).
- Opus 4.8 : 5 $ en entrée, 25 $ en sortie.
- Fable 5 : 10 $ en entrée, 50 $ en sortie.
- GPT 5.5 : 5 $ en entrée, 30 $ en sortie.
Ensuite la verbosité. SpaceXAI affirme que sur SWE Bench Pro, Grok 4.5 résout une tâche avec 15 954 tokens de sortie en moyenne, contre 67 020 pour Opus 4.8. Soit 4,2 fois moins.
Prix au token plus bas, multiplié par des tokens par tâche plus bas. C'est précisément le levier que je décris depuis Sonnet 5. Sauf que cette fois, c'est le vendeur lui-même qui met la thèse sur la table.
Mais est-ce que quelqu'un de neutre confirme ?
Parce que jusqu'ici, tout ce que je viens de citer vient de SpaceXAI. Et un chiffre de vendeur, c'est un chiffre de vendeur.
Donc je suis allé voir Artificial Analysis, qui teste tout le monde sur le même harnais, sans avoir de modèle à vendre.
Et pour une fois, la mesure indépendante va dans le même sens que le discours marketing.
Sur l'intelligence brute d'abord, Artificial Analysis place Grok 4.5 à 54 sur son Intelligence Index. Quatrième sur 168 modèles. Derrière Fable 5 (60), Opus 4.8 (56) et GPT 5.5 (55).
Donc SpaceXAI dit vrai : ce n'est pas le plus intelligent. C'est un bond de 16 points sur Grok 4.3, ce qui reste énorme pour une itération, mais ça ne prend pas la tête du classement.
Là où ça devient sérieux, c'est sur le coût réel mesuré :
- Coût par tâche sur l'Intelligence Index : 0,31 $. Cinq fois moins cher que Sonnet 5 en max, qui score pourtant moins bien.
- Tokens de sortie par tâche : environ 14 000, plus de 60 % en dessous d'Opus 4.8. La direction de la revendication à 4,2 fois est donc confirmée par une source neutre.
- Coût par tâche de code dans Grok Build : autour de 2,50 $, contre 11,80 $ pour Fable 5 dans Claude Code et 5,07 $ pour GPT 5.5 dans Codex.
Et sur l'agentique, là où le coût par tâche fait le plus mal, Grok 4.5 tape fort. Il prend la première place sur τ³-Banking (33 %, devant GPT 5.5 à 31 %) et sur AutomationBench-AA (51,4 %, premier modèle à passer la barre des 50 %, devant Fable 5 et Opus 4.8), à 0,34 $ la tâche contre plus de 1,30 $ pour les deux Claude.
Donc la lecture honnête, ce n'est pas "Grok 4.5 écrase Opus". C'est "Grok 4.5 fait un travail proche du top pour une fraction du prix, et cette fois un tiers neutre le confirme".
Car il y a quand même deux redflags
Je ne vais pas vous vendre un modèle que je n'ai pas testé comme si c'était parfait. Ce n'est pas ma façon de faire.
Le premier problème, c'est l'hallucination. Sur le test AA-Omniscience, la précision de Grok 4.5 monte de 35 % à 52 %. Bonne nouvelle. Sauf que son taux d'hallucination monte lui aussi, de 25 % à 54 %.
Traduction : le modèle sait plus de choses, mais il est aussi beaucoup plus sûr de lui quand il a tort. Pour du travail factuel à enjeu, la vérification reste obligatoire.
Le second problème, c'est la conformité en mode agent. Sur AutomationBench-AA, Grok 4.5 gagne en score, mais il enfreint plus souvent les règles métier : 0,63 violation de garde-fou par tâche, contre 0,55 pour Opus 4.8 et 0,46 pour Gemini 3.5 Flash.
Ça, c'est le genre de détail qui ne se voit pas sur un graphique de lancement, mais qui compte quand vous branchez un agent près d'un système financier ou d'une base de production.
Et il y a un troisième point, que je relaie sans trancher parce qu'il ne relève pas de la mesure : le fil le plus commenté sur Hacker News le jour du lancement ne portait pas sur les capacités du modèle, mais sur la confiance, autour d'accusations de biais orientés sur certaines questions politiques. Je le note, je ne conclus pas.
Et moi, je ne peux même pas encore le tester
Voilà le vrai souci de mon côté.
Grok 4.5 n'est pas disponible dans l'Union européenne au lancement. Ni dans les produits SpaceXAI, ni via la console API. La sortie EU est annoncée pour la mi-juillet.
Ce qui veut dire que tout ce que vous venez de lire, c'est de la lecture croisée : les chiffres de SpaceXAI d'un côté, ceux d'Artificial Analysis de l'autre. Ce n'est pas mon retour terrain.
Or mon retour terrain, c'est justement là où ces revendications de coût par tâche se cassent la figure ou se confirment. Un modèle concis en benchmark peut redevenir bavard sur votre vrai codebase, avec vos vraies contraintes, vos vrais retries.
Donc je fais ce que je fais toujours avec un produit que je n'ai pas eu en main : je vous donne les faits, je sépare l'auto-déclaré du vérifié, et je remets mon jugement à plus tard.
Je reteste tout ça pour de vrai dès que Grok 4.5 arrive en EU, dans mes propres projets, sur mes propres tâches. Et là on saura si le coût par tâche tient la route hors du terrain de jeu de son fabricant.
En attendant, retenez juste ceci : le fait que même Elon Musk vende désormais un modèle sur son coût par tâche plutôt que sur son score brut, ça vous dit où va vraiment le marché.