Anthropic annonce un Sonnet 5.5 jusqu'à 30% moins cher que Sonnet 5, et je vois déjà passer le mot "price drop" partout.
Sauf que la grille tarifaire n'a pas bougé d'un centime : 2$ le million de tokens en entrée, 10$ en sortie, 0,20$ en lecture de cache.
Ce qui baisse, c'est le coût par tâche, parce que le modèle consommerait beaucoup moins de tokens pour faire le même travail. Et c'est là que ça devient intéressant, car on a le résultat, mais pas la méthode.
Des chiffres, mais pas d'explication
La page d'annonce empile les benchmarks et les témoignages clients, mais pas une ligne sur ce qui a changé sous le capot.
Pas d'architecture, pas d'optimisation d'inférence documentée, pas d'équivalent au KV cache compressé que DeepSeek détaille publiquement.
On nous donne des chiffres, et ils varient énormément d'un client à l'autre :
- Slack : environ 14% de tokens de sortie en moins
- Box : 12% de tokens totaux en moins
- Balyasny : de 497k à 121k tokens par réponse, soit 4 fois moins
Un écart pareil, ce n'est pas une optimisation uniforme de l'infra, c'est un changement de comportement du modèle : moins de raisonnement verbeux, des tool calls regroupés, moins d'allers-retours.
Mais c'est mon hypothèse, pas une info.
Et elle est difficile à vérifier, parce que Sonnet 5.5 est justement le premier Sonnet livré avec des classifieurs anti-distillation qui protègent son raisonnement.
Moins cher pour qui ?
Donc la question n'est pas "est-ce moins cher ?", mais "moins cher pour qui ?".
Une baisse de prix unitaire, vous la voyez sur votre facture quoi que vous fassiez. Une baisse de tokens par tâche, elle dépend de votre usage, de vos prompts et du niveau d'effort choisi (Medium par défaut dans les apps, High sur l'API).
Et quand les comparaisons officielles opposent Sonnet 5.5 en Low ou Medium au meilleur score de Sonnet 5 en Max, on compare des réglages, pas des modèles.
La vérité c'est que le seul benchmark qui compte, c'est le vôtre. Relancez vos propres workflows, mesurez votre consommation, et vous saurez si ce "price drop" existe chez vous.
Reste une question que je trouve plus stratégique que le prix lui-même : jusqu'où allons-nous accepter de payer des modèles dont on mesure l'efficacité sans jamais pouvoir l'expliquer ?
D'ailleurs, je ne sais pas si vous avez remarqué le shift du discours ces derniers temps.
On est passé d'un monde où on nous vendait les agents toujours plus "capables" et performants et qui consommaient toujours de manière croissante à un monde où le combat est sur le coût par tâche, le rapport entre dépense et résultat.
OpenAI l'a fait avec GPT 6 Sol puis 6.1 Sol, moins cher par tâche. Viennent ensuite Opus 5.5 au même niveau que Sol et maintenant ce Sonnet 5.5 pour un marché plus entrée de gamme.
Je remets ça encore une fois sur la table mais c'est grâce à Deepseek et aux modèles chinois bien plus frugaux et optimisés pour le coût d'inférence qu'on y arrive enfin.
Peut être qu'on finira par tendre vers quelque chose de rationnel en matière de puissance de calcul pour un résultat satisfaisant.