Chargement…

Sonnet 5.5 : moins cher, mais personne ne vous dit pourquoi

Sonnet 5.5 : moins cher, mais personne ne vous dit pourquoi

Anthropic annonce un Sonnet 5.5 jusqu'à 30% moins cher que Sonnet 5, et je vois déjà passer le mot "price drop" partout.

Sauf que la grille tarifaire n'a pas bougé d'un centime : 2$ le million de tokens en entrée, 10$ en sortie, 0,20$ en lecture de cache.

Ce qui baisse, c'est le coût par tâche, parce que le modèle consommerait beaucoup moins de tokens pour faire le même travail. Et c'est là que ça devient intéressant, car on a le résultat, mais pas la méthode.

Des chiffres, mais pas d'explication

La page d'annonce empile les benchmarks et les témoignages clients, mais pas une ligne sur ce qui a changé sous le capot.

Pas d'architecture, pas d'optimisation d'inférence documentée, pas d'équivalent au KV cache compressé que DeepSeek détaille publiquement.

On nous donne des chiffres, et ils varient énormément d'un client à l'autre :

  • Slack : environ 14% de tokens de sortie en moins
  • Box : 12% de tokens totaux en moins
  • Balyasny : de 497k à 121k tokens par réponse, soit 4 fois moins

Un écart pareil, ce n'est pas une optimisation uniforme de l'infra, c'est un changement de comportement du modèle : moins de raisonnement verbeux, des tool calls regroupés, moins d'allers-retours.

Mais c'est mon hypothèse, pas une info.

Et elle est difficile à vérifier, parce que Sonnet 5.5 est justement le premier Sonnet livré avec des classifieurs anti-distillation qui protègent son raisonnement.

Moins cher pour qui ?

Donc la question n'est pas "est-ce moins cher ?", mais "moins cher pour qui ?".

Une baisse de prix unitaire, vous la voyez sur votre facture quoi que vous fassiez. Une baisse de tokens par tâche, elle dépend de votre usage, de vos prompts et du niveau d'effort choisi (Medium par défaut dans les apps, High sur l'API).

Et quand les comparaisons officielles opposent Sonnet 5.5 en Low ou Medium au meilleur score de Sonnet 5 en Max, on compare des réglages, pas des modèles.

La vérité c'est que le seul benchmark qui compte, c'est le vôtre. Relancez vos propres workflows, mesurez votre consommation, et vous saurez si ce "price drop" existe chez vous.

Reste une question que je trouve plus stratégique que le prix lui-même : jusqu'où allons-nous accepter de payer des modèles dont on mesure l'efficacité sans jamais pouvoir l'expliquer ?

D'ailleurs, je ne sais pas si vous avez remarqué le shift du discours ces derniers temps.

On est passé d'un monde où on nous vendait les agents toujours plus "capables" et performants et qui consommaient toujours de manière croissante à un monde où le combat est sur le coût par tâche, le rapport entre dépense et résultat.

OpenAI l'a fait avec GPT 6 Sol puis 6.1 Sol, moins cher par tâche. Viennent ensuite Opus 5.5 au même niveau que Sol et maintenant ce Sonnet 5.5 pour un marché plus entrée de gamme.

Je remets ça encore une fois sur la table mais c'est grâce à Deepseek et aux modèles chinois bien plus frugaux et optimisés pour le coût d'inférence qu'on y arrive enfin.

Peut être qu'on finira par tendre vers quelque chose de rationnel en matière de puissance de calcul pour un résultat satisfaisant.

FAQ

Le prix par million de tokens de Sonnet 5.5 a-t-il vraiment changé ?

Non, la grille tarifaire reste identique à celle de Sonnet 5 : 2$ en entrée, 10$ en sortie, 0,20$ en lecture de cache. La baisse annoncée porte sur le coût par tâche, pas sur le tarif unitaire.

Pourquoi le coût par tâche baisserait-il si les prix restent les mêmes ?

Parce que le modèle consommerait moins de tokens pour accomplir le même travail, grâce à un raisonnement moins verbeux et des appels d'outils plus regroupés. Mais Anthropic ne documente pas cette optimisation, contrairement à des acteurs comme DeepSeek qui détaillent leurs méthodes.

Pourquoi les gains varient autant d'un client à l'autre ?

Les écarts constatés vont de 12% à 4 fois moins de tokens selon les cas, ce qui suggère un changement de comportement du modèle plutôt qu'une simple optimisation d'infrastructure uniforme. Cela dépend surtout de vos prompts, de votre usage et du niveau d'effort choisi.

Comment savoir si cette baisse s'applique à mon propre usage ?

Le seul moyen fiable est de relancer vos workflows habituels sur Sonnet 5.5 et de mesurer votre consommation réelle de tokens. Les benchmarks officiels comparent souvent des réglages différents entre versions, ce qui rend les chiffres publics peu représentatifs de votre cas.

Qu'est-ce que les classifieurs anti-distillation changent pour l'utilisateur ?

Ils protègent le raisonnement interne du modèle, ce qui rend plus difficile de comprendre ou de vérifier précisément pourquoi Sonnet 5.5 consomme moins de tokens. Cela renforce l'opacité déjà présente sur les mécanismes d'optimisation revendiqués par Anthropic.


Poursuivre la lecture

GPT-6.1 Sol : ralentir l'AGI, mais en accéléré News
#gpt 6.1 sol#openai#code agentique

GPT-6.1 Sol : ralentir l'AGI, mais en accéléré

OpenAI promet de ralentir face aux risques de l'IA, mais enchaîne les sorties de modèles à un rythme record. Coïncidence ou stratégie ? Décryptage d'un discours qui interroge.

Alexandre P.
Open AI sort Dots News
#openai#dots#agent autonome

Open AI sort Dots

OpenAI lance les dots, des agents autonomes actifs 24h/24 avec leur propre ordinateur cloud. Mais entre quotas et abonnements annoncés, leur vrai coût reste flou.

Alexandre P.