Chargement…

Claude Opus 5, même prix !

Claude Opus 5, même prix !

Anthropic a sorti Opus 5 le 24 juillet. La communication tourne autour d'une idée simple : l'intelligence de Fable 5, à moitié prix. Sauf que le tarif affiché est rigoureusement identique à celui d'Opus 4.8. Voilà pourquoi ce lancement est le meilleur argument que j'aie vu depuis longtemps en faveur du coût par tâche.

Le tarif n'a pas changé, donc rien n'a changé ?

5$ le million de tokens en entrée, 25$ en sortie. Exactement la grille d'Opus 4.8.

Le cache reste aussi au même endroit : 6,25$ le million en écriture (25% de surcoût), 0,50$ en lecture (90% de remise), TTL de 5 minutes. Fenêtre de contexte à 1 million de tokens, comme avant.

Si vous lisez le lancement avec une grille de prix sous les yeux, vous ne voyez donc strictement rien, zéro évolution.

Et pourtant Anthropic titre sur "la moitié du prix".

Le prix dont ils parlent n'est pas le prix du token, c'est le prix de la tâche accomplie.

2 choses qui n'ont plus rien à voir depuis que les modèles décident eux-mêmes combien ils réfléchissent.

2,03$ la tâche, et ce chiffre est plus intéressant que la grille tarifaire

Artificial Analysis a évalué le modèle en amont de la sortie, ce qui en fait une source à moitié indépendante (ils précisent avoir accompagné Anthropic avant le lancement), mais avec une méthodologie publique et un harness ouvert. C'est ce qu'on a de mieux aujourd'hui.

Leur chiffre clé : Opus 5 en effort max coûte en moyenne 2.03$ par tâche de l'Intelligence Index.

Le classement complet du coût par tâche :

  • Sonnet 5 (max) : 1.53$
  • Opus 4.8 (max) : 1.80$
  • Opus 5 (max) : 2.03$
  • Fable 5 (avec fallback) : 2.75$

Regardez bien cette liste. Opus 5 est effectivement 26% moins cher que Fable 5 par tâche.

Mais il est aussi 13% plus cher qu'Opus 4.8 par tâche, à grille tarifaire identique.

Donc à prix au token constant, la génération suivante vous coûte plus cher à l'usage. Parce qu'elle consomme plus. C'est exactement le mécanisme que je répète depuis des mois : le prix au token est devenu une donnée décorative, la seule métrique qui engage votre facture c'est le coût par tâche terminée.

Nuance importante : Artificial Analysis précise qu'aux niveaux d'effort high et xhigh, Opus 5 passe devant Opus 4.8 et Sonnet 5 en intelligence tout en coûtant moins cher par tâche. La bonne affaire existe, elle n'est juste pas là où le marketing la pointe.

Au passage, notez l'écart entre les deux discours. Anthropic annonce "la moitié du prix" face à Fable 5. Artificial Analysis mesure 26% de coût par tâche en moins sur son propre index. Les deux peuvent être vrais (charges de travail différentes, prix au token contre prix à la tâche), mais l'écart entre 50 % et 26 % mérite d'être posé sur la table plutôt que lissé.

5 niveaux d'effort, 8x d'écart en tokens de sortie

C'est là que ça devient vraiment intéressant pour nous.

Opus 5 expose cinq réglages d'effort : low, medium, high, xhigh, max.

Sur GDPval-AA v2, l'écart entre le niveau le plus bas et le plus haut représente :

  • 407 points d'Elo de performance
  • environ 8x de tokens de sortie consommés

8 fois.

Le même modèle, la même API, le même prix au token, et une facture qui varie d'un facteur huit selon un paramètre que la plupart des gens laisseront par défaut.

Sur l'Intelligence Index d'Artificial Analysis, ça donne 51 en low, 56 en medium, 59 en high, 60 en xhigh, 61 en max.

Traduction : vous récupérez 84 % de la performance maximale au niveau low, pour une fraction du coût. Le dernier tiers de qualité est payé au prix fort, littéralement.

Si vous facturez du forfait ou que vous opérez un agent en production, le réglage d'effort devient une décision d'architecture, pas une option. Et personne ne vous l'expliquera dans un communiqué de presse.

Vous voyez pourquoi j'ai construit [un boîtier Pico W avec écran ePaper](url à venir) pour afficher ma consommation de tokens en temps réel sur mon bureau. Quand un paramètre fait varier votre coût d'un facteur huit sans changer une ligne de votre code, il faut le voir en permanence.

Le détail important : les benchmarks tournent avec un filet de sécurité

Celui-là, je l'ai trouvé en note de bas de page.

Anthropic précise que sur son run de Frontier-Bench v0.1, Opus 4.8 servait de fallback quand les classifieurs de sécurité refusaient une requête, pour Opus 5 comme pour Fable 5.

Artificial Analysis indique la même chose de son côté : les évaluations de l'Intelligence Index ont été passées avec le fallback vers Opus 4.8 activé.

Donc les scores publiés ne mesurent pas exactement Opus 5. Ils mesurent Opus 5 plus une doublure qui prend le relais sur les requêtes bloquées.

Je ne crie pas au scandale, c'est documenté et c'est probablement représentatif de ce que vit un utilisateur en production, puisque le fallback est justement le comportement par défaut dans Claude.ai, Claude Code et Cowork.

Mais ça veut dire que la ligne "Opus 5 : 61" n'est pas la performance d'un modèle. C'est la performance d'un système de routage.

Anthropic annonce d'ailleurs que les classifieurs cyber d'Opus 5 devraient se déclencher environ 85% moins souvent que sur Fable 5. Autrement dit, ils savent que le sujet des faux positifs est réel, et ils l'adressent.

Ce genre de détail devient structurant. Quand vous achetez un modèle aujourd'hui, vous achetez un modèle, des classifieurs, une politique de fallback et un mode de facturation. Le poids relatif de ces quatre briques n'apparaît nulle part dans un tableau comparatif.

Et puis je vois beaucoup de gens dire c'est bon je lâche Fable, c'est le meilleur modèle blabla...

Je pense qu'il faut garder en tête un point important: tout dépend de la taille de la tâche confiée.

Si vous demandez une feature simple à l'IA, alors oui Opus 5 fait très bien l'affaire. Mais confiez lui un projet de > de 3h vous verrez comment il pète les plombs vite fait alors que ce n'est pas le cas pour Fable.

FAQ

Le prix d'Opus 5 a-t-il vraiment changé par rapport à Opus 4.8 ?

Non, la grille tarifaire est strictement identique : 5$ le million de tokens en entrée, 25$ en sortie, même politique de cache et même fenêtre de contexte à 1 million de tokens. La communication autour de la baisse de prix concerne le coût par tâche, pas le tarif au token.

Pourquoi Anthropic parle-t-il de moitié prix si les tarifs sont identiques ?

Parce qu'ils comparent le coût réel d'exécution d'une tâche, qui dépend du nombre de tokens consommés, et non le prix affiché au token. Un modèle peut coûter le même prix au token tout en revenant moins cher à l'usage s'il produit moins de tokens pour un résultat équivalent.

Opus 5 coûte-t-il plus cher qu'Opus 4.8 à l'usage ?

Oui, selon Artificial Analysis, Opus 5 en effort max coûte environ 13% de plus par tâche que Opus 4.8, à grille tarifaire égale, car il consomme davantage de tokens. La bonne affaire n'apparaît qu'aux niveaux d'effort high et xhigh, où Opus 5 devient à la fois plus performant et moins cher par tâche.

À quoi sert le réglage d'effort et pourquoi est-il si important ?

Ce paramètre, disponible en cinq niveaux de low à max, fait varier la consommation de tokens de sortie d'un facteur huit pour un gain de performance beaucoup plus limité. Le niveau low permet déjà d'atteindre 84% de la performance maximale, ce qui en fait un vrai levier d'optimisation de coûts pour qui opère des agents en production.

Les benchmarks publiés reflètent-ils les performances réelles du modèle seul ?

Pas exactement, car Anthropic et Artificial Analysis précisent que les évaluations ont tourné avec un mécanisme de fallback vers Opus 4.8 activé lorsque les classifieurs de sécurité bloquaient une requête. Les scores mesurent donc la performance d'un système de routage complet, et non celle du modèle isolé.

Faut-il abandonner Fable au profit d'Opus 5 ?

Cela dépend surtout de la taille et de la durée de la tâche confiée. Pour des demandes simples et courtes, Opus 5 fait très bien l'affaire, mais sur des projets longs de plusieurs heures, Fable garde l'avantage en stabilité là où Opus 5 tend à décrocher.


Poursuivre la lecture

Claude Sonnet 5: baisse de prix ? News
#anthropic#sonnet#code agentique

Claude Sonnet 5: baisse de prix ?

Anthropic lance Sonnet 5, présenté comme l'équivalent quasi-Opus à prix Sonnet. Mais entre tokenizer plus gourmand et verbosité accrue, la facture réelle mérite qu'on y regarde de près.

Alexandre P.
Kimi K3, nouveau model frontier open weight News
#ai#kimi k3#code agentique

Kimi K3, nouveau model frontier open weight

Kimi K3 promet 2,8 trillions de paramètres et l'étiquette "open source", mais entre l'annonce et le vrai fichier téléchargeable, l'écart mérite d'être décortiqué.

Alexandre P.