Anthropic sort Fable 5.1 et Mythos 5.1, le même modèle avec deux niveaux de garde-fous. Et le chiffre que tout le monde a retenu, c'est la baisse de prix.
Sur le papier, la montée en capacité est réelle.
Terminal-Bench-Science passe de 24,7 % à 52,6 %, AutomationBench de 17,1 % à 31,4 %, Humanity's Last Exam à 60,9 % sans outils.
Artificial Analysis, qui n'est pas Anthropic, confirme la direction avec un score de 66 sur son Intelligence Index en effort max, le meilleur qu'ils aient mesuré, devant Opus 5 (63) et Fable 5 (62).
Côté tarif, les tokens ne bougent pas (10$ /M en entrée, 50$ en sortie), mais les cache reads tombent à 0,25 $ /M, soit 75% de moins. Anthropic en déduit environ 25 % d'économie sur une charge classique, et jusqu'à 45% sur de l'agentique lourd.
Sauf qu'une facture ne se lit pas au token, elle se lit à la tâche. Je m'explique. Artificial Analysis mesure environ 3,7$ par tâche de son Intelligence Index, soit à peu près 20 % de plus que Fable 5.
Le modèle est nettement plus verbeux : 160M de tokens générés sur l'index contre une médiane de 79M, et un facteur 11 entre l'effort low et l'effort max.
La remise sur le cache est vraie, mais elle est mangée par le volume de sortie.
Autre détail qui compte : ce score de 66 a été obtenu avec le fallback serveur actif, environ 4 % des tokens de sortie ayant été servis par Opus 4.8 ou Opus 5 quand un garde-fou se déclenchait.
Ce n'est donc pas un résultat mono-modèle.
Je ne l'ai pas encore mis en production sur mes propres workflows, donc je ne vais pas vous vendre un ressenti que je n'ai pas.
Ce que je retiens pour l'instant : le gain se concentre sur le travail long, outillé, non supervisé, et il reste à un chiffre sur le code quotidien court.
Avant de basculer votre pipeline, mesurez votre coût par tâche sur une semaine réelle plutôt que votre coût par million de tokens.
C'est le seul des deux qui apparaît sur votre relevé bancaire.