Un modèle low cost, de quoi alléger les factures ?
Un petit modèle qui ne fait plus de la figuration
Anthropic a sorti Claude Haiku 5.5 le 7 octobre, et je vais être honnête : Haiku 4.5 j'ai fini par lâcher à cause des tâches que je lui donnais. C'était des conditions, ou de la petite traduction et pour le coût j'étais passé sur Jev ou Deepseek 4.1 Flash.
Mais voyons un peu où en est Haiku.
Sur Terminal-Bench 4.0, il plafonnait à 0 %. Zéro.
Haiku 5.5 monte à 39,2 %, et à 72,4 % sur OSWorld 2.1 (contre 15,7 % pour son prédécesseur). Il prend aussi un réglage d'effort, comme Sonnet et Opus, ce qui est une première sur la gamme Haiku.
Mais il faut bien retenir une chose : ces chiffres sortent tous de chez Anthropic.
Artificial Analysis n'a encore rien publié de son côté, donc j'attends leurs mesures avant de m'emballer.
Et Anthropic le dit lui-même : pour du coding agentique complexe, Sonnet 5.5 et Opus 5.5 restent loin devant (70,6 % sur Terminal-Bench pour Sonnet).
Mais le vrai coup, c'est le prix
Voici la grille par million de tokens, pour les prompts sous 100k tokens :
- Input : 0,10 $ (contre 1 $ sur Haiku 4.5)
- Output : 0,50 $ (contre 5 $)
- Cache read : 0,01 $ (contre 0,10 $)
On parle de 90 % de baisse sur ce segment, qui représentait 90 % des requêtes sur Haiku 4.5.
Au-delà de 100k, la baisse tombe à 50 %.
Et le nouveau tokenizer consomme un peu plus de tokens par tâche, d'où le chiffre officiel plus prudent de 75 % d'économie moyenne.
Dans la foulée, Anthropic divise par 2 le cache read de Sonnet 5.5 (environ 20 % moins cher sur du travail agentique) et offre des crédits API mensuels : 100 $ pour Max 5x, 200 $ pour Max 20x, jusqu'à 500 $ mutualisés pour Team.
Donc, est-ce que je reviens chez Anthropic ?
Mes services en prod tournent aujourd'hui sur DeepSeek V4.1-Flash, que j'ai migrés depuis Haiku parce que la facture passait de 30 cents à 4 cents par jour de process.
Haiku 5.5 vise exactement ce terrain : résumés, classification, compaction, sous-agents, browser use. Le combo qui m'intéresse, c'est Opus ou Sonnet en lead, avec Haiku 5.5 en sous-agent qui fait le sale boulot pour quelques centimes.
La vérité c'est que le marché des petits modèles se joue désormais au centime près. Et la question n'est plus de savoir quel modèle est le plus intelligent, mais lequel est assez bon pour une tâche donnée au prix le plus bas.
Si vous avez déjà migré des workflows dessus, je suis preneur de vos retours.