DeepSeek sort un modèle "léger" de 552B paramètres, affirme qu'il bat son propre flagship et redirige d'office le trafic Pro dessus. Sur le papier, c'est un coup de maître.
Reste à regarder la facture par tâche.
Qu'est-ce que DeepSeek annonce vraiment ?
Le 10 septembre, DeepSeek a publié V4.1-Flash, premier modèle de sa nouvelle famille d'architecture.
Les chiffres clés :
- MoE de 552B paramètres, avec une architecture Causal Encoder-Decoder : 8B actifs en entrée, 16B en sortie
- multimodal natif (texte + image), contexte de 1M tokens
- KV cache réduit à 1/4 de la HBM et 1/8 du stockage SSD par rapport à la génération précédente
- poids publiés sous licence MIT sur Hugging Face
- baisse des prix API, avec des heures creuses facturées 50 % du tarif plein
Le point le plus intéressant n'est pas le benchmark. C'est le KV cache.
Car sur un agent qui tourne longtemps, ce sont les cache hits qui font gonfler la note. DeepSeek l'écrit d'ailleurs noir sur blanc, et toute l'architecture est pensée pour ça.
Mais où est passé le Pro ?
Depuis le 14 septembre, toutes les requêtes envoyées à deepseek-v4-pro sont routées vers V4.1-Flash, au tarif Flash, jusqu'à la sortie d'un futur V4.1-Pro.
Même chose pour V4-Flash, retiré, dont l'alias pointe désormais sur le nouveau modèle.
Donc si vous appeliez le Pro en production, vous avez changé de modèle sans toucher une ligne de code.
Moins cher, certes. Mais un swap silencieux reste un swap silencieux : vos prompts, vos parsers et vos évals ont été calibrés sur autre chose.
Et l'argument "Flash fait mieux que Pro" repose sur les tests de DeepSeek et de "multiple parties" jamais nommées.
Côté mesure indépendante, Artificial Analysis donne :
- 40 sur son Intelligence Index en effort max (35 pour V4-Flash), là où la médiane de sa catégorie est à 18
- environ 208 tokens/s en sortie, donc rapide
- 250M tokens générés pour passer l'index, contre une médiane à 140M
Ce dernier chiffre, c'est celui que je regarde en premier.
Un modèle bavard, c'est un prix au token qui ment. Ce qui compte, c'est ce que coûte une tâche de bout en bout, et Artificial Analysis le classe correct sur ce critère, sans plus.
KDnuggets arrive à la même conclusion après l'avoir testé : pas le meilleur en intelligence brute ni en coût, mais nettement devant sur la vitesse.
Donc, pour qui ?
Je ne vais pas vous parler de benchmarks, je vais vous parler de ma facture.
J'ai des services en ligne qui tournent déjà sur V4.1-Flash. Avant, ils tournaient sur Sonnet 5.
- avec Sonnet 5 : environ 0,30 $ par jour de process
- avec V4.1-Flash : environ 0,04 $ par jour
Soit à peu près 7,5 fois moins cher.
Le bavardage relevé par Artificial Analysis ? Il existe. Mais face à un tel écart de prix, il ne pèse rien.
C'est exactement pour ça que je martèle le coût par tâche plutôt que le coût au token : le seul chiffre qui compte, c'est celui qui tombe en fin de mois.
Donc pour les workloads agentiques et les process qui tournent en continu, V4.1-Flash est aujourd'hui difficile à battre.
Pour le self-hosting en revanche, calmez-vous tout de suite.
8B actifs ne veut pas dire que ça tient sur votre machine : il faut quand même stocker 552B de backbone, plus 196B de mémoire Engram. La recette vLLM vise des H100, B200 et MI350X, pas un homelab.
Petit warning toutefois sur le fait que Deepseek n'ait demandé l'avis de personne pour remplacer le model en background quand on requête le model pro. Cette action pose des interrogations quand à la fiabilité de ce dernier sur des tâches critiques.