Chargement…

DeepSeek V4.1-Flash: petit mais fort

DeepSeek V4.1-Flash: petit mais fort

DeepSeek sort un modèle "léger" de 552B paramètres, affirme qu'il bat son propre flagship et redirige d'office le trafic Pro dessus. Sur le papier, c'est un coup de maître.

Reste à regarder la facture par tâche.

Qu'est-ce que DeepSeek annonce vraiment ?

Le 10 septembre, DeepSeek a publié V4.1-Flash, premier modèle de sa nouvelle famille d'architecture.

Les chiffres clés :

  • MoE de 552B paramètres, avec une architecture Causal Encoder-Decoder : 8B actifs en entrée, 16B en sortie
  • multimodal natif (texte + image), contexte de 1M tokens
  • KV cache réduit à 1/4 de la HBM et 1/8 du stockage SSD par rapport à la génération précédente
  • poids publiés sous licence MIT sur Hugging Face
  • baisse des prix API, avec des heures creuses facturées 50 % du tarif plein

Le point le plus intéressant n'est pas le benchmark. C'est le KV cache.

Car sur un agent qui tourne longtemps, ce sont les cache hits qui font gonfler la note. DeepSeek l'écrit d'ailleurs noir sur blanc, et toute l'architecture est pensée pour ça.

Mais où est passé le Pro ?

Depuis le 14 septembre, toutes les requêtes envoyées à deepseek-v4-pro sont routées vers V4.1-Flash, au tarif Flash, jusqu'à la sortie d'un futur V4.1-Pro.

Même chose pour V4-Flash, retiré, dont l'alias pointe désormais sur le nouveau modèle.

Donc si vous appeliez le Pro en production, vous avez changé de modèle sans toucher une ligne de code.

Moins cher, certes. Mais un swap silencieux reste un swap silencieux : vos prompts, vos parsers et vos évals ont été calibrés sur autre chose.

Et l'argument "Flash fait mieux que Pro" repose sur les tests de DeepSeek et de "multiple parties" jamais nommées.

Côté mesure indépendante, Artificial Analysis donne :

  • 40 sur son Intelligence Index en effort max (35 pour V4-Flash), là où la médiane de sa catégorie est à 18
  • environ 208 tokens/s en sortie, donc rapide
  • 250M tokens générés pour passer l'index, contre une médiane à 140M

Ce dernier chiffre, c'est celui que je regarde en premier.

Un modèle bavard, c'est un prix au token qui ment. Ce qui compte, c'est ce que coûte une tâche de bout en bout, et Artificial Analysis le classe correct sur ce critère, sans plus.

KDnuggets arrive à la même conclusion après l'avoir testé : pas le meilleur en intelligence brute ni en coût, mais nettement devant sur la vitesse.

Donc, pour qui ?

Je ne vais pas vous parler de benchmarks, je vais vous parler de ma facture.

J'ai des services en ligne qui tournent déjà sur V4.1-Flash. Avant, ils tournaient sur Sonnet 5.

  • avec Sonnet 5 : environ 0,30 $ par jour de process
  • avec V4.1-Flash : environ 0,04 $ par jour

Soit à peu près 7,5 fois moins cher.

Le bavardage relevé par Artificial Analysis ? Il existe. Mais face à un tel écart de prix, il ne pèse rien.

C'est exactement pour ça que je martèle le coût par tâche plutôt que le coût au token : le seul chiffre qui compte, c'est celui qui tombe en fin de mois.

Donc pour les workloads agentiques et les process qui tournent en continu, V4.1-Flash est aujourd'hui difficile à battre.

Pour le self-hosting en revanche, calmez-vous tout de suite.

8B actifs ne veut pas dire que ça tient sur votre machine : il faut quand même stocker 552B de backbone, plus 196B de mémoire Engram. La recette vLLM vise des H100, B200 et MI350X, pas un homelab.

Petit warning toutefois sur le fait que Deepseek n'ait demandé l'avis de personne pour remplacer le model en background quand on requête le model pro. Cette action pose des interrogations quand à la fiabilité de ce dernier sur des tâches critiques.

FAQ

Pourquoi le KV cache est-il si important dans cette annonce ?

Parce que sur des agents qui tournent en continu, ce sont les cache hits répétés qui font grimper la facture, pas le prix au token affiché. En le réduisant à 1/4 de la HBM et 1/8 du stockage SSD, DeepSeek attaque directement le vrai poste de coût des workloads agentiques.

Que se passe-t-il concrètement si j'utilisais deepseek-v4-pro en production ?

Depuis le 14 septembre, vos requêtes sont automatiquement redirigées vers V4.1-Flash au tarif Flash, sans changement de code de votre part. Le risque, c'est que vos prompts, parsers et évals aient été calibrés sur un modèle qui n'est plus celui qui répond réellement.

Peut-on faire confiance aux benchmarks qui annoncent que Flash bat Pro ?

Avec prudence, car ces chiffres viennent surtout de DeepSeek et de parties tierces non identifiées. Les mesures indépendantes comme Artificial Analysis confirment de bonnes performances et une vitesse élevée, mais situent le modèle dans la moyenne côté coût réel par tâche, notamment parce qu'il génère plus de tokens que la médiane pour atteindre son score.

Est-ce que V4.1-Flash est vraiment plus rentable à l'usage ?

Sur des process qui tournent en continu, l'écart observé est net, avec un coût journalier environ 7,5 fois inférieur à celui de Sonnet 5 dans un cas réel testé. Le bavardage relevé par les benchmarks existe bien, mais il devient négligeable face à un tel écart de prix final.

Puis-je faire tourner ce modèle chez moi en self-hosting ?

Non, malgré les 8B de paramètres actifs, il faut stocker l'ensemble du backbone de 552B plus 196B de mémoire Engram. La configuration recommandée vise des GPU type H100, B200 ou MI350X, pas une machine personnelle ou un homelab.

Ce changement de modèle sans préavis pose-t-il un problème pour des usages critiques ?

Oui, remplacer silencieusement le modèle appelé en production sans consultation des utilisateurs interroge sur la fiabilité de DeepSeek pour des tâches sensibles. Cela justifie de revérifier ses évals et son monitoring dès qu'un fournisseur pratique ce type de bascule automatique.


Poursuivre la lecture

IBM veut réduire la consommation de token News
#ia#consommation de tokens#llm

IBM veut réduire la consommation de token

IBM confronte ALTK-Evolve à ACE sur AppWorld pour repenser la mémoire des agents IA et son coût réel en tokens : la méthodologie du comparatif mérite qu'on s'y attarde.

Alexandre P.
La fin du goulot sur les LLMs ? News
#llm#subquadratic#ia

La fin du goulot sur les LLMs ?

Une startup de Miami prétend avoir résolu le goulot quadratique qui freine les LLM depuis 2017. Des tests tiers viennent de tomber, mais les experts restent partagés.

Alexandre P.