DeepSeek a publié le 31 juillet 2026 la version officielle de son modèle V4 Flash, sous la désignation technique V4-Flash-0731. La surprise ne vient pas de l’architecture, mais des performances : ce modèle dit « budget » dépasse désormais le propre flagship de DeepSeek sur les neuf benchmarks d’agents publiés par la société.
Pas une nouveauté architecturale, mais un réentraînement
Le V4 Flash 0731 conserve la même structure que sa version Preview : 284 milliards de paramètres au total, dont seulement 13 milliards actifs par token grâce à l’architecture MoE (Mixture of Experts). Fenêtre de contexte d’un million de tokens. Licence MIT, ce qui permet l’hébergement en propre. Ce qui a changé, c’est uniquement le post-entraînement, la phase qui façonne le comportement du modèle sans modifier ses paramètres de base.
DeepSeek a appliqué un nouvel apprentissage par renforcement avec des récompenses vérifiables (RLVR) : le modèle tente des tâches de codage multi-étapes, le code est exécuté, les tests passent ou échouent, et le modèle est ajusté en conséquence. C’est cette technique, utilisée intensivement, qui explique l’écart de performances.
Des chiffres qui font parler
Sur Terminal Bench 2.1, benchmark de référence pour les tâches de codage agentique, V4 Flash 0731 obtient 82,7. En comparaison, la version Preview du même modèle plafonnait à 61,8, et le V4-Pro-Preview, le modèle flagship à 1 600 milliards de paramètres, n’atteint que 72,1. Le modèle budget devance donc le Pro sur la tâche pour laquelle ce dernier était censé exceller.
Plus frappant encore : sur DeepSWE, benchmark spécialement conçu pour évaluer la résolution réelle de tickets GitHub, le score passe de 7,3 dans la preview à 54,4 dans la version officielle. Soit une hausse de 645 %. Cette progression n’est pas due à un modèle plus grand ou plus puissant en calcul, mais uniquement à la qualité du post-entraînement.
Ce que cela signifie pour les développeurs
La transition est transparente pour les utilisateurs de l’API : le nom du endpoint reste « deepseek-v4-flash », et aucune modification de code n’est requise. Le prix ne change pas non plus : 0,14 dollar par million de tokens en entrée, 0,28 dollar par million de tokens en sortie.
Pour les équipes qui construisent des agents IA, c’est un signal fort. Obtenir des performances supérieures au flagship, au même prix, avec un modèle plus léger et plus rapide à inférer, change le calcul économique de nombreux projets. Concrètement, des pipelines d’automatisation codé, de revue de PRs ou de résolution de bugs peuvent tourner sur V4 Flash à moindre coût avec de meilleurs résultats que sur le Pro.
Une nuance importante : les benchmarks cités sont ceux de DeepSeek elle-même, sur son propre harness d’évaluation. Les poids du modèle V4 Flash ne sont pas encore disponibles sur Hugging Face, ce qui empêche des évaluations indépendantes. La vérification communautaire reste donc à venir. Mais si les chiffres se confirment, ce réentraînement marque un tournant dans la compréhension de ce que le post-entraînement peut apporter aux modèles existants.