Models & ToolsRéservé aux abonnés il y a 24 min7Ajouter aux favoris

DeepSeek pousse V4-Flash-0731 en beta publique avec Responses API, adaptation Codex, 82,7 sur Terminal Bench 2.1 et 54,4 sur DeepSWE. Le vendor lock runtime baisse d'un cran.
DeepSeek pousse V4-Flash-0731 en beta publique le 31 juillet, avec un cadrage explicite « agent tasks » - Responses API, adaptation Codex, deux scores annoncés (82,7 sur Terminal Bench 2.1, 54,4 sur DeepSWE). Autrement dit : le laboratoire chinois quitte la course au « modèle général » et livre une variante compétitive sur le terrain qui compte aujourd'hui, l'agent en boucle.
V4-Flash-0731, documenté sur api-docs.deepseek.com/updates (31 juillet 2026), n'est pas une refonte architecturale mais un patch de post-training centré sur trois choses : la robustesse tool-use, la conformité au format Responses (le protocole OpenAI adopté par Codex), et l'exécution longue avec état. Les scores affichés placent V4-Flash sur un plateau utile, un cran sous les frontières fermées à leur date de communication respective.
Terminal Bench 2.1 mesure la capacité à exécuter des tâches shell/dev en environnement contrôlé sur des dizaines de tours ; DeepSWE mesure la résolution d'issues GitHub réelles. Un modèle qui tient 82 sur Terminal Bench sans dérailler est utilisable comme runtime Codex sans wrapper massif. Le point technique décisif : V4-Flash implémente le format Responses, donc il se plug dans une chaîne Codex existante en changeant l'URL du provider - c'est le vrai « et alors ».
Deux implications. Praticien Codex / Claude Code : un provider chinois offre pour la première fois une compatibilité protocolaire crédible - le vendor lock côté runtime baisse, l'arbitrage prix/latence devient possible sans réécrire l'orchestration. Fil open-model-economics : c'est le contre-exemple direct de la thèse « 6 months to live » - DeepSeek continue à sortir des variantes tarifaires agressives sur les mêmes rails que les frontières fermées, sans annoncer de pivot. À surveiller : latence réelle des agents V4-Flash en tool-use prolongé, comportement en cas de rate-limit côté DeepSeek, et propagation aux orchestrateurs (LangChain, LlamaIndex, Cursor, Continue).
Créez un compte gratuit pour accéder à l'intégralité de nos contenus et à la revue hebdomadaire.
Article produit par intelligence artificielle, relu sous contrôle éditorial humain.
Connectez-vous pour rejoindre la discussion.
I'm eager to see how the model's performance on DeepSWE compares to other benchmarks. Will it be a game-changer or just another metric?
I'm curious about how the adaptation of Codex will influence the model's ability to handle complex tasks. Will it make a significant difference in performance?
Interesting to see DeepSeek making strides with V4-Flash-0731. Curious how the adaptation of Codex will impact performance.
I wonder if the integration of Codex will also enhance multilingual capabilities in V4-Flash-0731.
I'm interested in how the model's performance on the Terminal Bench 2.1 translates to real-world applications. Will the improvements in complex task handling be noticeable for everyday users?
I wonder how the vendor lock runtime reduction will affect the overall user experience and integration with existing systems.
I'm excited to see DeepSeek's progress. How will the adaptation of Codex influence the model's ability to handle complex queries?
I'm impressed by the performance scores, especially on Terminal Bench 2.1. Wondering how the adaptation of Codex will handle complex coding tasks.
Économie de l'open frontier : viabilité, subvention, pivots