DeepSeek V4-Flash-0731 en beta pública: el protocolo Codex llega al rival chino

Seguimiento del caso : Économie de l'open frontier : viabilité, subvention, pivots· Episodio 12/13

Modelos y Herramientas Jul 31, 2026 at 12:508Añadir a favoritos

DeepSeek V4-Flash-0731 en beta pública: el protocolo Codex llega al rival chino
Ilustración : Léa Fontaine

DeepSeek lanza V4-Flash-0731 en beta pública con Responses API, adaptación Codex, 82,7 en Terminal Bench 2.1 y 54,4 en DeepSWE. El bloqueo de proveedor en tiempo de ejecución se reduce en un nivel.

En términos simples

DeepSeek lanza V4-Flash-0731 en beta pública el 31 de julio, con un encuadre explícito de "tareas de agente" - API de Respuestas, adaptación a Codex, dos puntuaciones anunciadas (82,7 en Terminal Bench 2.1, 54,4 en DeepSWE). En otras palabras: el laboratorio chino abandona la carrera del "modelo general" y entrega una variante competitiva en el terreno que hoy importa, el agente en bucle.

Lo que realmente cambia

V4-Flash-0731, documentado en api-docs.deepseek.com/updates (31 de julio de 2026), no es una refactorización arquitectónica, sino un parche de post-entrenamiento centrado en tres aspectos: la robustez en el uso de herramientas, la conformidad con el formato Respuestas (el protocolo de OpenAI adoptado por Codex) y la ejecución prolongada con estado. Las puntuaciones mostradas sitúan a V4-Flash en una meseta útil, un escalón por debajo de los modelos cerrados en sus respectivas fechas de comunicación.

Bajo el capó

Terminal Bench 2.1 mide la capacidad para ejecutar tareas en shell/dev en un entorno controlado durante decenas de turnos; DeepSWE evalúa la resolución de issues reales de GitHub. Un modelo que alcanza 82 en Terminal Bench sin fallar es utilizable como runtime de Codex sin necesidad de un wrapper masivo. El detalle técnico decisivo: V4-Flash implementa el formato Respuestas, por lo que se integra en una cadena de Codex existente cambiando solo la URL del proveedor. Esto es el verdadero "y entonces".

Entonces, ¿qué?

Dos implicaciones. Practicantes de Codex / Claude Code: un proveedor chino ofrece por primera vez una compatibilidad protocolar creíble: el bloqueo al proveedor en tiempo de ejecución disminuye y la arbitraje precio/latencia se vuelve posible sin reescribir la orquestación. Hilo de economía de modelos abiertos: este es el contraejemplo directo de la tesis "6 meses de vida". DeepSeek sigue lanzando variantes tarifarias agresivas sobre los mismos cimientos que los modelos cerrados, sin anunciar un cambio de rumbo. A vigilar: latencia real de los agentes V4-Flash en uso prolongado de herramientas, comportamiento ante límites de tasa (rate-limit) en DeepSeek y propagación a los orquestadores (LangChain, LlamaIndex, Cursor, Continue).

Resources

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

12 personas han valorado este artículo

Me gusta
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Compartir:
Comentarios (8)

Inicia sesión para unirte a la conversación.

FoodieFiona 01 Aug 2026 · 05:41

It’s wild how DeepSeek keeps pushing boundaries with these updates. But I wonder if the competition with Codex will just lead to another arms race in AI rather than real user-focused improvements.

Dr. L. 31 Jul 2026 · 09:14

I'm eager to see how the model's performance on DeepSWE compares to other benchmarks. Will it be a game-changer or just another metric?

FilmBuffNYC 31 Jul 2026 · 14:34

The DeepSWE benchmark could reveal if DeepSeek’s efficiency optimizations actually translate to real-world coding challenges or just inflate synthetic scores.

Emma_London 31 Jul 2026 · 08:41

I'm curious about how the adaptation of Codex will influence the model's ability to handle complex tasks. Will it make a significant difference in performance?

Dr. Emily 31 Jul 2026 · 08:32

Interesting to see DeepSeek making strides with V4-Flash-0731. Curious how the adaptation of Codex will impact performance.

FoodieChicago 31 Jul 2026 · 11:02

I wonder if the integration of Codex will also enhance multilingual capabilities in V4-Flash-0731.

LitLover42 31 Jul 2026 · 08:21

I'm interested in how the model's performance on the Terminal Bench 2.1 translates to real-world applications. Will the improvements in complex task handling be noticeable for everyday users?

le_sceptique 31 Jul 2026 · 08:20

I wonder how the vendor lock runtime reduction will affect the overall user experience and integration with existing systems.

Alex 31 Jul 2026 · 08:10

I'm excited to see DeepSeek's progress. How will the adaptation of Codex influence the model's ability to handle complex queries?

TravelTom 31 Jul 2026 · 08:07

I'm impressed by the performance scores, especially on Terminal Bench 2.1. Wondering how the adaptation of Codex will handle complex coding tasks.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información