Modelos y Herramientas Jul 31, 2026 at 12:508Añadir a favoritos

DeepSeek lanza V4-Flash-0731 en beta pública con Responses API, adaptación Codex, 82,7 en Terminal Bench 2.1 y 54,4 en DeepSWE. El bloqueo de proveedor en tiempo de ejecución se reduce en un nivel.
DeepSeek lanza V4-Flash-0731 en beta pública el 31 de julio, con un encuadre explícito de "tareas de agente" - API de Respuestas, adaptación a Codex, dos puntuaciones anunciadas (82,7 en Terminal Bench 2.1, 54,4 en DeepSWE). En otras palabras: el laboratorio chino abandona la carrera del "modelo general" y entrega una variante competitiva en el terreno que hoy importa, el agente en bucle.
V4-Flash-0731, documentado en api-docs.deepseek.com/updates (31 de julio de 2026), no es una refactorización arquitectónica, sino un parche de post-entrenamiento centrado en tres aspectos: la robustez en el uso de herramientas, la conformidad con el formato Respuestas (el protocolo de OpenAI adoptado por Codex) y la ejecución prolongada con estado. Las puntuaciones mostradas sitúan a V4-Flash en una meseta útil, un escalón por debajo de los modelos cerrados en sus respectivas fechas de comunicación.
Terminal Bench 2.1 mide la capacidad para ejecutar tareas en shell/dev en un entorno controlado durante decenas de turnos; DeepSWE evalúa la resolución de issues reales de GitHub. Un modelo que alcanza 82 en Terminal Bench sin fallar es utilizable como runtime de Codex sin necesidad de un wrapper masivo. El detalle técnico decisivo: V4-Flash implementa el formato Respuestas, por lo que se integra en una cadena de Codex existente cambiando solo la URL del proveedor. Esto es el verdadero "y entonces".
Dos implicaciones. Practicantes de Codex / Claude Code: un proveedor chino ofrece por primera vez una compatibilidad protocolar creíble: el bloqueo al proveedor en tiempo de ejecución disminuye y la arbitraje precio/latencia se vuelve posible sin reescribir la orquestación. Hilo de economía de modelos abiertos: este es el contraejemplo directo de la tesis "6 meses de vida". DeepSeek sigue lanzando variantes tarifarias agresivas sobre los mismos cimientos que los modelos cerrados, sin anunciar un cambio de rumbo. A vigilar: latencia real de los agentes V4-Flash en uso prolongado de herramientas, comportamiento ante límites de tasa (rate-limit) en DeepSeek y propagación a los orquestadores (LangChain, LlamaIndex, Cursor, Continue).
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
It’s wild how DeepSeek keeps pushing boundaries with these updates. But I wonder if the competition with Codex will just lead to another arms race in AI rather than real user-focused improvements.
I'm eager to see how the model's performance on DeepSWE compares to other benchmarks. Will it be a game-changer or just another metric?
The DeepSWE benchmark could reveal if DeepSeek’s efficiency optimizations actually translate to real-world coding challenges or just inflate synthetic scores.
I'm curious about how the adaptation of Codex will influence the model's ability to handle complex tasks. Will it make a significant difference in performance?
Interesting to see DeepSeek making strides with V4-Flash-0731. Curious how the adaptation of Codex will impact performance.
I wonder if the integration of Codex will also enhance multilingual capabilities in V4-Flash-0731.
I'm interested in how the model's performance on the Terminal Bench 2.1 translates to real-world applications. Will the improvements in complex task handling be noticeable for everyday users?
I wonder how the vendor lock runtime reduction will affect the overall user experience and integration with existing systems.
I'm excited to see DeepSeek's progress. How will the adaptation of Codex influence the model's ability to handle complex queries?
I'm impressed by the performance scores, especially on Terminal Bench 2.1. Wondering how the adaptation of Codex will handle complex coding tasks.
Économie de l'open frontier : viabilité, subvention, pivots