Modelos e Ferramentas Jul 31, 2026 at 12:508Adicionar aos favoritos

DeepSeek lança V4-Flash-0731 em beta pública com Responses API, adaptação Codex, 82,7 no Terminal Bench 2.1 e 54,4 no DeepSWE. O bloqueio de fornecedor do runtime diminui um nível.
DeepSeek lança o V4-Flash-0731 em beta pública em 31 de julho, com um
O V4-Flash-0731, documentado em
O Terminal Bench 2.1 mede a capacidade de executar tarefas shell/dev em ambiente controlado ao longo de dezenas de turnos; o DeepSWE mede a resolução de issues reais do GitHub. Um modelo que atinge 82 no Terminal Bench sem travar é utilizável como runtime Codex sem wrapper massivo. O ponto técnico decisivo: o V4-Flash implementa o formato Responses, portanto, ele se integra a uma cadeia Codex existente alterando apenas a URL do provedor — esse é o verdadeiro "e daí".
Duas implicações. Praticantes de Codex / Claude Code: um provedor chinês oferece, pela primeira vez, compatibilidade protocolar crível — o vendor lock no runtime diminui, a arbitragem preço/latência torna-se possível sem reescrever a orquestração. Fio da economia de modelos abertos: este é o contraexemplo direto da tese "6 meses para morrer" — a DeepSeek continua lançando variantes tarifárias agressivas nos mesmos trilhos das fronteiras fechadas, sem anunciar um pivô. A se observar: latência real dos agentes V4-Flash em uso prolongado de ferramentas, comportamento em caso de rate-limit do lado da DeepSeek e propagação aos orquestradores (LangChain, LlamaIndex, Cursor, Continue).
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.
Inicie sessão para se juntar à discussão.
It’s wild how DeepSeek keeps pushing boundaries with these updates. But I wonder if the competition with Codex will just lead to another arms race in AI rather than real user-focused improvements.
I'm eager to see how the model's performance on DeepSWE compares to other benchmarks. Will it be a game-changer or just another metric?
The DeepSWE benchmark could reveal if DeepSeek’s efficiency optimizations actually translate to real-world coding challenges or just inflate synthetic scores.
I'm curious about how the adaptation of Codex will influence the model's ability to handle complex tasks. Will it make a significant difference in performance?
Interesting to see DeepSeek making strides with V4-Flash-0731. Curious how the adaptation of Codex will impact performance.
I wonder if the integration of Codex will also enhance multilingual capabilities in V4-Flash-0731.
I'm interested in how the model's performance on the Terminal Bench 2.1 translates to real-world applications. Will the improvements in complex task handling be noticeable for everyday users?
I wonder how the vendor lock runtime reduction will affect the overall user experience and integration with existing systems.
I'm excited to see DeepSeek's progress. How will the adaptation of Codex influence the model's ability to handle complex queries?
I'm impressed by the performance scores, especially on Terminal Bench 2.1. Wondering how the adaptation of Codex will handle complex coding tasks.
Économie de l'open frontier : viabilité, subvention, pivots