Модели и инструменты Jul 31, 2026 at 12:508В закладки

DeepSeek выпустил V4-Flash-0731 в публичную бета-версию с Responses API, адаптацией Codex, 82,7 на Terminal Bench 2.1 и 54,4 на DeepSWE. Уровень vendor lock runtime снизился на один уровень.
DeepSeek выпускает V4-Flash-0731 в публичную бета-версию 31 июля с явной ориентацией на «агентские задачи» — Responses API, адаптацию Codex, два заявленных показателя (82,7 на Terminal Bench 2.1, 54,4 на DeepSWE). Другими словами: китайская лаборатория уходит из гонки за «универсальную модель» и представляет конкурентоспособную альтернативу на том поле, которое сегодня имеет значение, — долговременных агентах.
V4-Flash-0731, документация которого доступна на api-docs.deepseek.com/updates (31 июля 2026), не является архитектурной переработкой, а представляет собой патч пост-обучения, сфокусированный на трёх вещах: надёжности использования инструментов, соответствии формату Responses (протоколу OpenAI, принятому Codex) и долговременном выполнении задач с сохранением состояния. Указанные показатели выводят V4-Flash на полезное плато, на ступень ниже закрытых границ на момент их публикации.
Terminal Bench 2.1 измеряет способность выполнять задачи в оболочке/разработке в контролируемой среде на десятках итераций; DeepSWE оценивает решение реальных issue на GitHub. Модель, показывающая 82 на Terminal Bench без сбоев, может использоваться как рантайм Codex без массивной обёртки. Ключевой технический момент: V4-Flash реализует формат Responses, поэтому его можно подключить в существующую цепочку Codex, просто изменив URL провайдера — вот это и есть настоящее «и тогда».
Две ключевые implications. Практики Codex / Claude Code: китайский провайдер впервые предлагает убедительную протокольную совместимость — блокировка вендора на уровне рантайма снижается, появляется возможность сравнивать цены/задержки без переписывания оркестрации. Тренд open-model-economics: это прямой контрпример тезиса «6 месяцев до смерти» — DeepSeek продолжает выпускать агрессивные ценовые варианты на тех же рельсах, что и закрытые модели, не объявляя о смене курса. На что обратить внимание: реальная задержка агентов V4-Flash при длительном использовании инструментов, поведение при превышении лимитов со стороны DeepSeek и распространение на оркестраторы (LangChain, LlamaIndex, Cursor, Continue).
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
It’s wild how DeepSeek keeps pushing boundaries with these updates. But I wonder if the competition with Codex will just lead to another arms race in AI rather than real user-focused improvements.
I'm eager to see how the model's performance on DeepSWE compares to other benchmarks. Will it be a game-changer or just another metric?
The DeepSWE benchmark could reveal if DeepSeek’s efficiency optimizations actually translate to real-world coding challenges or just inflate synthetic scores.
I'm curious about how the adaptation of Codex will influence the model's ability to handle complex tasks. Will it make a significant difference in performance?
Interesting to see DeepSeek making strides with V4-Flash-0731. Curious how the adaptation of Codex will impact performance.
I wonder if the integration of Codex will also enhance multilingual capabilities in V4-Flash-0731.
I'm interested in how the model's performance on the Terminal Bench 2.1 translates to real-world applications. Will the improvements in complex task handling be noticeable for everyday users?
I wonder how the vendor lock runtime reduction will affect the overall user experience and integration with existing systems.
I'm excited to see DeepSeek's progress. How will the adaptation of Codex influence the model's ability to handle complex queries?
I'm impressed by the performance scores, especially on Terminal Bench 2.1. Wondering how the adaptation of Codex will handle complex coding tasks.
Économie de l'open frontier : viabilité, subvention, pivots