DeepSeek V4-Flash-0731 in öffentlicher Beta: Das Codex-Protokoll kommt zum chinesischen Rivalen

Fortlaufende Berichterstattung : Économie de l'open frontier : viabilité, subvention, pivots· Teil 12/13

Modelle & WerkzeugeNur für Abonnenten 23 min ago7Zu Lesezeichen hinzufügen

DeepSeek V4-Flash-0731 in öffentlicher Beta: Das Codex-Protokoll kommt zum chinesischen Rivalen
Illustration : Léa Fontaine

DeepSeek veröffentlicht V4-Flash-0731 in der öffentlichen Beta mit Responses API, Codex-Anpassung, 82,7 auf Terminal Bench 2.1 und 54,4 auf DeepSWE. Die Vendor-Lock-Runtime sinkt um einen Schritt.

In einfachen Worten

DeepSeek veröffentlicht V4-Flash-0731 am 31. Juli als öffentliche Beta mit dem klaren Fokus auf "Agentenaufgaben" - Responses API, Codex-Anpassung, zwei angekündigte Scores (82,7 auf Terminal Bench 2.1, 54,4 auf DeepSWE). Mit anderen Worten: Das chinesische Labor verlässt das Rennen um das "Allgemeine Modell" und liefert eine wettbewerbsfähige Variante für das, was heute zählt, den Agenten in der Schleife.

Was sich wirklich ändert

V4-Flash-0731, dokumentiert unter api-docs.deepseek.com/updates (31. Juli 2026), ist keine architektonische Überarbeitung, sondern ein Post-Training-Patch, der sich auf drei Dinge konzentriert: die Robustheit des Tool-Uses, die Konformität mit dem Responses-Format (das von OpenAI adoptierte Protokoll) und die langfristige Ausführung mit Zustand. Die angezeigten Scores platzieren V4-Flash auf einem nützlichen Niveau, einen Schritt unter den geschlossenen Grenzen zum Zeitpunkt ihrer jeweiligen Bekanntgabe.

Unter der Haube

Terminal Bench 2.1 misst die Fähigkeit, Shell-/Dev-Aufgaben in einer kontrollierten Umgebung über mehrere Runden auszuführen; DeepSWE misst die Lösung echter GitHub-Issues. Ein Modell, das 82 auf Terminal Bench erreicht, ohne aus der Bahn zu geraten, ist als Codex-Runtime ohne massiven Wrapper verwendbar. Der entscheidende technische Punkt: V4-Flash implementiert das Responses-Format, sodass es in eine bestehende Codex-Kette eingesteckt werden kann, indem einfach die URL des Anbieters geändert wird - das ist das echte "Und was nun".

Und was jetzt?

Zwei Implikationen. Codex-/Claude-Code-Praktiker: Ein chinesischer Anbieter bietet erstmals eine glaubwürdige protokollarische Kompatibilität - die Vendor-Lock-in-Seite der Runtime sinkt, die Preis-/Latenz-Arbitrage wird ohne Neuschreibung der Orchestrierung möglich. Open-Model-Economics-Thread: Dies ist das direkte Gegenbeispiel zur These "6 Monate Lebensdauer" - DeepSeek bringt weiterhin aggressive Preisvarianten auf den Markt, die auf denselben Schienen wie die geschlossenen Grenzen laufen, ohne einen Pivot anzukündigen. Zu beobachten: Die tatsächliche Latenz der V4-Flash-Agenten beim verlängerten Tool-Use, das Verhalten bei Rate-Limiting auf Seiten von DeepSeek und die Ausbreitung auf die Orchestratoren (LangChain, LlamaIndex, Cursor, Continue).

Inhalt Mitgliedern vorbehalten

Erstellen Sie ein kostenloses Konto, um auf alle unsere Inhalte und die Wochenrevue zuzugreifen.

Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.

Unsere Redaktion
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
War dieser Artikel hilfreich?

8 Personen gefiel dieser Artikel

Gefällt mir
P
Priya RamanML-Ingenieur
🇩🇪 ML-Ingenieur, angewandte Forschung.
Teilen:
Kommentare (7)

Melden Sie sich an, um an der Diskussion teilzunehmen.

Dr. L. 31 Jul 2026 · 09:14

I'm eager to see how the model's performance on DeepSWE compares to other benchmarks. Will it be a game-changer or just another metric?

Emma_London 31 Jul 2026 · 08:41

I'm curious about how the adaptation of Codex will influence the model's ability to handle complex tasks. Will it make a significant difference in performance?

Dr. Emily 31 Jul 2026 · 08:32

Interesting to see DeepSeek making strides with V4-Flash-0731. Curious how the adaptation of Codex will impact performance.

FoodieChicago 31 Jul 2026 · 11:02

I wonder if the integration of Codex will also enhance multilingual capabilities in V4-Flash-0731.

LitLover42 31 Jul 2026 · 08:21

I'm interested in how the model's performance on the Terminal Bench 2.1 translates to real-world applications. Will the improvements in complex task handling be noticeable for everyday users?

le_sceptique 31 Jul 2026 · 08:20

I wonder how the vendor lock runtime reduction will affect the overall user experience and integration with existing systems.

Alex 31 Jul 2026 · 08:10

I'm excited to see DeepSeek's progress. How will the adaptation of Codex influence the model's ability to handle complex queries?

TravelTom 31 Jul 2026 · 08:07

I'm impressed by the performance scores, especially on Terminal Bench 2.1. Wondering how the adaptation of Codex will handle complex coding tasks.

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Themen
Erkunden
Informationen