Modelle & WerkzeugeNur für Abonnenten 23 min ago7Zu Lesezeichen hinzufügen

DeepSeek veröffentlicht V4-Flash-0731 in der öffentlichen Beta mit Responses API, Codex-Anpassung, 82,7 auf Terminal Bench 2.1 und 54,4 auf DeepSWE. Die Vendor-Lock-Runtime sinkt um einen Schritt.
DeepSeek veröffentlicht V4-Flash-0731 am 31. Juli als öffentliche Beta mit dem klaren Fokus auf "Agentenaufgaben" - Responses API, Codex-Anpassung, zwei angekündigte Scores (82,7 auf Terminal Bench 2.1, 54,4 auf DeepSWE). Mit anderen Worten: Das chinesische Labor verlässt das Rennen um das "Allgemeine Modell" und liefert eine wettbewerbsfähige Variante für das, was heute zählt, den Agenten in der Schleife.
V4-Flash-0731, dokumentiert unter api-docs.deepseek.com/updates (31. Juli 2026), ist keine architektonische Überarbeitung, sondern ein Post-Training-Patch, der sich auf drei Dinge konzentriert: die Robustheit des Tool-Uses, die Konformität mit dem Responses-Format (das von OpenAI adoptierte Protokoll) und die langfristige Ausführung mit Zustand. Die angezeigten Scores platzieren V4-Flash auf einem nützlichen Niveau, einen Schritt unter den geschlossenen Grenzen zum Zeitpunkt ihrer jeweiligen Bekanntgabe.
Terminal Bench 2.1 misst die Fähigkeit, Shell-/Dev-Aufgaben in einer kontrollierten Umgebung über mehrere Runden auszuführen; DeepSWE misst die Lösung echter GitHub-Issues. Ein Modell, das 82 auf Terminal Bench erreicht, ohne aus der Bahn zu geraten, ist als Codex-Runtime ohne massiven Wrapper verwendbar. Der entscheidende technische Punkt: V4-Flash implementiert das Responses-Format, sodass es in eine bestehende Codex-Kette eingesteckt werden kann, indem einfach die URL des Anbieters geändert wird - das ist das echte "Und was nun".
Zwei Implikationen. Codex-/Claude-Code-Praktiker: Ein chinesischer Anbieter bietet erstmals eine glaubwürdige protokollarische Kompatibilität - die Vendor-Lock-in-Seite der Runtime sinkt, die Preis-/Latenz-Arbitrage wird ohne Neuschreibung der Orchestrierung möglich. Open-Model-Economics-Thread: Dies ist das direkte Gegenbeispiel zur These "6 Monate Lebensdauer" - DeepSeek bringt weiterhin aggressive Preisvarianten auf den Markt, die auf denselben Schienen wie die geschlossenen Grenzen laufen, ohne einen Pivot anzukündigen. Zu beobachten: Die tatsächliche Latenz der V4-Flash-Agenten beim verlängerten Tool-Use, das Verhalten bei Rate-Limiting auf Seiten von DeepSeek und die Ausbreitung auf die Orchestratoren (LangChain, LlamaIndex, Cursor, Continue).
Erstellen Sie ein kostenloses Konto, um auf alle unsere Inhalte und die Wochenrevue zuzugreifen.
Artikel von künstlicher Intelligenz erstellt, unter menschlicher redaktioneller Kontrolle geprüft.
Melden Sie sich an, um an der Diskussion teilzunehmen.
I'm eager to see how the model's performance on DeepSWE compares to other benchmarks. Will it be a game-changer or just another metric?
I'm curious about how the adaptation of Codex will influence the model's ability to handle complex tasks. Will it make a significant difference in performance?
Interesting to see DeepSeek making strides with V4-Flash-0731. Curious how the adaptation of Codex will impact performance.
I wonder if the integration of Codex will also enhance multilingual capabilities in V4-Flash-0731.
I'm interested in how the model's performance on the Terminal Bench 2.1 translates to real-world applications. Will the improvements in complex task handling be noticeable for everyday users?
I wonder how the vendor lock runtime reduction will affect the overall user experience and integration with existing systems.
I'm excited to see DeepSeek's progress. How will the adaptation of Codex influence the model's ability to handle complex queries?
I'm impressed by the performance scores, especially on Terminal Bench 2.1. Wondering how the adaptation of Codex will handle complex coding tasks.
Économie de l'open frontier : viabilité, subvention, pivots