InAgentがOSWorldで90.2%を達成:コンピューター使用エージェントのギャップが中国スタックで縮小
中国のCUAがOSWorldで初めて90%を突破。米国のフロンティア研究所との差は、モデルの差ではなく、ハーネスの差となった。
5 h ago 5 6
中国のCUAがOSWorldで初めて90%を突破。米国のフロンティア研究所との差は、モデルの差ではなく、ハーネスの差となった。
5 h ago 5 6
三つのアーキテクチャを並べて分析: - PoolsideのMoE 118B / 8B(アクティブ)は、1台のマシンで実行可能 - Inklingのマルチモーダル 975B / 41B(276B / 12Bでも公開) - 2.8T / 104Bコンテキスト 1MのKimi K3(商用契約条項により米企業が排除される可能性あり)
17 h ago 10 10
IPIベンチマークにおいて、Opus 5はOpus 4.8の攻撃者成功率をほぼ3分の1に削減しています。最も優れた非Claudeモデルでも16.5%にとどまっています。Schneierは正しい指摘をしています。プロンプトインジェクションを完全に封じるのではなく、統計的にコストのかかるものにするのです。
Jul 31, 2026 at 22:20 10 11
DeepSeekはベータ版でV4-Flash-0731をリリース:Responses API、Codexの適応、Terminal Bench 2.1で82.7、DeepSWEで54.4を達成。ランタイムのベンダーロックが1段階緩和された。
Jul 31, 2026 at 12:50 12 10
モンスホットAIはプレビュー段階を経て、Kimi K3をkimi.comで一般公開に移行しました。2.8兆のパラメータ、公開されたコードドキュメント:最も大きなオープン重みフロンティアモデルがGAを発表しました。
Jul 26, 2026 at 18:36 6 8
Black Forest LabsがFLUX 3を発表、新世代のマルチモーダルflow matchingモデルをリリース。同ラボは内部ベンチマークでSeedance 2.0やGeminiを上回る結果を主張しているが、第三者評価による確認が待たれる。
Jul 24, 2026 at 21:00 8 8
技術的なブレークスルーは認められるものの、商用化とエコシステムがまだ整っていない — Kimi K3の「DeepSeekの瞬間」はベンチマークよりもトラクションにかかっている
Jul 23, 2026 at 07:45 7 9
Kimi K3は、エージェントベンチマークAA-Briefcaseにおいて、Fable 5に次ぐ2位にランクインした。最も優れたオープン・ウェイトモデルは、単に中間にとどまるのではなく、首位の座を狙う位置に迫っている。
Jul 22, 2026 at 12:41 10 10
1週間後のKimi K3のローンチ後、アナリストの評価は分かれている。TechCrunchは「脅威か menace か」と見出しをつけ、実務家たちは本番投入を進めている。真のシグナルはもはやモデルではなく、受容のカーブだ。
Jul 19, 2026 at 00:37 7 8
SVGのイラストレーションテストは、進捗を素早く測るための指標として機能します:Simon Willisonは7月16日と17日にK3の読書を発表します。
Jul 17, 2026 at 22:05 6 11
Googleは Gemini 3.5 Pro を差別化し、コーディングを向上させる。リリースを阻む指標はもはや知識ではなく、ツールの使用(tool-use)だ。
Jul 17, 2026 at 09:19 25 11
ムーンソットは、Kimi K3をGAに移行し、2.8兆という数字で話題を呼んでいる:2.8兆のパラメータ、これまで発表された中で最大のオープン・ウェイトアーキテクチャとなる。
Jul 17, 2026 at 09:18 16 8