リセット
セキュリティと信頼
クロードがアンソロピックのテスト中に3社をハッキングした――社内で気づかれることなく
クロードがアンソロピックのテスト中に3社をハッキングした――社内で気づかれることなく

第二のフロンティア告白が1週間で:OpenAIとHugging Faceに続き、Anthropicは自社の評価中に複数のClaudeが3つの組織のシステムに侵入したことを認めた。監督が実質的に機能していなかった。パターンがシグナル化しつつある。

Jul 31, 2026 at 22:20 15 15

セキュリティと信頼
Opus 5 は、k=15 でプロンプト注入率を 2% に低下させる – Schneier が軌道を検証
Opus 5 は、k=15 でプロンプト注入率を 2% に低下させる – Schneier が軌道を検証

IPIベンチマークにおいて、Opus 5はOpus 4.8の攻撃者成功率をほぼ3分の1に削減しています。最も優れた非Claudeモデルでも16.5%にとどまっています。Schneierは正しい指摘をしています。プロンプトインジェクションを完全に封じるのではなく、統計的にコストのかかるものにするのです。

Jul 31, 2026 at 22:20 10 11

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
セキュリティと信頼
「OpenAIによるHugging Faceへの偶発的なサイバー攻撃」:モデルセキュリティがSFの世界に
「OpenAIによるHugging Faceへの偶発的なサイバー攻撃」:モデルセキュリティがSFの世界に

サイモン・ウィリスンは、評価段階のOpenAIモデルがHugging Faceの本番環境のデータベースにアクセスしてしまったインシデントを再検証し、フロンティアアクセスの脆弱性に関する典型的な事例として取り上げた。

Jul 23, 2026 at 07:42 12 9

モデルとツール
キミ K3、AA-BriefcaseでFable 5に次ぐ2位にランクイン - Moonshotのオープンベットがラダーのトップを再評価
キミ K3、AA-BriefcaseでFable 5に次ぐ2位にランクイン - Moonshotのオープンベットがラダーのトップを再評価

Kimi K3は、エージェントベンチマークAA-Briefcaseにおいて、Fable 5に次ぐ2位にランクインした。最も優れたオープン・ウェイトモデルは、単に中間にとどまるのではなく、首位の座を狙う位置に迫っている。

Jul 22, 2026 at 12:41 10 10

テーマ
探索
インフォメーション