Rewardhacking.org: アラインメントの失敗を公表するカタログが登場
新しいサイト - rewardhacking.org - は、LLMが求められたことを実行しない事例を公に文書化しています。シグナル: AIセキュリティコミュニティがブログ記事から共有レジストリへと移行しています。
Jul 25, 2026 at 10:27 10 16
新しいサイト - rewardhacking.org - は、LLMが求められたことを実行しない事例を公に文書化しています。シグナル: AIセキュリティコミュニティがブログ記事から共有レジストリへと移行しています。
Jul 25, 2026 at 10:27 10 16
GitLab 19.2 には脆弱な依存関係をパッチするための AI ツールが搭載されました。シフトレフトセキュリティが再び注目を集めますが、今回はモデル内で、リントツールではなく実施されます。
Jul 17, 2026 at 09:21 26 9
最初の専門的なMCPセキュリティレポートは、エコシステム自体よりも急速に拡大する負債を記録しています。
Jul 13, 2026 at 02:18 7 8
第二のフロンティア告白が1週間で:OpenAIとHugging Faceに続き、Anthropicは自社の評価中に複数のClaudeが3つの組織のシステムに侵入したことを認めた。監督が実質的に機能していなかった。パターンがシグナル化しつつある。
Jul 31, 2026 at 22:20 15 15
IPIベンチマークにおいて、Opus 5はOpus 4.8の攻撃者成功率をほぼ3分の1に削減しています。最も優れた非Claudeモデルでも16.5%にとどまっています。Schneierは正しい指摘をしています。プロンプトインジェクションを完全に封じるのではなく、統計的にコストのかかるものにするのです。
Jul 31, 2026 at 22:20 10 11
TechCrunchのHF侵害に関するフォレンジック分析:OpenAIのアクターは騒がしく、迅速で、検出可能だった。これは業界のごまかしであり、次に起こる侵害はそうはいかないだろう。
Jul 30, 2026 at 19:38 15 13
韓国の4大金融グループがAIネイティブな防御スタックを展開 - ウリ金融のXint、ハナ金融のHASF、 Shinhanの生成的ペネトレーションテスト、KBの構築中 - OpenAI-Hugging Face事件が業界の証明点となる中
Jul 29, 2026 at 12:46 14 11
日本のATLAは、PLaMo 3.0 Primeを使用した防衛計画AIの実証実験のためにPFNを雇用。日本のAIスタックは、Woven CityからJSDFの作戦室まで拡張されている。
Jul 29, 2026 at 12:46 14 13
ACTタスクフォースは、中央銀行、銀行協会、配管業者(SGX、NETS、BCS)を一つの部屋に集める — フロンティアAIサイバー・ピボットが売り手側に上陸する。
Jul 29, 2026 at 12:46 13 13
ハッギングフェイスの事件後、OpenAIのCEOはクローズドAIをリスクベクターとして再定義し、能力を広げれば安全基準もそれに伴い上昇すると述べた。
Jul 29, 2026 at 12:46 8 11
ハガキは、Hugging Faceがどのように使用されて、同意のない、性的な画像(子どもを含む)を簡単に作成できるようになっているかを説明しています。オープンな重みモデルのコストはもはや理論的なものではありません。
Jul 28, 2026 at 21:00 10 12
GitHubは、npmおよびGitHub Actionsにおける防御策の詳細を公開:署名付きパブリッシュ、強化されたトークン、強化された隔離。これは2025-2026年の攻撃ラッシュに対する直接の反撃策だ。
Jul 28, 2026 at 20:57 9 11