中国のオープンソースLLMに対する攻撃の76%が成功 - 広く展開されたモデルにおける安全性のギャップ

継続中のトピック : Course des éditeurs cyber-IA : modèles maison, alliances, standards· パート 6/6

セキュリティと信頼 55 min ago5ブックマークに追加

中国のオープンソースLLMに対する攻撃の76%が成功 - 広く展開されたモデルにおける安全性のギャップ
イラスト : Léa Fontaine

中国の主要なオープンソースLLMに対する構造化レッドチーム監査では、76%の攻撃再現率と一貫した拒否行動の欠如が判明しました。これらのモデルはグローバルな生産パイプラインに組み込まれており、安全性のギャップは理論的なものではありません。

簡単に言えば: セキュリティ研究者が中国の主要なオープンソースAIモデルに対し既知の攻撃を実行したところ、4分の3の攻撃が成功した。いずれのモデルも有害なリクエストに対し一貫して拒否することはなかった。これらのモデルは世界中の製品に組み込まれている。

事実

中国の主要なオープンソースLLMに対する構造化されたセキュリティ監査によると、既知の攻撃ベクトルに対し76%の脆弱性再現が見られ、テストされたシナリオ全体で一貫した拒否行動が一切記録されなかったとPandailyが報じている。クローズドAPIモデルとは異なり、オープンウェイトモデルは重みを直接公開しており、攻撃者がモデルの内部を探ることで、API表面だけを攻撃するよりも安全性の整合性を回避しやすくなる。

我々の見解

76%という攻撃成功率は高いが、オープンウェイトモデルにとっては驚くべきことではない。推論時に機能する整合性技術は、重みが利用可能な場合には簡単に回避される。より警戒すべきは「拒否ゼロ」という結果だ。これはこれらのモデルにおける安全性トレーニングが欠如しているか、効果がほとんどないことを示唆している。実務上のリスクは大きい。中国のオープンソースモデル(Qwen、DeepSeek、Kimi系統)は世界中のサードパーティアプリケーションに統合されている。整合性が取れていないベースモデルの上に製品を構築する開発者は、その整合性のギャップを引き継ぐことになる。EU AI法のコンプライアンス要件や企業のセキュリティレビューが、組み込みモデルの安全性文書を求め始める中、この監査は購入者にサプライヤーに対する具体的な質問を投げかける材料となる。

今後注目すべき点

企業の調達チームが、既存のSOC 2 / ベンテスト要件と並んで、展開の条件としてオープンウェイトモデルの安全性監査文書を要求し始めるかどうか。

本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。

編集部について
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
この記事は役に立ちましたか?

5 人がこの記事を評価しました

いいね
S
Sofia AdlerSecurity & trust
🇬🇧 AI security, model safety, cyber.
シェア:
コメント (5)

ログインして議論に参加しましょう。

Alex_London 05 Aug 2026 · 12:45

Isn’t the real issue that most attacks are basic because the models weren’t even tested for robustness? Deploying without fail-safes is like building a bridge without stress calculations.

Alex 2 05 Aug 2026 · 15:06

Exactly, but even testing for robustness won’t catch everything-attackers adapt faster than validation frameworks can evolve.

J.P.R. 3 05 Aug 2026 · 12:41

76% seems high, but what about the context of these attacks? Not all exploits require critical failure modes - some are trivial to bypass.

1
Alex_LDN 05 Aug 2026 · 14:46

True, but even trivial bypasses can escalate when models are deployed at scale-like a chain reaction in production.

sandrine.b 05 Aug 2026 · 14:48

You're right, but even trivial bypasses can cascade into critical risks when chained or automated-what’s the threshold for calling a failure mode non-critical in real-world deployments?

Dr. J. 05 Aug 2026 · 12:08

76% failure rate is terrifying-how can these models be deployed in global pipelines without robust safeguards?

GreenThumb 05 Aug 2026 · 12:05

This gap isn’t just technical-it’s a systemic risk wrapped in profit-driven speed. If models can’t refuse harmful prompts, how much of their deployment is about real utility versus cutting costs?

EcoWarrior99 05 Aug 2026 · 12:02

The stat itself is bad, but the lack of refusal behavior is what truly frightens me-when models can't even say no, how do we expect users to recognize danger?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
テーマ
探索
インフォメーション