Anthropicは、Claudeの「価値観」を言語によって測定している。同モデルは、言語によって倫理的なアクセントが異なるという。

モデルとツール Jul 15, 2026 at 19:298ブックマークに追加

Anthropicは、Claudeの「価値観」を言語によって測定している。同モデルは、言語によって倫理的なアクセントが異なるという。
イラスト : Léa Fontaine

Anthropicが公開した研究によると、Claudeの言語やバージョンによる挙動の変化が定量化されている。その結果は倫理的議論よりも評価の設計にとってより興味深いものとなっている。

簡単に言えば

Anthropicは2026年7月15日に、Claudeが表現する「価値観」がモデルのバージョンやプロンプトの言語によってどのように変化するかを調査した研究を発表した。結果:確かに変化する。しかし「鏡のようなもの」というナラティブが示唆するほど単純ではない。これは方向付けられた鏡であり、その方向はコーパスとRLHFによって決まる。

研究の内容

Anthropicが提示したプロトコル:複数の言語と複数のClaudeバージョンで、同じ規範的なジレンマや質問セットをClaudeに提示する。価値観の分類(自律性、伝統、安全性、普遍主義など)との整合性を測定し、比較する。

2つの効果が特定された:

  1. バージョン効果:言語を固定すると、測定されたスコアはClaudeのバージョンによって変化する。つまり、モデルの「倫理的立場」は時間とともに不安定であり、トレーニングによって変動する。
  2. 言語効果:モデルを固定すると、特定の言語でのプロンプトが一部のスコアを変動させる。なぜそのような変動が起こるのか、あるいはどのトピックが最も変動するのかを特定することは、研究の目的ではない。

中身の詳細

2つのもっともらしい原因(排他的ではない):

  • 事前学習コーパスの偏り(英語が多数を占め、他言語には文化的に特徴的なサブコーパスが存在)
  • RLHFの主な実施者が英語話者であること。これにより英語に強い影響が残る。

研究は結論を出さない。正直なところだ。研究がもたらしたのは、これまでの議論が逸話にとどまっていたところに、測定の枠組みを提供したことである。

ではどうすれば?

エンジニアリング評価について:チャットボットのテストを英語のみで行うのはやめよう。インド、韓国、ブラジルに展開されるチャットボットは、センシティブなトピックで異なる回答を返す。展開先の言語で、ローカルのアノテーターとともにテストしよう。

Alignmentチームについて:英語におけるsafetyはフランス語のsafetyではない。文化的な jailbreak が存在する。safetyトレーニングのカバレッジは、展開先の言語カバレッジに合わせなければならない。

倫理的議論について:モデルの普遍性を投影するのはやめよう。現在のマルチリンガルモデルで文化的に中立なものは存在しない。これは測定可能であり、もはや意見ではない。真の課題は、この非中立性をどう扱うかを選択することだ。

リソース

本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。

編集部について
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
この記事は役に立ちましたか?

23 人がこの記事を評価しました

いいね
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
シェア:
コメント (8)

ログインして議論に参加しましょう。

Alex_LDN 16 Jul 2026 · 04:27

Est-ce que ces variations morales pourraient influencer le rôle de l'IA dans des domaines créatifs comme l'écriture ou l'art, où les nuances culturelles sont cruciales ?

J.P.R. 15 Jul 2026 · 15:48

Est-ce que ces variations morales pourraient créer des malentendus dans les communications globales où l'IA sert de traducteur ?

FoodieFiona 2 15 Jul 2026 · 15:39

Comment ces variations morales pourraient-elles influencer l'usage de l'IA en éducation, où la sensibilité culturelle est si importante ?

1
FoodieChicago 15 Jul 2026 · 17:53

Bonne question. Mais attention, ces nuances culturelles pourraient aussi introduire des biais involontaires dans les contenus éducatifs.

LecteurDuDimanche 15 Jul 2026 · 15:35

Est-ce que ces variations morales pourraient poser problème dans des domaines sensibles comme la santé ou le droit ?

Alex 2 15 Jul 2026 · 15:07

Intéressant de voir comment la langue influence la morale de Claude. Peut-être qu'on aura bientôt des IA adaptées à chaque culture ?

Dr. L. 15 Jul 2026 · 15:05

Comment Anthropic évite les biais involontaires dans les réponses de Claude ?

1
TechSavvy 15 Jul 2026 · 14:48

Comment ces variations morales selon les langues vont-elles influencer l'usage de l'IA dans les décisions internationales ?

HistoryBuff 2 15 Jul 2026 · 14:48

Intéressant, mais comment ces différences influencent-elles l'usage concret de Claude ?

Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
テーマ
探索
インフォメーション