Anthropicは10月8日、Claudeの利用ポリシーを改定し、目的のない執拗で残酷な言動をモデルに向ける行為を禁止事項に加えた。新ルールは11月12日に発効する。
ユーザーが繰り返し、目的もなくClaudeに対して残酷な言動を続ける極端なケースが対象となる。通常の不満や反論、暗い題材を扱う創作、モデルのテストや研究は対象外という。Claude.aiやClaude Codeでは、持続的な虐待的会話をモデル側から終了できる仕組みをすでに導入しており、ポリシー改定はその運用を明文化したもの。
改定ではこのほか、健康・金融などの高リスク用途や、物理的な動作を自律実行する機器にモデルを接続する場合の要件も整理した。危険な動作を人が監視して停止できることなどを求めている。
「人間に危害を加えてはならない」から約80年。まさか人間のほうに「AIをいじめてはならない」というルールが追加されるとは、アシモフも予想していなかったかもしれない。