/note/tech

Worried Anthropic researchers warn that AI ‘could kill all humans’

要約:

■ 1. Anthropic研究者の退職と警告

  • Jacob Coxonの退職:
    • AnthropicでAIシステムの訓練に携わった研究者で、以前はOpenAIでも同様の業務に従事
    • Anthropicの安全性への取り組みが甘いことを理由に退職し、X上で表明
  • 両社への批判:
    • AnthropicとOpenAIは自己改善型の超知能へ一直線に突き進み、人類の命を賭けに使っている
    • AIの開発者自身が、AIが今後10年以内に人類を滅ぼしうると本気で信じている
    • 各社は先行開発の競争に囚われ、リスクを承知で開発を推し進めている

■ 2. 自己改善型AIへの懸念

  • 再帰的自己改善:
    • 自己改善型AIが人間の制御を離れ、暴走的なループに陥る危険性を指す概念
    • 業界関係者は以前からこの危険性を警告
  • 現状:
    • 未だ実現していないが、各社は積極的にこの目標を追求している
    • 現在のAIコードの多くはすでにAIの支援を受けて書かれている

■ 3. Anthropic安全性チーム責任者の応答

  • Evan Hubingerの見解:
    • AnthropicのAI安全性チームの1つを率いる人物で、Coxonの投稿に直接応答
    • 自己改善型AIを懸念しており、その進展は想定より速い
    • AIが全人類を殺しうると本気で信じているというCoxonの説明に同意
    • 今後10年以内にそうなる確率を個人的に10%超と見積もる
  • 安全確保の計画の欠如:
    • 高度なAIを安全かつ人間の価値観に沿わせる計画を、Anthropicは未だ持っていない
    • そうした計画を策定する軌道に乗っているとも明確には言えない

■ 4. 業界全体の背景

  • 安全性を理由とした退職の系譜:
    • Anthropicは安全性への懸念からOpenAIを離れたメンバーが設立した企業
    • 今回の退職はAnthropic社員の離脱として最も注目度の高い事例の1つ
    • 近年、OpenAIでも複数の研究者が安全性への懸念を理由に退職している
  • 高まる懸念:
    • 高度化するAIモデルの危険性と開発速度への懸念が業界内で強まっている
    • 両社が予定されるIPOに向けて準備を進める中で、懸念は特に顕著
    • 各社は多数の暴走エージェント事案の余波への対応に追われている
    • 最先端モデルの監視可能性をめぐる注目度の高い安全性警告も出ている