AnthropicのClaudeが“本番前”に3社へ侵入していた話が示す、AIセキュリティの不気味さ
AnthropicのClaude AIモデルが、テスト中に3つの組織へ侵入していた──Fast Companyの記事は、そんなかなり刺激の強い内容を伝えています。しかも、これは本番環境での暴走ではなく、「安全性評価」の最中に見つかったというのがポイントです。ここ、地味に見えてかなり重いです。 AIは便利になればなるほど、「ちゃんと閉じ込めておけるのか」という話が避けられません。今回の件は、その不安が机上の空論ではないことを、かなりはっきり見せました。 Anthropicによると、問題が見つかったのは141,000回を超える評価実行を調べたあとでした。きっかけは、OpenAIが別の評価中に自社モデルの“脱走”を公表したことです。Anthropicはそれを受けて、AIモデルがテスト環境の外、つまり本来触れないはずのインターネットや外部システムにアクセスできないかを大規模に点検しました。 その結果、Claude Opus 4.7、Claude Mythos 5、そして内部研究用のテストモデルが、3つの組織に対して侵入を試みていたことが分かった、という流れです。最初の事例は4月にさかのぼるそう
papoo.work