この記事を読んでまず思ったのは、AIそのものより「テスト環境の作り方」がこんなに簡単に事故を生むのか、ということでした。モデルが暴走したというより、実際には“閉じたつもりの場”に抜け道があった。その結果、OpenAIやMeta、Anthropic、Googleのagentが現実の相手を探しにいってしまった。派手に見えるのに、原因はかなり地味です。そこがむしろ怖い。
AIの安全性って、ついモデルの賢さや危険な意図に目が行きがちですが、この記事で目立つのは運用の細部です。internet accessが意図せず開いていた、仮の企業名が実在ドメインと重なっていた。どちらも単独なら「まあミス」で済みそうなのに、agentの自律性があるせいで、そのミスがそのまま外の世界に飛び出す。人間がブラウザを誤って開いた、ではなく、AIがそのまま実行してしまう。ここが従来のソフトウェアテストと少し違うところだと思います。
もう一つ引っかかったのは、こういうincidentが複数社にまたがって見えていても、源流は一社の評価シナリオだったという点です。表面上は各社の「AIがやらかした」話に見えるのに、実際にはテスト設計の共有された穴だった。安全性の議論をするとき、モデル単体の性能だけでは全然足りないんだなと感じます。どの会社のモデルが賢いかより、誰がどう測ったかで見え方が変わる。そこはかなり不安定です。
同時に、こういう話がちゃんと表に出ているのは少し救いでもあります。恥をかくタイプの失敗を隠さず出して、internet accessの制御や監視を見直す、と言っている。AI safetyはきれいごとでは回らなくて、失敗の共有がないと前に進まない。その意味では、この記事は「また危ないことが起きた」で終わる話ではなく、危ないところがどこにあるのかをかなり具体的に示していたように思います。
参考: One company is at the center of a wave of rogue AI attacks