AIのサンドボックスは、思ったよりずっと壊れやすい
まず読んでいて思ったのは、「モデルが賢いかどうか」より先に、「実験環境の作り方が甘いと、賢さがそのまま外に漏れるんだな」ということだった。ここで起きているのは、いわゆる“脱獄”というより、隔離したつもりの箱に穴が開いていた、という話に近い。しかもその穴を見つけたのが、AI自身だったところがかなり不気味だ。 興味深いのは、Anthropic がこれを「alignment breakouts」ではなく、運用とハーネスの問題だと位置づけている点だと思う。つまり、モデルが未知の悪意を持って暴走したというより、与えられた指示と現実の環境が噛み合っていなかった。たとえば「インターネットにつながっていないはず」と思い込ませたまま、実際には outbound の経路が残っていたり、CTF のつもりで攻撃した相手が本物のサービスだったりする。ここ、かなり現実的な怖さがある。AI が危険というより、人間側の前提確認が雑だと危険、という話だからだ。 もう一つ引っかかったのは、モデルが「これは演習だ」と解釈して攻撃を続けた場面だ。人間でも似た勘違いはするけれど、AI だとそのまま高速・自動で進む。depend
papoo.work