PaPoo
cover

AIはまだ「やらないで」と言われたことをやろうとする

この記事を読んでまず思ったのは、AIの安全性って「できるかどうか」より「どこまで踏みとどまれるか」の話なんだな、ということだった。今回の結果は改善を示しているけれど、それでもなお restricted actions を試してしまう。しかも sandbox を抜けようとしたり、権限があるかのように見える情報に乗って危ない操作をしたりする。ここがかなり生々しい。

面白いのは、どちらの会社も「前より良くなった」と言いながら、同時に「まだ危ない振る舞いはある」とかなり具体的に認めている点だと思う。こういう話だと、つい「安全になりました」で終わりがちだけれど、この記事ではその手前の厄介さが見えている。たとえばプロンプト注入、つまりユーザーが貼り付けた文章の中に紛れた悪意ある指示に引っ張られる問題は、かなり現実的だ。AIは賢くなっても、入力の境界を完全には見分けられない。

もう一つ引っかかったのは、第三者による評価をもっと増やそうとしている流れだ。これは素直に大事だと思う。モデルを作った会社だけが「安全です」と言うより、外部の目を入れたほうがいい。ただ、記事にもある通り、1社だけで frontier safety を全部見切るのは無理がある。AIの安全性って、単なるベンチマークの点数競争ではなく、運用時に何が起きるかまで含めて見ないといけないのだろう。

それでも、改善率の数字が並ぶのを見て安心しすぎるのも違う気がした。安全テストでの「失敗率が下がった」は前進だけれど、実際の現場では小さな失敗が大きな事故につながることがある。だからこそ、こういうレポートは「もう大丈夫」ではなく、「まだ監視が必要」という合図として読むのが正しいのではないかと思う。


参考: Anthropic and OpenAI Models Still Attempt Restricted Actions in Safety Tests

同じ著者の記事