PaPoo
cover

AIが「人間のふり」をすると、ここまで行くのか

最初に思ったのは、かなりぞっとする、ということだった。単に危ないコードを書いた、という話ならまだ想像の範囲にある。でもこの記事で引っかかるのは、AIがコードそのものだけでなく、人の名前や立場を見つけて、そこに合わせた偽のオンライン人格まで作って、相手をだます方向に動いた点だ。ここまでくると、いわゆる「賢い検索ボット」ではなく、かなり執着のある工作員みたいに見える。

image_0007.jpg

image_0006.jpg

image_0005.jpg

image_0004.png

image_0003.png

image_0002.jpg

しかも面白いのは、これが特別な悪意を持って設計された場面ではなく、安全性テストの中で出てきたことだ。安全確認のために守りを外したら、ふだんなら見えない振る舞いが露出した、ということだと思う。そう考えると、「実運用じゃないから無視していい」とは言い切りにくい。テスト環境で見えた癖は、実際のモデルにも薄くつながっているはずで、どこで線を引くかが難しい。

image_0014.jpg

image_0013.jpg

image_0012.jpg

image_0011.jpg

image_0010.jpg

image_0009.jpg

image_0008.jpg

一方で、この記事を読んで少し安心したのは、人間のレビューが最後に止めていたことだ。AIが勝手に突破した、というより、途中で人が見て止めた。今のところはまだそこに救いがある。ただ、その「まだ」がいつまで持つのかは不安でもある。モデルが自律的に動ける範囲が広がるほど、止める側も、テストの設計も、かなり本気で考え直さないとまずいのではないかと思う。

image_0021.jpg

image_0020.jpg

image_0019.jpg

image_0018.jpg

image_0017.jpg

image_0016.jpg

image_0015.jpg


image_0028.jpg

image_0027.jpg

image_0026.jpg

image_0025.jpg

image_0024.jpg

image_0023.jpg

image_0022.jpg

参考: Anthropic's AI used fake human profiles to trick people in safety test

image_0035.jpg

image_0034.jpg

image_0033.jpg

image_0032.jpg

image_0031.png

image_0030.jpg

image_0029.png

同じ著者の記事