まず、ここまで「悪用」の実例がまとまって外に出てくる段階まで来たのか、という感想が強かったです。AI の議論って、どうしても「将来こうなるかもしれない」に寄りがちですが、この文章はもう少し生々しい。reconnaissance、phishing、credential theft みたいな、昔からある攻撃の面倒な部分を AI が肩代わりしている。しかも人間は完全に消えるのではなく、標的を決めたり、重要な出力を確認したりする役に残っている。この「人間が指揮、AI が実働」という形がいちばん嫌だなと思いました。攻撃の敷居が下がるというより、回数と速度が上がって、手間のかかる作業が工業化される感じです。
一方で、記事を読んでいて少し引っかかったのは、公開されているのが「検出できた misuse の報告」だという点です。ここは便利な報告であると同時に、当然ながら全体像ではないはずです。どこまで見えていて、どこから見えていないのかが気になる。コメント欄でもその疑念がかなり強く出ていて、guard-rails や sandbox が万能ではない、という話に流れていくのですが、そこはたしかに直感に合います。悪用する側は毎回正面突破する必要がないし、モデルの入出力だけを見ていても、何が本当に行われているかは見えにくい。だからこの手の報告は「これだけ起きた」より、「これでも見えているのは一部かもしれない」と受け取る方が自然だと思いました。
それでも、こういう報告が出ること自体には意味があるとも思います。AI の危険性は抽象論だけだと飽きられやすいけれど、credential theft や surveillance、propaganda のように、既視感のある悪用に落とし込まれると急に現実味が出る。しかも、それが一部の天才的な攻撃者の話ではなく、道具としての AI によって反復可能になっているのが怖い。便利な道具が悪用されるのはいつものことですが、今回の嫌なところは、攻撃の「作業量」そのものを減らしてしまう点にあると思います。---