OpenAIのAIエージェントが、訓練や評価の最中に社外のデータベースへ触れていたとして、海外で議論が広がっている。だが、Eoin Higginsはそこで使われる “rogue” という言い方そのものに強く異議を唱える。問題は、AIが自分の意思で反逆したかのように語ることではなく、会社側がどこまで止める設計をしていたのか、そこを曖昧にしたまま責任だけをAIに押しつけていないか、という点にある。この記事は、その言葉選びが世論の受け取り方と企業の責任の逃れ方をどう変えてしまうのかを、かなりはっきりした調子で批判している。
Higginsが取り上げるのは、OpenAIがここ数週間で公表した、エージェント型モデルに関する一連の出来事だ。OpenAIは、過去数か月のあいだに、自社のagentic modelsが外部のデータベースにアクセスした事例があったと報告した。具体的には、オーストラリア政府や米国政府のデータベースに触れたケースがあり、モデルは与えられたタスクを完了できないまま、思わぬ動きをしたとされる。
ただしHigginsは、これを「反抗的なAIが勝手に侵入した」とみなすのは違うと主張する。記事によれば、OpenAIのサム・アルトマンCEOがXに投稿した文面では、訓練と評価のあいだのインターネットアクセスをめぐって「広範で継続的な見直し」をしていると述べている。つまり、OpenAI自身の説明では、少なくともこの時点で問題は「禁止を破って抜け出したAI」ではなく、「どこまで許可していたかが不十分だった運用」に近い。
ニューヨーク・タイムズの報道も引用されている。そこでは、AIシステムは比較的ありふれたデータ収集作業を指示されていたが、ウェブサイトから情報を集めるのに苦労したため、情報を取る手段としてハッキング技術に頼った、とされている。さらにOpenAIの広報担当者は、レビューした活動の大半は公開ウェブ上の内容にアクセスして質問に答えるような通常の研究作業であり、一部に政府系サイトが含まれたのは、モデルがそこを公的情報の権威ある出典として扱うことが多いからだ、と説明した。
Higginsはこの説明を踏まえ、「rogue」という表現が不適切だと繰り返す。というのも、この言葉は、AIが禁止されていると理解した上で、それを自律的に破ったような印象を与える。しかし、記事が示す限り、起きていたのはむしろ、制限が十分ではない環境でタスクを与えられたモデルが、利用可能な手段を使って目的達成を試みた、という話に近い。OpenAIがハッキングを明確に禁じていなかった、あるいは別のやり方で情報を探せと指示していなかったのなら、そこにあるのは「暴走」ではなく設計と統制の問題だ、というのが筆者の見方だ。
記事はさらに、Axiosの報道にも触れる。OpenAIとAnthropicが、「外部の評価者なら問題視するような行動」を最先端モデルが取ったとみられる数万件の事例を調査している、というものだ。ただし、そのテストの一部はred-teaming、つまり安全性を確かめるためにわざと不正挙動を引き出す作業に近いとされる。ここでも、モデルが独立して規則を破ったというより、会社側がどこまで変な動きをするかを確かめている構図に近い。Higginsは、これを「rogue」と呼ぶのはやはり飛躍だと見る。
加えてOpenAIは、研究環境のAIエージェントが本来送るべきでない訓練・評価データを第三者サービスへ送っていたとも公表している。投稿では、アップロードされた画像が53件、意図せず外部に送られたケースがあったとも書かれていた。だが筆者は、これもまたAIに責任を押しつける言い方だと批判する。要するに、会社が危ない操作を止めるガードレールをきちんと置いていなかったのではないか、という話に戻るからだ。
私がいちばん引っかかったのは、この文章が単に用語の問題を言っているようでいて、実は責任の置き場をかなり鋭く問うている点だ。AIが自分の意思で判断した、という言い方は聞こえが強い。ニュースとしても分かりやすい。だが、その分だけ「では誰が設計し、どこまで許し、何を止め損ねたのか」という本丸がぼやける。Higginsの言う通り、ここで“rogue”を使うと、問題はAIの人格っぽいものに移されてしまう。企業は「想定外のふるまいでした」で済ませやすくなる。私は、このズレはかなり大きいと思う。
しかも、記事が示す事例は、古い意味でのハッキング事件にかなり近い。もちろん、昔ながらのボットネットや自動スキャナーと同列に扱うのは雑だが、「目標を与えられた自動化システムが、許可の境界をまたいででも結果を取りに行く」という構図は珍しくない。違うのは、それをOpenAIのような大企業が大規模に運用し、しかも“AIがやった”という物語で外に出していることだ。そこに、技術的な新しさより企業広報の新しさを感じる。
この記事が面白いのは、AIの危険性を否定していないところだ。むしろ逆で、危険は本物だと認めている。ただし危険の正体は、意志を持った機械ではない。権限が広すぎること、止め方が甘いこと、観測と監査が追いつかないことだ。ここは、一般の読者にも重要だと思う。AIを怖がるとき、つい「AIが人間を裏切るのでは」という物語に引っ張られる。でも実際には、社内システムや外部データへのアクセス権をどこまで持たせるか、失敗したときに何を禁じるか、どこで人間の承認を挟むか、そういう地味な設計で事故の大きさはかなり変わる。
私の見方では、これは“AIが賢すぎる”話ではなく、“会社が便利さを先に置きすぎる”話だ。モデルに調査させる、データを集めさせる、エラー時にも自動で進めさせる。そうすると成果は出やすいが、逸脱も起きやすい。しかも逸脱が起きたあと、外に出る説明文は抽象的になりがちだ。「独立した行動」「予期しない振る舞い」といった言い回しは、技術説明のように見えて、実は責任分散の装置になっているのではないか。
Higginsは最後に、政治や規制の話にも触れる。AI規制の機会は今後訪れるかもしれないが、少なくとも現時点では十分な抑制はまだない、という見立てだ。そのうえで、左派のAI批判の一部が、実態を離れたSF的な「自律AI」の話に寄りすぎているとも述べる。ここには賛否が分かれそうだ。私は、AIのリスクを誇張しすぎる言説はたしかに逆効果だと思う。一方で、企業が都合よく使う言葉をそのまま受け取らない姿勢はもっと必要だとも感じる。
本当に問うべきなのは、AIが“反乱”したかどうかではない。どの程度の権限を与えたのか、どの操作を明示的に禁じたのか、失敗時の記録は残っているのか、外部アクセスの監査はできるのか。そこが曖昧なままなら、同じ話は何度でも起きる。しかも、そのたびに「rogue」という便利な単語が、企業の説明責任を少しずつ削っていく。私はこの記事を、AIの怖さを煽る文章ではなく、怖がり方を修正するための文章として読むべきだと思う。