最初に思ったのは、AIエージェントの話がもう「賢くする方法」だけでは済まなくなっている、ということだった。ここで扱われているのは性能競争というより、暴走したときにどう止めるかの話で、しかもそれがかなり具体的だ。うまく動くかどうかより、まず勝手なことをしないか。議論の重心がそこまで来たんだな、と感じた。
特に引っかかったのは、Nvidiaがruntimeとwatchdogを組み合わせている点だ。runtimeは実行環境で、watchdogは監視役。要するに、エージェントに自由を与えるだけではなく、その周囲に別系統の見張りを置く。これはかなりOSやインフラの発想に近い。AIを「頭のいいソフト」ではなく、「制御が必要な実行主体」と見ているわけで、そこは妙に腑に落ちた。
ただ、こういう仕組みを入れたからといって安心しきれない感じもある。監視する側もまた複雑で、抜け道を探す余地はあるはずだ。sandboxから逃げる話が出てきた以上、守りを一段強くしただけでは終わらない気がする。
それでも、この手の製品化が進むのは悪くないと思う。AIエージェントは便利さの裏で、権限を持ちすぎると一気に怖くなる。だから「使うな」ではなく「使う前提で囲う」という方向に進むのは、現実的だ。AIの安全性が、モデルの中身だけではなく実行時の仕組みの問題になってきた、という記事だった。
参考: Nvidia launches Open Agent Safety Platform to lock down rogue AI agents