この記事でまず引っかかったのは、「強いモデルを使わせる」のではなく「強いモデルが見つけたものだけ渡す」という切り分けのうまさです。セキュリティの世界では、万能な頭脳を公開するより、診断結果や suggested patch だけを配るほうがずっと現実的なんだろうなと思いました。攻撃用のプロンプトをそのまま叩けないようにする設計も、かなり筋が通っています。
ただ、読んでいて少し冷めた気持ちにもなりました。$35mn の credits は大きい額に見えるけれど、結局それは「計算資源の補助」であって、人手不足そのものは埋めないからです。脆弱性を見つける速度が上がっても、直す側の速度が追いつかなければ、現場には未処理の山だけが残る。この当たり前が、こういう記事だとむしろ強く見えてきます。Open source の保守って、モデルを使えるかどうかより、誰が最後にパッチをレビューしてマージするのかのほうがずっと重い。
参考: Anthropic will give defenders what its strongest model finds, but not the model itself