Anthropicの「守り方」の設計は、かなり筋がいい
この記事を読んでまず思ったのは、Anthropic は「強いモデルを配る」ことよりも、「危ない使い方をさせない配り方」をかなり意識している、ということだった。そこが単なるAI機能追加のニュースと少し違う。セキュリティ用途のAIって、便利さだけを前に出すとすぐ不安になるけれど、この記事ではその不安に対して、直接モデルを触らせず、決められた出力だけ返す形に寄せている。発想としては地味だが、実務ではかなり大事だと思う。 特に引っかかったのは、`Claude Security` がコードスキャンに Mythos 5 を使うけれど、利用者は生の出力を見ない、という設計だ。脆弱性の指摘や patch の候補だけを返すなら、攻撃に転用しづらい。これはたしかに理屈としては分かる。ただ、実際の現場では「生の出力を見られない」ことで、調査の自由度がどれくらい削られるのかは気になる。防御と検査の細かさは、たぶん常に綱引きになるはずで、そのバランスをどこに置くかが難しい。 もう一つ面白かったのは、`$35 million` を open source のセキュリティ支援に回す話だ。AI企業が自社モデルの守備範
papoo.work