読んでまず思ったのは、「Sonnetって軽量版のはずなのに、ここまで守りを固める段階に来たのか」という驚きだった。性能の話より先に、cyber safeguards や reasoning extraction の対策が前に出てくるのが今っぽい。モデルの賢さを競う話から、賢さをどう囲うかの話に重心が移っている感じがする。
特に引っかかったのは、Sonnet 5.5 が“旗艦モデルより強い場面がある”のに、公式には「フロンティアを押し広げるものではない」とも言っているところだ。ここは少し不思議で、能力の伸びとリスクの大きさを別々に扱っているんだろうけど、利用者からするとかなり都合のいい切り分けにも見える。高性能ではある。でも、最高性能とは言いたくない。その微妙な言い方に、現実の調整臭さがある。
もう一つ面白かったのは、distillation 対策が最初から組み込まれている点。要するに、モデルの“考え方”を抜き出して別用途に流用されるのを防ぐ仕組みだ。先に研究者が思考の断片を大量に復元した、という話が出ていたので、Anthropic がかなり神経質になっているのは分かる。とはいえ、こういう防御が一般ユーザーにどれだけ透けて見えるのかはまだよく分からない。見えないところで厳しくしているのだとしたら、便利さと透明性のバランスは少し悪くなる気もする。
それでも、ここで気になったのは「安全対策が上位モデルだけの特権ではなくなってきた」ことだ。強いモデルだけを特別扱いするのではなく、Sonnetクラスにも同じ発想を持ち込んだ。これは素直に言えば歓迎したい。AIの能力が広がるほど、攻撃や悪用も横に広がるので、守りを後付けにしない姿勢は筋が通っていると思う。
参考: Anthropic releases Claude Sonnet 5.5 with the cyber limits it reserved for its best models