Sonnetって、モデルの名前としては地味なのに、実際の使い勝手はかなり重要なんだなと改めて思った。最上位の Opus ほど派手ではないけれど、日常的に触るのはたぶんこういう中間グレードのモデルだからだ。そこで「速い」「安い」「そこそこ賢い」をまとめて少しずつ底上げしてくるのは、かなり実務的なアップデートに見える。
ただ、読んでいて少し引っかかったのは、Anthropic が Sonnet 5.5 を「everyday tasks に強い」としている点だった。つまり、難問を解くというより、バグ修正や資料作成、UI の磨き込みみたいな、ちゃんと人間の仕事に近いところで効くモデルとして売っている。これは便利そうだけれど、同時に「AI に何を任せると得なのか」がかなりはっきりしてきた感じもある。夢のある話というより、現場の作業をどれだけ短縮できるかの競争だ。
もうひとつ面白かったのは、価格を据え置いたまま速くなっていること。こういう話は毎回そう簡単ではないはずで、実際には内部でかなり割り切った最適化をしているのだと思う。しかも、同じ価格でも使う token が減るなら、利用者から見ると「同じ値段で少し賢く、しかも軽い」という印象になる。派手ではないけれど、かなり強い改善だ。
一方で、cybersecurity や biology の safeguards の話は、やっぱり今の生成AIらしい緊張感がある。性能が上がるほど、便利さと危うさが同じ方向に伸びるので、こういう安全策の説明が毎回セットになるのは自然だし、むしろ当然だと思う。モデルの良し悪しが、単純なベンチマークだけでは測れなくなっている。
参考: Anthropic upgrades Claude with new Sonnet 5.5 model, details here