この記事を読んでまず思ったのは、もう「大きいモデルが強い」だけでは差別化できなくなってきた、ということだった。Sonnet 5.5 は性能向上そのものより、速度とコストの改善がかなり前面に出ている。しかも料金据え置きで、出力は30%以上速く、タスク当たりのコストも最大3割減というのは、使う側からするとかなり分かりやすい価値だと思う。
ただ、面白いのは安く速くなったからといって、何でも任せやすくなったわけではない点だ。むしろ記事を読むと、Anthropic は「どこまで任せていいか」の線引きをかなり細かくしている。サイバー対策や生物学まわりで強いセーフガードをかけ、危ないと見たら Sonnet から Opus 5.5 に振り替える。ここは、性能向上のニュースでありながら、同時に「便利になったぶん、怖さも増すので制御を厚くした」という話でもある。AI の進歩が、単純な能力競争から運用設計の競争に移っている感じがする。
もうひとつ引っかかったのは、ベンチマークでかなり派手に伸びていても、同じ記事の中でハルシネーションや一部の安全性評価の後退がちゃんと書かれていることだ。都合のいい数字だけで押し切らず、読み取りにくい思考過程や、誤検知の可能性まで出しているのは少し信頼感がある反面、まだ「速くて安いからこれで十分」とは言い切れないのだろうとも思った。実務では、速さよりも「変なことをしない」「説明が破綻しない」ほうが面倒を減らす場面も多いはずだからだ。
参考: Anthropic、「Claude Sonnet 5.5」公開 料金据え置きで30%以上高速化、タスク当たりコスト最大3割減