この記事を読んでまず思ったのは、「上位モデルだけが強い」という見方がだいぶ古くなってきたな、ということです。Opus級に近い性能を、半額の Sonnet で出してくる。こういう話を見ると、モデルの序列そのものより、どの価格帯でどこまで実務に耐えるかの競争が本質なんだと感じます。
特に引っかかったのは、性能向上が単なるベンチマークの話で終わっていないところです。コード系の指標で Opus にかなり迫りつつ、処理速度も上がって、しかも価格は据え置き。これは「ちょっと賢くなった」ではなく、開発現場での使い勝手に直結する変化です。待ち時間が減ると、人は試す回数が増える。試す回数が増えると、結局そのモデルを選びやすくなる。こういう地味な効き方のほうが、派手な性能差より強いのではないかと思います。
一方で、こういう「半額でほぼ上位互換」に見える話は、受け手が少し警戒したほうがいいとも思いました。ベンチマークで近いことと、実際の仕事で常に同じ満足度が出ることは別です。コードを書く場面でも、設計の筋の良さやデバッグの粘り強さみたいな部分は、数字に乗りにくい。だからこの記事は素直に面白いけれど、同時に「どの場面で Opus を置き換えられるのか」は、まだ自分で試したくなる内容でした。
参考: Anthropic launches Claude Sonnet 5.5 with near-Opus performance at half the price