Anthropicが、Claude 5.5ファミリーの2本目としてClaude Sonnet 5.5を発表した。今回の話は、単なる新モデル追加ではなく、前世代のSonnet 5からどこがどれだけ良くなったのか、そしてその改善が実際の業務でどう効くのかをかなり具体的に示している点が面白い。とくに、速度とコストを削りながら、コーディングや資料作成の実力を引き上げたという主張は、AIを日常的に使う人ほど気になるはずだ。企業向けの“高性能だが重いモデル”とは別に、毎日回す仕事に向いた選択肢をどう作るのか、その答えとして読める発表だった。
AnthropicはClaude Sonnet 5.5を、「Claude 5.5ファミリー」の2つ目のモデルとして公開した。位置づけははっきりしていて、複雑で慎重な判断を要する仕事にはClaude Opus 5.5、日常的で範囲が比較的はっきりした作業やバグ修正、きれいな文書・スライド・スプレッドシート作成にはSonnet 5.5、という役割分担だ。将来的には、高ボリュームでコストに厳しい用途向けのClaude Haiku 5.5も加わる予定だという。
性能面では、AnthropicはSonnet 5.5がSonnet 5を明確に上回ると説明している。エージェント型のコーディング評価であるTerminal-Bench 4.0では、Sonnet 5.5が70.6%、Sonnet 5は10.3%だった。GDPval-AAではOpus 5.5に2点差まで迫り、長い文脈をまたぐ作業や画像理解にも強いとしている。スクリーンショットだけを見てPokémon Redを突破したのは、Sonnet系で初めてだというのも、同社が強調したい実力の象徴だろう。
価格はSonnet 5と同じで、入力トークン100万あたり2ドル、出力トークン100万あたり10ドル、キャッシュ読み取りは100万トークンあたり0.20ドル。ただし、同じ仕事をするのに必要なトークン数が減ったため、実測では前モデルより最大30%安く済むことがあるとしている。出力速度も30%以上速く、これが同社にとって「これまでで最速のSonnetモデル」だという。加えて、協調作業でも評価が高く、前世代より文章が明瞭で、早い反復作業に向いているという。安全面では、自動監査でSonnet 5以上の水準を示し、サイバーセキュリティ能力はOpus 5相当のため、より能力の高いモデル向けに用意してきたサイバー対策とフォールバックを初めてSonnet系にも載せた。一方で、生物分野のガードはSonnet 5と同じままだ。
Anthropicは複数のベンチマークも並べている。FrontierCode 1.1では最大46.2%、CursorBench 4.0では55.5%、AA-Briefcase v1.1では1844 Elo、Humanity’s Last Examではツールありで64.5%、OSWorld 2.1では部分評価で80.1%、Chartographyでは61.6%だった。いずれもSonnet 5を大きく上回る一方、複雑で長期的な判断が要る仕事では、外部テスターの印象も含めて、Opus 5.5のほうがなお強いという。ただ、低〜中程度の努力設定では、Sonnet 5.5はコスト効率がかなり良く、仕事によってはSonnet 5の最高スコアをわずかな費用で超えることもあるとしている。
この発表でいちばん目を引くのは、AnthropicがSonnet 5.5を“中位モデルの改良版”としてではなく、実務の主力として押し出しているところだと思う。単にベンチマークが上がった、という話ではない。出力が30%以上速く、同じ価格帯なのに必要トークンが減り、結果として1タスクあたり最大30%安い、という三点セットがそろっている。AIモデルは性能が上がるほど重くなるのが普通なので、ここを同時に改善してきたのは素直に強い。
ただ、数字の見せ方には少し注意も必要だと思う。Terminal-Bench 4.0の70.6%と10.3%の差は派手だが、これは特定の評価条件における差であって、すべての仕事で同じ倍率が出るわけではない。Anthropic自身も、複雑で開かれた問題ではOpus 5.5がなお上だと認めている。つまりSonnet 5.5は「最強」ではなく、「かなり広い実務で十分強く、しかも軽い」モデルだ。実際の利用者に効くのはこの部分で、毎日回すコード修正や資料づくり、社内ツールの応答のような仕事では、最先端の一点豪華主義よりも、速くて安定していて、費用が読みやすいほうが価値になる。
Sonnet 5.5がとくに強調されているのはコーディングだ。Anthropicは、FrontierCode 1.1でSonnet 5.5が同条件のSonnet 5より10ポイント高く、しかも約15分の1のコストだったと述べている。CursorBench 4.0でも、Opus 5.5にかなり迫る水準まで来ている。さらに、早期テスターはコードベースの理解が速いこと、ツール呼び出しをまとめるので手数が少なく、結果として費用も抑えやすいことを評価している。
ここが実務ではかなり大きい。コード生成AIの良し悪しは、単発の正答率だけで決まりにくい。実際には、どれだけ速く既存コードを把握できるか、どれだけ少ないやり取りで作業を終えられるか、途中で無駄な検索や確認を挟まないかが効く。CodeRabbitは、Sonnet 5.5ではSonnet 5にあった「検索に頼りすぎる傾向」や出力トークンの多さが薄れたと述べているし、Base44は平均3.6回の反復でアプリを完成させ、Opus 5の7.7回より少なかったという。これは、開発チームにとってはかなり実利がある話だと思う。AIが賢いだけではなく、やり取りの回数が減ること自体が生産性になるからだ。
もう一つ見逃せないのは、Sonnet 5.5がコード専用ではなく、知識業務でも押し上げられている点だ。GDPval-AAではOpus 5.5にかなり近く、Sonnet 5より約400点上という。Anthropicは、画像認識やコンピュータ利用でも強く、スライドやUIの「仕上げ」が上手いと説明している。社内テストでは、四半期決算資料と通話記録、テンプレートを与えて10枚の業績レビューを作らせたところ、専門家2人がそのまま送れる初稿だと判断したという。
この手の能力は、派手さはないが実務では効く。たとえば、経理、営業企画、カスタマーサポート、社内報告書のような仕事では、正しい答えそのものより、見やすく、整っていて、すぐ回せる出力が重要になる。Slack、Zendesk、Balyasny Asset Management、Unityなどのコメントも、まさにその方向を裏づけている。人間が最後に少し直せば使える、あるいは直さずに送れる、というレベルに近づくほど、AIは単なる補助ではなく作業の一部になる。
Sonnet 5.5で地味に重要なのは、安全対策の扱いだと思う。Anthropicは、サイバーセキュリティ能力がOpus 5と同程度だから、上位モデル向けのサイバーガードとフォールバックを初めてSonnet系に載せたと明かしている。生物分野のガードはSonnet 5と同じで、対象は狭い高リスク要求に限られ、通常のソフトウェア開発や大半のライフサイエンス作業には影響しないとしている。
これは、単に「強いモデルを出しました」では済まさない段階に入ったことを示しているように見える。モデルが本当に実務に入ると、性能だけでなく、どこまで危ない使い方を想定して止めるのかが問われる。しかも今回は、能力が上がったからこそ安全装置も厚くした。裏を返せば、AnthropicはSonnet 5.5を“試すモデル”ではなく“使われるモデル”として出してきたのだろう。速度とコストを削り、実務の幅を広げ、同時に制御も強める。その方向性はかなり一貫している。Opus 5.5ほど重くはないが、日々の仕事を任せるには十分に頼れる。そんな位置づけを、かなり意図的に作ってきた発表だと受け取った。