Anthropicが新しい大規模言語モデル「Claude Opus 5.5」を公開した。単なる上位モデルの更新ではなく、コード作成や業務支援の現場で「かなり強いのに、かなり安く動く」と打ち出しているのが今回の話だ。しかも同社は、性能の話だけでなく、安全性の評価結果まで前面に出している。AIモデルの競争が、単純なベンチマークの点数争いから、実務でどれだけ使えるかに移ってきたことがよく見える発表だと思う。
Anthropicは2026年9月22日、Claude Opus 5.5を「新しいClaude 5.5ファミリーの最初のモデル」として発表した。説明によると、このモデルは多くの作業でClaude Fable 5.1と同等の水準に達しつつ、Opus 5よりも通常の負荷では40%安く運用できるという。今回のリリースは、Anthropicが「frontierを急ぎすぎない」と呼びかけてから最初の公開モデルでもあり、外部評価者として Frontier Design と METR が事前テストに参加した。
性能面では、Opus 5.5は「Opus 5から大きく前進した」とされ、初期テスターは最も複雑な作業で大きな改善を見たという。たとえば、あるテスターは68万行のコード移行を1日未満で終えたとされ、通常ならエンジニアチームで数週間かかる仕事だったとしている。別の例では、Webアプリ全体の読み込み時間を短くするよう依頼したところ、40回中39回成功し、Opus 5が見せた改善よりも副作用が少なかったという。ゲーム制作のテストでも、1つのプロンプトから作らせた場合に、グラフィックや仕上がりの良さで他のモデルを上回ったと説明している。
安全性については、同社の自動行動監査で過去最高の結果を出したとされる。これは、何千ものシミュレーション場面でClaudeを試し、境界を越えた行動や取り返しのつきにくい操作をしにくいかを確かめる仕組みだ。Prompt injection、つまり外部からの指示の混入にもOpus 5より強いという。さらに、長いタスク、実行不可能なタスク、実際の事故を模した場面まで評価範囲を広げたと説明している。ただし限界はあるとも明記している。
一方で、Bioとcybersecurityの能力はClaude Mythos 5.1に匹敵するとして、Opus 5.5にはClaude Fable 5.1に近い保護策を適用する。生命科学の研究に使うには認定組織向けの Life Sciences Verification Program に申請が必要で、今後は Cyber Verification Program も拡大する予定だという。価格面では、入力トークンが100万あたり4ドル、出力トークンが100万あたり20ドルで、Opus 5より20%安い。Cache reads は100万トークンあたり0.20ドルで60%下がり、Cache writes は5ドルだ。さらに出力はOpus 5より30%以上速いとされる。加えて、Pro、Max、Team、seat-based Enterpriseでは5時間の使用上限が引き上げられ、サブスクユーザーは「使いたいときに使える」リセット枠も保存できるようになった。
ベンチマークでは、agentic coding、computer use、knowledge workで最上位だと主張する。Terminal-Bench 4.0 は66.4%、FrontierCode v1.1 は54.4%、CursorBench 4.0 は57.8%、GDPval-AA v2.1 は1846、AutomationBench は40.0%、Humanity’s Last Exam は67.7% with tools、Terminal-Bench-Science 0.1 は58.7%、OSWorld 2.0 は81.8% partial、Chartography は89.0% with tools だ。とはいえAnthropic自身も、こうした差は実世界では読みづらくなっていると書いている。実務でよりはっきり効くのは効率で、たとえば200,000行のコードベース監査と修正を3時間未満で終えた例や、HAProxyのCからRustへの移植でFable 5.1より短時間かつ51%安く済んだ例を挙げている。GitHub、Clio、Lovable、Quantiumなどの初期テスターも、少ないトークンと少ないステップで作業が進んだと語っている。
この発表で目を引くのは、単に「新モデルが強い」と言って終わっていないところだと思う。Anthropicは、Opus 5.5が多くの作業で強く、しかも40%安いと繰り返し押し出している。ここで重要なのは、AIモデルの価値が「最高点」ではなく「総コスト」で決まる場面が増えている、という事実だ。コード修正やエージェント的な作業では、モデルの出力品質だけでなく、何回やり直すか、何トークン使うか、待ち時間がどれだけ短いかがそのまま現場の収支に効く。Anthropicが前面に出しているのは、まさにその部分だ。
私が面白いと思うのは、ベンチマーク上の僅差より、実例のほうがずっと説得力を持っている点だ。68万行の移行や20万行の監査という数字は、派手ではあるが、単なる競争用の点数ではない。大きなコードベースを抱える会社にとっては、これが丸ごと一日や半日の差になる。モデルの優劣が「賢いかどうか」ではなく「人間の一週間を何日削るか」に変わってきた。これはかなり実務的な転換だと思う。
Anthropicは安全性の説明にもかなり紙幅を割いている。これは当然で、コードを自律的に触れるモデルが強くなるほど、間違った変更や暴走のリスクも上がるからだ。特に今回は、Prompt injectionに強いこと、取り返しのつきにくい操作をしにくいことを強調している。自動化されたエージェントは便利だが、外部の文面に引っ張られると、意図しない動きをする。そこをどれだけ抑えられるかは、実運用でかなり大きい。
ただ、ここで少し気になるのは、Anthropicが「生物学やサイバーセキュリティでは高い能力がある」と見て、Fable 5.1相当の制限を付けていることだ。つまり、性能が上がったから全面開放、ではない。むしろ逆で、強くなったからこそ検証済みの組織だけに段階的に開く。これは慎重で筋が通っている一方、モデルが現場で本格的に使われるほど、アクセス設計そのものが製品価値になることも示している。AIの競争は、性能表だけでは終わらない。
今回の発表を読むと、Anthropicは単発の小さな補助より、長時間・多工程・複数リポジトリにまたがる仕事を取りにいっているように見える。GitHub Copilot CLIやVS Codeでのテスト、Clioの18時間超の無人稼働、Lovableの少ないステップでの実装、Quantiumの4日分が3時間に縮んだという話は、その方向をはっきり示している。ここでのターゲットは「ちょっと便利なチャット」ではなく、「一人の開発者が一晩預けておける作業相手」だ。
これは開発現場にとってかなり大きい。人間が細かく指示し続ける前提のAIは、結局オーバーヘッドが高い。けれど、長いタスクをまとめて処理できるなら、プロンプトの回数も確認の回数も減る。逆に言えば、モデルの価値は「回答が正しいこと」より「途中で迷子にならないこと」に寄っていく。Anthropicが「it writes the way I do」といった感想を拾っているのも象徴的で、これは会話のうまさというより、仕事の進め方が人間に近いことを褒めているのだと思う。
Anthropicは自分たちのベンチマークで首位だと示しつつ、同時に「このレベルではベンチマーク差は現実の差を測る指標として以前ほど頼れない」とも書いている。ここは正直で、かなり重要な一文だと思う。大規模モデルの比較は、点数が少し上でも、実際の仕事では別のモデルとあまり変わらないことが増えている。だからこそ、効率、待ち時間、失敗時の修正コストが効いてくる。
私の見方では、Opus 5.5は「最高性能を更新したモデル」というより、「高性能モデルを、現場で払える値段に近づけたモデル」だ。しかも、ただ安くしたのではなく、速度も上げている。これは開発者や企業にとってかなり扱いやすい。反面、ここまで強いモデルが安くなると、使える人と使えない人の差は性能差ではなく、運用や権限管理の差になる。AIの競争は、モデルの賢さの戦いから、組織がそれをどう管理できるかの戦いへ移っていくのではないかと思う。