AnthropicのClaude Opus 5.5を、Artificial Analysisがベンチマークと価格の両面から分析した記事だ。単に「賢い」と言うだけではなく、どれくらいの料金で、どれくらいのトークンを使って、どの程度の速度で動くのかまで見ているのがポイントになる。大規模モデルは性能だけでは選べないので、この手の比較は実運用を考える人ほど気になる。今回の結果は、最上位級のモデルらしく能力は高い一方で、使いどころを選ぶタイプだと示している。
Artificial Analysisによると、Claude Opus 5.5は「Adaptive Reasoning, Max Effort, Default Fallback」という理由づけのある推論版のモデルで、表示上はAnthropicのProprietary modelとして、Released September 2026とされている。入力はtextとimageに対応し、出力はtextのみ。文脈長は1M tokensで、およそ1500ページ分のA4・12ptに相当すると説明されている。
性能面では、Artificial Analysis Intelligence Indexで58点を獲得し、210モデル中1位とされている。記事はこれを「平均を大きく上回る」と評価しており、同クラスのモデルの中央値が25点であることも併記している。つまり、少なくともこの基準ではかなり強い。いっぽうで、ベンチマーク中の出力量は260M output tokensとされ、中央値の88Mよりかなり多い。これは、単に答えが長いというより、推論にかなりトークンを使う設計であることを示している。
価格は、入力が1M tokensあたり$4.00、出力が1M tokensあたり$20.00。どちらも記事では「somewhat expensive」とされ、中央値はそれぞれ$2.00と$10.00だ。Cache Discountは95%で、キャッシュを使えばかなり安くなる余地がある。Artificial Analysisの計算では、Intelligence Indexの1タスクあたり平均コストは$5.98。コストランキングでは93位で、性能順位と比べるとかなり下がる。要するに、賢いが安くはない。
また、速度についてはこのページでは出力tokens per secondがUnknownで、SpeedはN/A扱いになっている。つまり、少なくともこの表示だけでは速度比較はできない。記事はモデル比較の枠組みも説明していて、Artificial Analysis Intelligence Index v4.3.2はAA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1の10評価で構成されるとしている。
このモデルでまず目を引くのは、1M tokensのcontext windowよりも、むしろその長さを前提にした使い方のほうだと思う。1Mあれば長文の資料や大量のログを一気に読ませられるが、実際には「入る」ことと「効率よく扱える」ことは別だ。Artificial Analysisの結果では、Claude Opus 5.5はかなり多くの出力トークンを使っている。これは丁寧さにも見えるし、慎重さの表れにも見えるが、運用側からすると請求額にも直結する。長い回答が悪いわけではないが、用途によっては過剰になるはずだ。
ここで重要なのは、モデルの賢さをそのまま“お得さ”だと思い込まないことだ。ベンチマークで上位でも、1タスクあたり$5.98なら、雑に大量実行するワークロードには向かない。逆に、失敗コストが高い仕事、たとえば契約書の読解、重要な調査、複雑な社内ナレッジ検索のような場面では、少し高くても採用する意味がある。高いけれど、使う場面を絞れば筋が通るモデルだと見ている。
今回の記事で少し気になったのは、速度の欄がN/Aになっていることだ。Artificial Analysisのページは本来、性能だけでなくtokens per secondやtime to first tokenも見比べられるのが売りだが、このページではその数値が出ていない。つまり、少なくともこのモデルについては、現時点で「どれだけ速いか」を同じ粒度で評価しにくい。性能1位という派手な数字に目を引かれやすいが、実際のプロダクトでは待ち時間が長いと一気に体験が悪くなる。
私はここに、最上位モデルのよくある弱点が出ていると思う。推論を厚くすれば、回答の質は上がりやすいが、そのぶん遅さやコストがついて回る。特にチャットUIでは、数十秒待たされるだけでユーザーは別の選択肢に逃げる。だから、研究用途や社内の高付加価値業務では輝いても、一般向けの軽い対話には向きにくい。Artificial Analysisがコストだけでなく速度も並べているのは、そのトレードオフが本質だからだろう。
入力$4.00、出力$20.00という数字は確かに高い。ただ、現場で本当に効いてくるのは、キャッシュディスカウントが95%あるという記述かもしれない。RAGや定型ワークフローのように、同じプロンプトや同じ前提情報を何度も使う場面では、キャッシュがあるかないかで総額がかなり変わる。逆に、毎回まったく違う入力を投げる使い方では、この恩恵は薄い。
この点でClaude Opus 5.5は、単純な「高いモデル」ではなく、運用設計とセットで価値が決まるモデルだと思う。高性能モデルをそのまま雑にAPIへ投げると高くつくが、入力の再利用や前処理をきちんと組めば、かなり現実的なコストに落ちる可能性がある。つまり、モデルそのものより、使う側のアーキテクチャが試される。最近のAI導入で本当に差がつくのは、モデル選定よりもこの部分ではないか。
Artificial Analysis Intelligence Indexで1位というのは強い肩書きだが、それを万能の証明と受け取るのは違うと思う。記事自体も、知能指標や各種評価を分けて見せている。AA-Briefcase、GDPval、AutomationBench、Terminal-Bench、SciCode、Humanity’s Last Examなど、評価系が多様なのは、AIの強さが単一尺度では測れないからだ。Claude Opus 5.5は総合力で強いが、だからといって全業務を置き換えるわけではない。
むしろ、このモデルは「難しい仕事を任せる候補」として見るのが自然だ。たとえば複雑な推論、長文の整合性確認、知識密度の高い文章生成では頼りになるだろう。一方で、安価な分類や大量処理には過剰だ。性能が高いモデルほど、使いどころを間違えると無駄が目立つ。Claude Opus 5.5はその典型で、最高峰だからこそ、雑に使うと持ち味を殺してしまう。強さは疑いにくいが、採用判断はかなり慎重であるべきモデルだと感じる。