Anthropic が小型モデルの新版「Claude Haiku 5.5」を公開した。単に“軽いモデルを更新しました”という話ではなく、速度、価格、実務での使い道をかなり前面に出した発表だ。要するに、安くて速く、しかもそこそこ賢いモデルを、まとめ処理やサブエージェント、ブラウザ操作のような大量処理向けに押し出している。大きなモデルが主役になりがちな生成AIの話の中で、こうした小型モデルの強化は現場の使い勝手を左右するので、見過ごしにくい。
Anthropic は Claude Haiku 5.5 を「これまでで最も安く、最も速く、最も能力の高い小型モデル」と位置づけている。狙いは、高頻度で回す仕事やコストに厳しい仕事だ。例として挙げているのは、要約、コンパクション、データベースへの問い合わせ、分類のような反復作業で、コード作業では Opus 5.5 や Sonnet 5.5 のサブエージェントとして使うと相性がいいとしている。さらに、同社はこれを「これまでで最速のモデル」とも説明していて、ライブチャットの顧客対応や browser use のように遅さが体験を悪くする用途にも向くと述べている。
価格面では、Haiku 4.5 と比べてかなり安いとされる。本文では平均すると約 75% 安く動かせるとしており、脚注では 100,000 tokens 以下のリクエストでは Haiku 4.5 より 90% 安く、100,000 tokens を超える場合は 50% 安いと説明している。加えて、今回の発表ではモデル群の使い勝手を広げる調整も入った。Claude Sonnet 5.5 の cache reads は半額になり、Most agentic work ではおよそ 20% 安くなるという。さらに、Claude Max と Team の加入者向けに毎月の API credit も新設され、Claude Platform 上で新しい agent やアプリを作るための後押しにする、としている。
性能の説明では、いくつかの benchmark が並ぶ。Knowledge work の GDPval-AA v2.1 では 1620、AA-Briefcase v1.1 では 1578。Computer use の OSWorld 2.1 では 72.4%。Multidisciplinary reasoning の Humanity’s Last Exam は tools なしで 45.9%、tools ありで 57.4%。Agentic coding の Terminal-Bench 4.0 は 39.2%、FrontierCode 1.1 (Main) は 46.4%。Visual reasoning の Chartography は tools なしで 46.4% だった。Anthropic は、Haiku 5.5 が初めて adjustable effort setting に対応した Haiku クラスのモデルだとも書いている。これは、コスト寄りか intelligence 寄りかを用途に応じて選べる仕組みだ。
実利用の感触としては、Asana、HubSpot、AlphaSense、Box、Rogo、Cognition などの初期テスト結果も紹介されている。たとえば Asana は、AI Teammates の評価で以前のモデルより task completion の latency が 30% 以上減り、1 agent turn あたりの inference が最大 2.5 倍速くなったと述べている。HubSpot は CRM タスクで 92.8% の平均スコアを記録したとし、AlphaSense は 400 queries のテストで Haiku 4.5 より有意に良い 0.84 を得たとしている。Box は latency が約半分で 11 点上回ったといい、Rogo は 10-K から必要な行を拾うような短くて大量の仕事に向くと説明する。Cognition も、Devin Fusion の sidekick としてコストと latency を抑えながら高いスコアを維持できると述べた。
安全面では、Haiku 4.5 より alignment が改善し、misaligned behavior が減り、悪用に協力しやすい傾向も下がったとする。一方で cyber security の safeguard は、Haiku 4.5 よりは厳しく、最近の上位モデルよりはやや緩い。防御的な作業はある程度認めるが、penetration testing のような攻撃に転用されやすい手法は止める、という立て付けだ。biology については Sonnet 5、Sonnet 5.5、Opus 5 と同じ guardrail を採り、研究用途は認めつつ、害につながりそうな依頼は制限する。利用開始はすでに可能で、AWS、Google Cloud、Microsoft Azure、そして Claude Platform で使える。開発者向けには browser use と computer use の beta 対応も SDK に追加される。
今回いちばん興味深いのは、Anthropic が Haiku を“廉価版”として置いていない点だと思う。小型モデルはしばしば、性能が足りないときの妥協案として扱われる。でも Haiku 5.5 は、要約や分類、サブエージェント、browser use のような仕事にかなり明確な役割を与えられている。しかも benchmark を見ると、単に速いだけではなく、OSWorld や GDPval でも実用域に入る数字を出している。ここで重要なのは、会話のうまさではなく「大量に回せること」だろう。
実務では、最も高価なモデルを毎回呼ぶのは無理がある。見積もり、社内検索、顧客対応、ログ整理のような処理は、数が増えた瞬間にコストが跳ねる。だから現場は、賢さよりも latency と単価でモデルを選ぶ場面が多い。Anthropic はそこを正面から取りに来ている。Haiku 5.5 が刺さるのは、最先端ベンチで 1 位を取るからではなく、十分な精度を保ったまま“常用できる”からではないか。モデル競争が大型化の一辺倒ではなく、運用のしやすさに軸足を移していることがよく分かる。
本文で地味に効いているのが、Sonnet 5.5 の cache reads 半額化だ。新しい小型モデルの発表なのに、同時に中位モデルのランニングコストまで下げている。これは単発の新製品投入というより、Claude ファミリー全体の価格体系を組み替えている動きに見える。Haiku 5.5 を安価な実働要員として置き、Sonnet 5.5 を少し複雑な判断や agentic work に回し、必要なら Opus 5.5 をより重い作業に使う、という分担が見えやすくなる。
この構図はユーザーにとって分かりやすい。どのモデルを使うかを、能力の優劣だけで決めなくてよくなるからだ。実際の開発では、速度が必要な下請け処理と、考え抜く必要がある中核処理が混ざる。そこで Haiku が下回りを引き受け、Sonnet が中間層を担い、Opus が難所に入るなら、設計はかなり組み立てやすい。逆に言えば、Anthropic は自社モデルを“全部同じように賢い”方向には寄せていない。役割分担を固定しにいっている感じがある。これは利用者には便利だが、モデル選定を雑にすると逆に損をする作りでもある。
Haiku 5.5 が browser use と subagent に強いと繰り返している点も、かなり今っぽい。昔のAI紹介は、文章生成や対話の上手さを中心に語られがちだった。でも実際の現場では、ひとつの長い回答より、複数の短い処理を並列に回す方が価値を生みやすい。Web を見て、フォームを埋め、情報を拾い、別のモデルが最終判断をする。そういう分業の一部として小型モデルが動く。Anthropic はそこに Haiku をはめ込もうとしているように見える。
この方向性は、AI が「考える道具」から「作業員の一人」へ変わっていく流れとも重なると思う。ブラウザ操作は一見地味だが、実装が難しい。遅いモデルでは待ち時間が積み上がり、安くないモデルでは採算が合わない。だからこそ、速くて安い Haiku に出番がある。初期テストで Asana が latency の改善を強く評価しているのも自然だ。ここで勝つのは、会話の巧さではなく、仕事の流れを止めないことだろう。AI の価値が「回答の質」だけでなく「処理の連続性」に移っていることを、この発表はかなりはっきり示している。
面白いのは、Anthropic が安全面の記述をかなり丁寧に置いていることだ。性能が上がるほど、小型モデルでも危険な依頼に使える場面が増える。だからこそ、単純に「安い小型モデルです」で済ませず、cybersecurity の制限や biology の扱いを細かく説明しているのだろう。Haiku 5.5 は上位モデルより制限がやや緩いが、攻撃に使いやすい手法は止める、という中間的な位置づけになっている。
これは製品戦略としては妥当だと思う一方、利用者には少し難しい局面もある。企業は安くて速いモデルを業務に組み込みたいが、用途によっては guardrail が思ったより強く働く。特に security や life sciences のような分野では、モデルの性能よりも「どこまで許されるか」の方が実装上の論点になる。Anthropic が検証プログラムを用意しているのも、その複雑さを前提にしているからだろう。結局、モデルが強くなるほど、単なる API ではなく、運用ルール込みの製品として見ないといけない。Haiku 5.5 の発表は、その現実をかなり率直に示している。