いちばん強く思ったのは、「小さいモデル」がやっと本当に実務の土俵に上がってきたんだな、ということです。しかも単に安いだけじゃなくて、summarization や subagent、browser use みたいな“数を回す仕事”にかなり寄せているのがはっきりしています。ここは地味ですが、実際の現場ではかなり効くはずです。
面白いのは、Anthropic がこのモデルを「賢い小型版」として売っているというより、「高頻度で使う役割を任せる部品」として位置づけているところです。大きいモデルが最終判断をして、Haiku が下調べや切り出し、雑務をさばく。記事に出てくる subagent の使い方はまさにその発想で、AI を1体の万能選手として扱うより、チームに分ける方向がかなり現実的だと感じました。
一方で、ベンチマークの見せ方には少し身構えました。グラフを見ると確かに速くて安い、しかもいくつかの評価ではかなり良い数字が出ています。でもこういう記事は、結局「どの仕事なら十分で、どこから上位モデルに渡すべきか」を読む側が自分で見極めないといけません。Anthropic 自身も Terminal-Bench のような複雑な coding は Sonnet や Opus の方が向いていると書いていて、その線引きを隠していないのは好感が持てました。逆に言うと、Haiku 5.5 は“なんでもできるから安い”ではなく、“仕事を選べばかなり強い”モデルです。
価格の話も印象に残りました。小型モデルの値下げは、単なるコストダウン以上に、AI の使い方を「たまに呼ぶ道具」から「常時流れる処理」に変えていく力があります。要するに、これで初めて回せる処理が増える。しかも cache reads の値下げまで同時にやっているので、エコシステム全体を下げにきている感じがあります。こういう値付けは、モデル性能の競争というより、運用の設計思想の競争になってきたんだなと思いました。