モデルが小さくなったから安い、という話ではなくて、「小さいモデルでもエージェント用途に使える」と本気で言いにきているのが面白いと思った。LLMの話はどうしても「大きいほど賢い」に引っ張られがちだけれど、実運用ではそこだけ見ていても意味がない。待ち時間、コスト、失敗したときの痛さ。このへんが効いてくるので、安い小型モデルに「effort controls」が付くのは、かなり実務寄りの匂いがする。
ただ、そこで少し引っかかったのは、ベンチマークの伸びがそのまま現場の安心に直結するわけではないことだ。computer-use や command-line 系で強い、というのはたしかにわかりやすい。でも、こういう用途は一回の正解率より、むしろ変な操作をしないか、途中で迷走しないかのほうが大事だったりする。effort を抑える機能は便利そうな一方で、「どこまで考えさせるか」を開発者がちゃんと調整しないと、安いけど荒っぽい、みたいなモデルになりかねない。そこは期待と同時に、少し怖さもある。
それでも、こういう値付けの動きは歓迎したい。高性能モデルを全部の処理に使うのは、やっぱり贅沢すぎることが多い。下書き、補助、ルーチン作業、軽い自動化は、小さめのモデルが担うほうが自然だと思う。Anthropic がそこを狙っているなら、AI を「いつでも最大出力で回すもの」から「用途ごとに使い分ける部品」に寄せていく流れの一部なのだろう。実際、プロダクトを作る側からすると、そのほうがずっと現実的だ。