価格を20%下げた、という話だけなら普通は「使いやすくなったな」で終わる。でもこの記事を読んで引っかかったのは、そのあとにある“静かに別のモデルへ回されることがある”という部分だった。ここ、かなり重要だと思う。
LLMのAPIを使うとき、開発者が本当に欲しいのは単なる返答ではなく、「このモデルをこの条件で使った」という再現性だ。ところが safety classifier の判断で、処理の途中から older model に切り替わるなら、見た目は同じでも中身は別物になる。エージェント開発って、タスクを分解して長い手順を回すぶん、どこかで挙動が変わると原因追跡が急に難しくなる。安くなったのに、デバッグコストが上がる可能性があるわけで、そこは素直に喜びにくい。
それでも、こういう話が表に出てくるのは悪くないとも思った。AI の品質って、ベンチマークの数字だけでは見えない。実運用では「どのモデルが、どの時点で、なぜ選ばれたか」がかなり効く。今回の件は、モデルの性能競争が進むほど、モデルそのもの以上に“ルーティングの透明性”が重要になる、と突きつけている感じがした。