まず思ったのは、「強いモデルです」と言うだけでは終わらせず、かなり細かく“使うといくらかかるか”まで前面に出しているのが、むしろ誠実だなということでした。AI の話は性能だけが独り歩きしがちですが、実際にはコストと出力量で印象がかなり変わる。そこを隠さずに並べているのは好感が持てます。
ただ、読んでいて少し引っかかったのは、賢さの指標が高いことと、実運用で気持ちよく使えることは別だ、という点がかなりはっきり見えてしまうところです。Intelligence Index が高くても、出力 tokens が多くて verbose だと、ユーザー体験としては「よく考えるけど長い」モデルになりやすい。たぶんこれは、ベンチマークで高得点を取るモデルほど起きやすい不自然さだと思います。点数は分かりやすいけれど、現場では「要点だけ返してほしい」のほうが価値が高い場面も多いはずです。
それと、1M tokens の context window はかなり目を引きました。ざっくり言えば、長い文書や大量の会話履歴を一度に抱えられるということですが、こうなると「何を覚えられるか」より「何を読ませ続けるか」の設計が重要になるはずです。大きい箱があるだけでは使いこなせない。むしろ、コンテキストを埋め尽くしても破綻しないか、そこに実務上の価値が出るのかが気になります。
このページを見ていて一番面白かったのは、AI の性能評価がもはや単なる能力テストではなく、コスト・速度・長文処理・信頼性を同時に見ないと意味がない段階に来ていることです。昔なら「賢いかどうか」だけで話せたのに、今は「賢いが高い」「長文は得意だが長い」「速くはないが考え込む」みたいな比較になっている。モデル選びが、かなり人間の道具選びに近づいてきた感じがしました。