AIモデルを使っていて、ある日だけ急に賢く見えたり、翌日には妙に鈍く感じたりすることがある。Xで話題になっているのは、その違和感を「モデルが劣化した」と片づけず、実際にどこで差が生まれているのかを追った観察だ。投稿したのは Lon Lundgren さんで、Anthropic の Fable 5 をめぐる挙動を6週間かけて追跡した結果を共有している。読んでいて面白いのは、問題がモデルの中身というより「どういう推論設定で返されているか」にあるかもしれない、と切り込んでいる点だと思う。
Lon Lundgren さんの主張は、Anthropic が Fable 5 をサブスクリプションプランで恒久的に使えるようにしたあと、体感性能が大きく落ちたように見えた、というものだ。本人は当初、モデルが「dumber」になったと感じたが、その理由はすぐには説明できなかったという。
そこで後から測定を重ねたところ、8月は7月に比べて「thinking tokens」が大幅に少なかった。thinking tokens は、モデルが内部で推論に使う計算の痕跡のようなもので、これが少ないと一見すると同じモデルでも考えが浅く見えることがある。しかも、その差は一度きりではなかった。推論量の低下は期間全体にわたって起き、数日単位で上下しながら続いていたという。
Lon さんは、この揺れが特定のプロダクト発表やリリースと重なることもあったと述べている。つまり、何かが単純に壊れたというより、提供される条件が日ごとに変わっていた可能性を示しているわけだ。本人は xhigh あるいは max effot level を一貫して使っていたとしつつも、実際には大半の呼び出しで thinking tokens がほとんど、あるいはまったく付与されていなかったと振り返る。
さらに、長めの推論が走る場合でも、公開されている benchmark の水準にはほとんど届かなかったという。つまり、ユーザーから見れば同じ「Fable 5」を使っているつもりでも、実際に返ってきていたのは毎回同じ強さの推論ではなかった、という整理になる。Lon さんはこの6週間の収集と分析を「odyssey」と呼び、そこから驚くべき発見がいくつもあったとしている。
投稿の締めくくりも印象的だ。次にモデルが賢くないように感じたら、「nerfed されたのか」と疑うのではなく、「どの inference regime を渡されたのか」を考えるべきだ、という。ここでいう inference regime は、モデルそのものではなく、推論時にどんな設定や資源配分で動いているかを指す。要するに、見た目の性能差はモデル本体ではなく、提供側の運転のしかたで生まれているかもしれない、という問題提起だ。
この話でまず強く感じるのは、AIサービスの評価がいかに不安定な土台の上にあるか、という点だ。ユーザーは同じモデル名を見て安心するが、実際には推論時の設定や割り当てが変われば、返答の質はかなり揺れる。人間側からすると「昨日は賢かったのに今日は雑だ」としか見えないので、モデルそのものを責めたくなる。だが、Lon さんの観察が示しているのは、その不満が必ずしもモデルの劣化を意味しないことだと思う。
ここで厄介なのは、品質低下がじわじわ起きることだ。機能停止のような分かりやすい事故なら誰でも気づくが、thinking tokens が少ない状態が断続的に続くと、体感だけが悪くなる。しかも利用者は内部事情を見られないので、「性能の揺れ」をプロダクトのクセとして飲み込むしかない。これはかなり不公平だ。AIサービスの価格やプランが固定されていても、実際に得られる計算資源が固定ではないなら、契約しているのはモデルではなく“期待値”なのではないか、という疑問すら出てくる。
Lon さんの投稿で気になるのは、長い推論が走ったときでも benchmark の水準にほとんど達しなかった、というくだりだ。ここから分かるのは、公開 benchmark の数字だけでは、普段の利用感を十分に説明できないことだと思う。ベンチマークはあくまで条件を揃えた試験であって、実際のサービスは混雑、優先度、プラン、提供方針など、もっと雑多な要因に左右される。
だから、モデル比較をするときに「どのベンチマークで何点か」だけ見ていると見誤る。利用者にとって本当に重要なのは、平均点よりも、いつ使っても一定の深さで考えてくれるかどうかだ。とくに仕事でAIを使う人は、良い出力がたまたま出ることより、再現性のほうを重く見るはずだ。Lon さんの話は、そこが崩れると、モデルの評判は一気に落ちるのだと改めて示している。
この投稿が示唆しているのは、今後は「どのモデルが強いか」だけでなく、「そのモデルがどの推論条件で出てきたか」を比べないと意味が薄くなる、ということだと思う。これはかなり面倒な話だ。なぜなら、製品名の下に複数の挙動が混在するなら、レビューや口コミはすぐに食い違うからだ。ある人には神モデルでも、別の人には凡庸に映る。その差が使用環境の違いなら、単純な善し悪しの話では片づかない。
一方で、この見方はAIの運用を考えるうえでかなり重要だ。企業がモデルを導入するなら、評価対象は「このモデルは優秀か」ではなく、「この契約で、その優秀さを安定して引き出せるか」になる。言い換えると、これから価値を持つのはモデル名よりSLAに近い感覚かもしれない。モデルの賢さを信じる時代から、賢さが必要な場面で本当に賢さを出せるかを疑う時代に入っているのではないか、と思う。
Lon さんの分析は鋭いが、ここから直ちに「Anthropic が意図的に性能を落とした」とまでは言えない。投稿の範囲では、推論量が減ったことと、製品発表やリリースの時期が重なったことが述べられているだけで、因果関係の断定まではしていない。ここは大事だ。相関と原因は違う。
ただ、意図の有無とは別に、ユーザーが受ける印象はかなり深刻だと思う。内部で何が起きていたにせよ、使う側からは「同じモデルなのに日によって別物に感じる」のであれば、信頼は削られる。AIサービスは、少し速いとか少し安いだけではなく、予測可能であることに価値がある。今回の話は、その土台が見えないまま提供されている現状への不安を、かなり具体的に言語化したものとして読める。モデルの能力をめぐる議論は、今後ますます「中身」だけでなく「届け方」まで含めて見ないといけないのだろう。