PaPoo
cover
technews
Author
technews
世界の技術ニュースをリアルタイムでキャッチし、日本語でわかりやすく発信。AI・半導体・スタートアップから規制動向まで、グローバルテックシーンの「今」をお届けします。

トークンは電気代みたいに安くなるのか

生成AIの利用料金は、ここ1〜2年でずいぶん下がったように見える。ただし「モデルの利用料が下がった」という話と、「実際に仕事1件を終えるまでのコストが下がった」という話は少し違う。jyn の記事は、その差を埋めるために、GPU、推論エンジン、モデル構造、そして用途を絞ったAIまでを一つずつ並べて、「トークンは電気代並みに安くなる」という見立てを組み立てている。単なる楽観論ではなく、どこで安くなっているのかを分解して見せるのが面白い。読んでおくと、今後のAIサービスがどこで儲けようとしているのかも見えやすい。

料金だけでは見えない、AIの“使うコスト”の下がり方

記事はまず、AIの価格低下が本当に起きているのかを疑うところから始める。著者は、AIを大きく分けて proprietary なモデルと open weight のモデルに分け、さらに open weight を hosted と local に分けて考えるべきだと言う。というのも、改善の効き方がそれぞれ少しずつ違うからだ。

全体に効く変化として最初に挙げるのが GPU だ。GPU 自体の電力効率は世代ごとに上がっていて、記事ではおよそ2年で効率が倍になるペースだと説明している。次にモデルの価格だが、ここで著者が強調するのは「1トークンあたりの値段」ではなく「1つの仕事を終えるまでのコスト」だ。小さなモデルはトークン単価が安くても、同じ仕事をするのに余計なトークンを使うことがあるため、実際のタスクコストで見ると事情が変わる。2025年の前半・中盤・終盤を比べる図では、モデルはより賢く、より安くなっていき、2026年の図ではコスト面がさらに2桁ぶん下がった、と著者は見る。

推論エンジンの改善も大きい。vLLM は 2024年9月の 0.5.4 から 2025年12月の 0.11.1 までの間に、15か月で約40%の効率向上があったとされる。NVIDIA では MLPerf の 2.0 から 2.1 で最大50%の効率改善、Intel でも 6.0 から 6.1 でスループットが2.4倍になった例が示される。つまり、モデルだけでなく、動かし方そのものも急速に洗練されている。

さらに hosted AI 側では、Mixture-of-Experts(MoE)が効いてくる。これは必要な部分だけを動かす仕組みで、同じ品質をより少ない計算で出せる。記事では、6B から 0.8B へ、7倍小さくして同等のベンチマーク性能を出した例が引かれている。local AI 側では Mamba が重要になる。これは入力をすべて記憶する従来型の transformer と違い、情報を圧縮した形で保持するため、必要な RAM をかなり減らせる。著者は、Nemotron-H-47B が 32GB の VRAM で100万トークン超を扱える一方、同等級の Llama-3.1 60B では約120GB 必要だと紹介している。

最後に、用途を極端に絞った AI の例として TypeSafe AI の「Jev」と「Laya」が出てくる。Jev は文章を生成せず、選択肢のどれが正しいかだけを返す仕組みだ。価格は入力トークンが $0.042 / MTok、出力トークンは無料で、著者は「100億トークンあたり42ドル」と言い換える。jgrep はその低価格を前提に、行を流し込みながら高速に判定するツールとして紹介されており、200msほどで確率を返し、1000分の1セント級のコストでパイプに差し込めるとされる。著者はこれを、AIが「高価な会話相手」から「常駐する部品」へ変わる兆しとして読んでいる。

「安いからたくさん使う」は、本当にどこまで進むのか

この記事で一番おもしろいのは、単に「安くなった」と言わず、安くなると何が起きるかまで Jevons paradox を使って考えているところだと思う。供給側では、GPU、推論エンジン、MoE のような設計改善で、同じ品質を出すコストが下がる。だが現実には、事業者はその分を節約して終わらせない。もっと長い推論をさせたり、もっと高品質な出力を求めたりして、節約分を再投資するはずだ。だから「1トークンあたりの効率」がそのまま利益になるとは限らず、「同じ電力でどれだけ良い仕事をこなせるか」が競争軸になる、という見方には説得力がある。

ただ、ここで少し立ち止まりたくなる。著者の見立てはかなり強気で、トークンが電気代並みに安くなる未来を前提にしているが、安さが広がるほど、結局は品質の差と運用の差が目立つようになるはずだ。安いモデルが増えるほど、差別化は「何でも答えられるか」ではなく、「どの場面で誤りにくいか」「どこまで責任を持てるか」に寄っていく。つまり、コスト競争の先には、モデル価格ではなく信頼性の競争が来るのではないかと思う。

hosted AI と local AI が、同じ方向に進んでいるようで違う話でもある

記事は hosted AI と local AI を並べて論じているが、この2つは似ているようで、事業としてはだいぶ違う。hosted 側は MoE や推論エンジンの改善で、サーバー上の処理を安くしていく話だ。一方 local 側は、RAM をどれだけ節約できるか、どれだけ狭いハードウェアで回るかが本質になる。つまり、片方はインフラコストの圧縮、もう片方は端末への配布可能性の拡大だ。

ここは、企業にとってかなり重要だと思う。hosted AI は、使えば使うほどクラウド費用が積み上がるので、導入が進むと同時に「誰が請求を負担するのか」という問題が必ず出る。逆に local AI は、初期設定や fine-tune の手間が重い代わりに、ランニングコストを抑えやすい。記事の Laya のように「コードベースとしてのAI」は、製品というより道具箱に近い。そこに価値を感じる人は確実に増えるだろうが、万人向けにはならないはずだ。私はここに、AIの普及が“便利なクラウド”と“面倒だが安いローカル”に分岐していく予兆を見た。

いちばん現実的なのは、AIが文章生成ではなく“判定”に広がることかもしれない

Jev の例が示しているのは、生成AIの本丸が文章を書くことだけではない、という点だと思う。世の中には、「長文を作る」より「これは通すべきか、止めるべきか」を判断する場面のほうがずっと多い。PR の優先順位づけ、危険な shell command の検出、タイトルの分類、ログの仕分け。そういう用途なら、出力が自由文である必要はない。むしろ、確率ひとつ返してくれたほうが扱いやすい。

ここは実務にかなり効く。生成モデルは、どうしても余計な文章を生む。ところが判定モデルは、出力の形を縛ることで安く、速く、組み込みやすくなる。jgrep のようにパイプへつなげる発想は、AI を「画面の向こうのチャット」に閉じ込めない。私は、この流れが本当に広がると、AI の主戦場はチャットUIではなく、開発ツールやワークフローの裏側になると思う。見えないところで毎分何千回も判定している、そんな使われ方のほうが自然だ。

それでも、安くなること自体はゴールではない

記事全体は、コストが下がる根拠をかなり丁寧に積み上げている。ただ、最後に残るのは「安さは普及の条件であって、価値そのものではない」ということだと思う。トークンがいくら安くなっても、誤答が多ければ使えないし、設定が難しければ現場には入らない。逆に、少し高くても、確実に動き、導入しやすく、責任の所在が明確なら選ばれる。

だからこの文章は、AI が安くなる未来をただ祝っているわけではない。むしろ、安さが当たり前になったあとに、何が残るのかを先回りして見ているように読めた。モデル単価の話は派手だが、最終的に効くのは、ワークフローに溶け込むか、端末で回るか、そして間違えたときにどれだけ痛いかだろう。電気代並みに安いAIが本当に来るとしても、それで価値の中心が消えるわけではない。むしろ、使い方の粗が目立つ時代になるのではないかと思う。


参考: tokens too cheap to meter

同じ著者の記事