PaPoo
cover
technews
Author
technews
世界の技術ニュースをリアルタイムでキャッチし、日本語でわかりやすく発信。AI・半導体・スタートアップから規制動向まで、グローバルテックシーンの「今」をお届けします。

OpenAIはTypeSafeを食べるのか、という話

OpenAIが、TypeSafeのような新興サービスをすぐに追い抜けるのではないか。Arcturus LabsのJohn Berrymanは、そんな見立てをかなり率直に書いています。相手の中心機能が「分類」をうまくやることなら、OpenAIはすでに似たことを長くやってきたし、同じ発想を製品として前面に出せば、真似るだけでなく飲み込むところまで行ける、という見方です。単なる脅し文句ではなく、tool calling や token ごとの確率制御といったOpenAI側の積み重ねを踏まえた話なので、AI基盤モデルの競争をどう見るべきかを考える材料になります。

TypeSafeの「Jev」は、分類を前面に出したモデルとして見られている

この記事の中心にあるのは、TypeSafeの「Jev」というプロダクトです。Berrymanはこれを、従来のLLMを少し変えたものというより、「分類器」として使う新しい形のモデルだと捉えています。たとえば yes/no の質問なら、Jevは true と false の2語に相当する確率を見て答えを返す。選択式の質問なら、A・B・C・D の候補の確率分布を比べて最も高いものを選ぶ。彼はこうした発想を、以前から自分が書いてきた logprobs の使い方と近いものだと説明しています。

彼の主張は、Jevがまったく新しい魔法を使っているというより、LLMがもともと持っている「次の単語を確率で選ぶ」性質を、分類に寄せてうまく製品化したものだという点にあります。OpenAIのtool callingも、内部では似たことをやっていたと彼は振り返ります。assistant が応答を始める最初の1トークンで、自然文を続けるか、to=function. のような形でツール呼び出しに入るかが分かれる。さらに、どの tool を使うか、引数名や引数値をどう埋めるか、最後に応答を終えるかどうかまで、トークンごとの確率判断が積み重なっている。昔のGPT-4のAPIでは、<|im_start|><|im_end|> を正しく扱えず、モデルが延々と話し続けることもあった、と彼は書いています。

そのうえでBerrymanは、TypeSafeの本当の防御線はアーキテクチャではなく、データと学習手順にあるのではないかと見ます。TypeSafeの共同創業者 Diogo Almeida は、X上で「データを重視している」「100% synthetic data を使っている」と語っています。Berrymanは、もし自分なら、サポートチケットと実際の振り分け結果、履歴書と採用可否、レビューと星評価、モデレーションキューと判定結果、prediction market と実際の決着といった、答えが既に分かっている大量の例を集めるだろうと述べます。狙いは個別分野の知識ではなく、あらゆる領域にまたがって「分類を一般化する筋肉」を鍛えることです。

さらに彼は、TypeSafeにもう一つの秘密があるなら強化学習ではないか、とも推測します。ウェブサイト上のWikipediaデモやDoomデモのような、選択肢が限られた環境での判断学習です。ただし、ここは断定していません。むしろ彼が強調しているのは、性能が本当に一般的で、しかも正確でなければ、この手の仕組みには moat ができないという点です。速さや安さ、使いやすさは分かりやすいが、正確性は外から検証しにくい。しかも彼自身、すでにいくつかの領域で Jev の確率が当てにならない例を見つけたと書いています。

そのうえで、OpenAIの次の一手は二つあると彼は見ます。一つは単純にJevをコピーして、別の model type として出すこと。もう一つはもっと面白く、分類能力を通常のLLMに埋め込んでしまうことです。記事は途中で切れていますが、そこで彼は OpenAI が <prediction> のような新しいタグを導入し、モデル自身が質問に答えるための分類を内部で使えるようにする、という方向を示唆しています。

「新しいモデル」より「既存モデルへの埋め込み」のほうがOpenAIらしい

この話でいちばん面白いのは、OpenAIがもし追随するなら、単に同じ製品を出すより、既存のチャットや agent に分類機能を溶かし込むほうが自然だろう、という点です。Berrymanの見立てでは、OpenAIはもう長いあいだ、LLMを半ば分類器として使ってきました。tool calling もそうだし、応答を終えるかどうかの判定もそうです。だから「分類を前提にした新機能」は、彼らにとってまったく異物ではない。むしろ、今ある仕組みを少し広げるだけで届く場所に見えます。

ここで重要なのは、模倣の難しさが“モデルそのもの”より“学習資産”に移っていることです。アーキテクチャの見た目が似ているだけなら、大手はすぐ追いつける。ところが、どんなデータをどう作り、どう正解ラベルを整え、どう「校正された」分類に仕立てるかは、外から見えにくい。BerrymanはそこにTypeSafeの余地があると認めつつ、それでもOpenAIなら資金も計算資源も人材もあるので、十分に可能性があると言っています。私はここに、今のAI市場の残酷さが出ていると思います。プロダクトの新しさより、内部の運用力や学習管制のほうが差になりやすいのに、それがユーザーから見えないからです。

分類モデルが本当に強いなら、最初に効くのはエージェント側だと思う

Berrymanが挙げる「より面白い使い方」は、私はかなり本命に近いと思います。分類専用の外部APIとして売るより、モデル内部で「次に何をすべきか」を判定するために使うほうが、OpenAIには圧倒的に相性がいいからです。エージェントは、長い推論をずっと続けるだけではなく、途中で止まり、道具を呼び、候補を絞り、危険ならやめる必要があります。そこに高精度の分類器が入ると、モデル選択は軽くなるし、ガードレールも付けやすい。コスト削減も見込めるでしょう。

逆に言うと、TypeSafeの価値は「単独で何を返せるか」だけでなく、「他のモデルやエージェントの中で何を肩代わりできるか」にもあるはずです。もしOpenAIが似た機能を自前モデルの内部へ入れてしまえば、TypeSafeはUIやAPIで勝っていても、下流の採用で押されるかもしれません。SaaSとして見れば別製品でも、現場から見れば“標準機能”に吸収されるわけです。ここはプラットフォーム企業の強さが露骨に出るところで、Berrymanの懸念はそこにあるのだと思います。

ただし、正確性を外から証明しにくい点は簡単に片づかない

一方で、この記事が妙に慎重なのも気になります。BerrymanはTypeSafeに好意的ですし、「かなり興味深いものを見つけた」という感触も持っています。それでも、結局のところ moat を決めるのは精度だと何度も戻っていく。これが重要です。分類は派手ではないので、ベンチマークの見せ方次第でいくらでも良く見せられるし、実運用でのズレも見えにくい。しかも、分類結果が確率で返ってくると、ユーザーは数字をそのまま信用しがちです。

私はここに、LLM時代の評価の難しさがよく出ていると思います。文章生成なら間違いが目に見えるのに、分類は間違い方が静かです。ラベルを外すだけで、大きな事故ではないように見える。でも実際には、その小さなズレがルーティング、採用、審査、モデレーションの品質をじわじわ壊すことがあります。だからこそ、TypeSafe が本当に強いかどうかは、デモの印象ではなく、どれだけ広い領域で再現性を持てるかにかかっています。Berrymanが最後まで断定を避けているのは、その不安定さを分かっているからでしょう。私はその慎重さのほうに、むしろ信頼を感じました。


参考: Will OpenAI Eat Jev's Lunch?

同じ著者の記事