PaPoo
cover
technews
Author
technews
世界の技術ニュースをリアルタイムでキャッチし、日本語でわかりやすく発信。AI・半導体・スタートアップから規制動向まで、グローバルテックシーンの「今」をお届けします。

Reflectionが5010億パラメータの開放モデル「Beam」を出した理由

Reflectionが発表したのは、同社初のopen-weight modelである「Beam」だ。open-weightは、モデルの重みを公開して外部利用しやすくする形で、いわば“中身を触れるAI”に近い。今回の発表が目を引くのは、単に大きいモデルだからではない。コード生成、reasoning、agentic workloadsに強いとされるうえ、学習にRLをかなり大規模に使っている点が、今の大規模モデル競争のど真ん中にあるからだ。

Beamは、能力だけでなく効率でも勝負しようとしている。そう読める発表だった。

Beamがどんなモデルで、何を競おうとしているのか

Reflectionによると、Beamは5010億の総パラメータを持つsparse Mixture-of-Expertsモデルで、実際に1トークンあたり動くのは230億パラメータだという。用途として前面に出しているのは、coding、reasoning、agentic workloadsの3つ。要するに、文章をそれっぽく返すだけではなく、コードを書き、段取りを立て、外部ツールを使いながら作業を進めるタイプの仕事を狙っている。

学習ではまず、webとlicensed datasetsを合わせた23.8兆トークンでpretrainingを行った。そのうえで、RLにもかなりの資源を投じたとしている。高計算量のRLでは、10.5K台のNVIDIA GB300 GPUを4週間回し、100 millionを超えるrolloutを生成した。最大コンテキスト長は256K tokensで、学習と採点には約13億のsandboxesを使ったという。Reflectionは、これは公開ラボとしては最大級のRL実験のひとつだと述べている。

性能面では、Beamは既存の同規模級のopen base modelと比べて同等かそれ以上の結果を出し、codingやagentic tasksではGLM 5.2に匹敵し、Qwen 3.8-Maxに近づいていると主張する。一方で、raw capabilityではKimi K3のようなモデルがまだ上にいるとしているが、Beamの強みは推論時の効率だと位置づけている。たとえばadvanced reasoning benchmarksではGLM-5.2並みのスコアを、3〜4倍少ないinference computeで出したと説明する。

公開されたベンチマークには、SWE Bench Pro v2-Hardで77.2、Terminal Bench v2.1で80.1、AIME 2026で97.8、GPQA Diamondで90.5などが並ぶ。さらに、tool callingやsearch系でもAutomationBench public 37.0、MCP Atlas 78.7、BrowseComp w/ context management 77.4、DeepSearchQA w/context management 80.1といった値を示した。Beamはまだfinal red-teamingと評価中で、weights、technical report、model card、developer artifactsは今月中に公開する予定だという。

「大きい」より「効率がいい」を前面に出したのが面白い

この発表でまず面白いのは、Beamが「最強モデル」よりも「使いやすい強モデル」を狙っていることだ。最近の上位モデル競争は、どうしても総合性能の見せ合いになりがちだが、Reflectionはそこから一歩ずらして、推論時のコスト効率を強く押し出している。これは企業向けにはかなり現実的な訴え方だと思う。実運用では、1回のベンチマークで何点かより、1日に何万回回せるかのほうが重要だからだ。

特にagentic用途では、モデルの賢さと同じくらい、長い思考を何度も回せるかが効いてくる。人間の作業に近いタスクほど、1回の応答で終わらず、検索、再計画、コード修正、再実行が続く。そこで推論コストが高すぎると、性能があっても現場では使いにくい。Beamが「3〜4倍少ないcomputeでGLM-5.2級」と言っているのは、単なる自慢というより、ここを狙っているのだろう。もちろん、ベンチマークの比較条件には注意が必要で、モデルごとの実装差や評価環境の違いは無視できない。それでも、効率を主要な売りにしたのは筋がいい。

RLをここまで大きく回したこと自体が、研究のメッセージになっている

もうひとつ気になったのは、Beamの中核にあるのがpretraining以上に「高計算量RL」だと明言している点だ。RLは最近のモデル開発で重要性が増しているが、ここまで大規模に、しかも100 million超のrolloutを回した話はかなり攻めている。しかも単に量を増やしただけではなく、長いrollout、128Kではなく256K tokensの長文文脈、stalenessのある古い政策からの学習を安定させる仕組みまで話している。これは、研究とインフラの両方がないと成立しない実験だ。

私が面白いと思うのは、Reflectionがこの部分を“性能向上の背景”ではなく“製品の芯”として出していることだ。つまり、Beamは「大きく学習した結果たまたま賢い」のではなく、「RLを大規模に回せるように設計したから強い」という見せ方になっている。これは今後のopen labにとって、かなり重要な示唆かもしれない。モデルのサイズ競争だけではなく、どれだけ安定して大量のtrial-and-errorを回せるかが差になるからだ。

一方で、こうした大規模RLは再現しにくい。10.5K GPUや1.3 billion sandboxesという数字は、そのまま他社や個人開発者が追随できるものではない。だからこそ、Beamの価値はモデルそのもの以上に、「この規模のRLで何が得られるか」を見せる実験結果にあるのではないかと思う。

文章モデルなのに、検索やOCRまで自然に使うのは示唆的だ

発表のデモで興味深かったのは、Beamがtext-onlyモデルなのに、web accessがあると検索し、他のLLMを問い合わせ、OCR APIで文書を読むようになったと説明しているところだ。ここは少し重要で、モデルの“理解”がマルチモーダルである必要は必ずしもない、という現実を示している。入力や出力はテキストでも、周辺のツールを組み合わせれば、かなり広い作業ができる。

NYC Subwayのライブマップ作成や、Gemma-4のfine-tuning notebook作成の例は、その象徴だと思う。モデル単体の知識だけでなく、ドキュメントを読み、仕様を確認し、必要なコードを組み立て、場合によっては別モデルの挙動まで参照する。これがうまく回るなら、企業が欲しいのは「万能な単体モデル」より「仕事を進めるオーケストレーター」に近づく。Beamのようなモデルは、その方向をかなりはっきり示している。

ただし、ここには落とし穴もある。ツールを使えることと、現実の業務で安定して使えることは別だ。検索やOCRは便利だが、誤読や誤検索も起きる。agenticモデルが広がるほど、出力の正しさだけでなく、どのツールをなぜ使ったのかを追えることが重要になる。Beamがdeveloper artifactsやmodel cardを出すと言っているのは、その透明性を少しでも補うためだろう。私は、ここをどこまで丁寧に出せるかで評価が変わると思っている。

open-weight競争の次は、公開の仕方そのものが差になる

Beamの発表は、単なる新モデル紹介というより、open-weight陣営がどう戦うかの宣言に近い。総合性能だけならすでに強いモデルはいくつもあるが、Reflectionは「大規模RLで作った効率の良い実務モデル」という旗を立てた。これは、フロンティア競争が“賢さ”から“賢さと運用コスト”の競争に移っていることをよく表している。

同時に、open-weightである以上、公開後は評価がすぐに始まる。ベンチマークの数字が本物か、実際の企業ワークロードでどこまで安定するか、長い推論で本当に得をするのか。そこは厳しく見られるはずだ。私は、Beamが成功するかどうかは、初期の派手なスコアよりも、公開後にどれだけ“使える感じ”を保てるかにかかっていると思う。もしそれができるなら、単に大きいモデルではなく、open-weightモデルの役割そのものを少し書き換える一作になる。


参考: Introducing Beam: Reflection’s 501B open-weight model — Reflection

同じ著者の記事