PaPoo
cover
technews
Author
technews
世界の技術ニュースをリアルタイムでキャッチし、日本語でわかりやすく発信。AI・半導体・スタートアップから規制動向まで、グローバルテックシーンの「今」をお届けします。

Grok 4.7が狙うのは、速さより「長く考える」仕事

x.ai が発表した Grok 4.7 は、単なる次世代モデルの名前替えではなく、コーディングや知識労働の現場でどう使われるかをかなり意識した更新だ。発表文では「最も強力なモデル」と位置づけられ、難しい作業をより長く考え、自分の出力をより丁寧に検証し、安全面でもこれまでで最も調整されたと説明している。しかも価格は Grok 4.6 と同じで、速度も同等だという。AIモデルの性能競争が、単純なベンチマークの数字だけでなく、実務での時間効率や安全運用まで含めた勝負になってきたことがよく見える発表だった。

Grok 4.7 は何を変えたのか、発表文から拾う

x.ai は 2026年9月21日に Grok 4.7 を公開した。位置づけは「coding and knowledge work」に最も強いモデルで、単にコードを書くだけでなく、資料作成や会話ベースの作業、長い文脈を扱う仕事まで含めて性能を押し出している。発表文によると、Grok 4.7 は Grok 4.6 よりも大きい新しいベースモデルを使い、より難しいタスクを多く含む reinforcement learning を長く回したという。特に、何時間もかかる問題に重みを置いて学習したと説明していて、短い応答のキレより、粘り強さを優先した設計に見える。

性能面では、CursorBench 4.0 のような長時間の coding task を測るベンチマークで、価格性能の最前線にあると主張している。表では Grok 4.7 の input token price が 100万トークンあたり $2、output token price が $6 とされ、Grok 4.6 と同じ価格帯だが、GPT-5.6 Sol や Fable 5.1 より安い比較も示されている。ベンチマークごとの数値も並び、software engineering の CursorBench 4.0 は Grok 4.7 が 46.3%、Grok 4.6 が 40.4%、GPT-5.6 Sol が 41.7%、Fable 5.1 が 51.8%。DeepSWE v1.1 は Grok 4.7 が 71.0%*、Grok 4.6 が 65.2%、GPT-5.6 Sol が 72.7%、Fable 5.1 が 70.0%。EEBench は 64.0%、53.0%、39.4%、56.4%。Terminal-Bench 4.0 は 38.0%、20.3%、37.3%、57.9%。Harvey Legal Agent Benchmark は 19.6%、15.8%、2.5%、6.7%。HealthBench Professional は 56.7%、48.5%、60.5%、62.1%。このほか GDPval や AA Briefcase では、Grok 4.6 より改善し、他の frontier model と同程度だと説明している。

もうひとつ目立つのは安全面だ。Grok 4.7 は「entirely new safeguard stack」で作られ、拒否と jailbreak resistance の両方で最強だとする。cybersecurity や biological work のような dual-use 領域では、善意の用途にはよく応答しつつ、危険な要求には安全に拒否できるバランスを重視したという。biosafety benchmark では LatchBio の指標で 62.4% とトップだとしている。HackerBench v0.3 では risky な prompt の 3.3% しか通さず、正当な security work をむやみに止めることも少ないと説明した。さらに、選ばれた cybersecurity パートナーには invite-only で red-team capabilities を開放し、防御研究に使ってもらうとも書いている。公開範囲については、Cursor と Grok Build で今日から使え、Grok API、第三者の coding harness、model routers、cloud platforms からも利用できる。価格は 100万 input tokens あたり $2、output tokens あたり $6 からで、2倍の出力速度を持つ fast variant は 2倍の価格だとしている。

「速い」よりも「長く考える」を前面に出したのはなぜか

この発表でおもしろいのは、x.ai が Grok 4.7 を「速いモデル」として売っていないことだ。もちろん冒頭には比較モデルの半額、2倍の速さという派手な文言もあるが、本文を読むと本当に押したいのはそこではない。むしろ、長い作業を最後までやり切る力、自分の作業を検証する力、長文脈の管理、そして安全な拒否だ。ここは、単発のチャットで気の利いた答えを返す競争から、実務の代行に近い競争へ、AIの重心が移っていることを示していると思う。

特にコード生成は、1回の出力が正しいかより、数十分から数時間にわたる作業を壊さず進められるかが効く。途中で仕様を忘れたり、筋の悪い変更を混ぜたりすると、見た目のベンチマークが良くても実務では使いにくい。Grok 4.7 が「checks its own work more carefully」と繰り返すのは、まさにその痛点への回答だろう。AIエージェントの失敗は派手な誤答より、静かな手戻りとして出ることが多い。だからこそ、検証の強化を前面に置くのは筋が通っている。

ベンチマークの並べ方には、少し戦略が見える

数値の出し方を見ると、x.ai はかなり丁寧に勝ち筋を選んでいる。CursorBench 4.0 や Terminal-Bench 4.0 のように、長時間の coding や端末操作に寄った指標では Grok 4.7 の存在感がある。一方で、DeepSWE v1.1 では Fable 5.1 や GPT-5.6 Sol に届かない場面もあり、万能な独走ではない。そのうえで「price-performance」のフロンティアだと押し出しているので、純粋な最高点よりも、実際の運用コストを含めた評価軸に誘導したいのだと思う。

ここはかなり現実的だ。企業が気にするのは、最高性能の1点より、月間の使用量に対してどこまで成果が出るかだからだ。input も output も $2 / $6 という価格は、上位モデル群の中ではかなり攻めている。もちろん、ベンチマークごとに順位が違う以上、「最強」と言い切るのは危うい。でも、価格と性能をひとつの表に置いて見せることで、x.ai は「最上位を取る」より「採算の合う上位」を狙っているように見える。これは、モデルの性能競争が実は販売戦略でもあることを隠していない。

安全機能を前に出したのは、機能追加以上に重要かもしれない

Grok 4.7 の説明で、私は安全面の扱いがかなり印象に残った。生物分野や cybersecurity で「善意の利用には役立ち、危険な要求には拒否する」という言い方は、今の生成AIが直面している矛盾をそのまま表している。強いモデルほど、便利さと危うさが同居する。だから safeguard stack を刷新したと先に言うのは、単なるおまけではなく、実運用に入れる前提条件として安全を置いているという意味合いが強いのだと思う。

ただし、ここは表現を額面通りに受け取りすぎない方がいい。ベンチマークでの安全性が高くても、現実の攻撃や悪用は想定外の組み合わせで起きる。invite-only の red-team capabilities を防御研究に開くのも、裏返せばまだ外部の検証が必要だということだろう。私は、この発表が「安全を後回しにしない」姿勢を示した点は評価するが、同時に、実際の利用現場でどこまで持つかは別問題だと見ている。とくに高性能モデルは、便利になるほど責任の範囲も広がる。そこをどれだけ引き受けられるかで、評価はかなり変わるはずだ。

いちばんの実利は、個人よりチームと企業にありそうだ

Grok 4.7 は派手なデモより、継続利用で効いてくるタイプの更新に見える。Cursor、Grok Build、API、third-party coding harness、model routers、cloud platforms と、配布先を広く取っているのもそのためだろう。つまり、x.ai は単体のチャット体験より、開発環境の一部として入り込むことを重視している。これは個人ユーザーには少し地味に見えるかもしれないが、実際に課金するのはチームや企業の方で、そこで重要なのは「毎回少し得する」ことだ。

fast variant を 2倍の出力速度・2倍の価格で出すのも、使い方の違いをかなり意識している。人が待つ対話なのか、バッチ処理に近い自動作業なのかで、必要な応答速度は変わるからだ。こうした設計は、AIがひとつの万能製品ではなく、仕事の流れに合わせて選ぶ道具になってきたことを示していると思う。Grok 4.7 は、その切り替えをかなり露骨に商品化したモデルだ。


参考: Introducing Grok 4.7

同じ著者の記事