生成AIの話題は、文章作成やコード補助を離れて、ついに「車を動かす」段階にまで広がっている。DrivingBenchは、その期待をかなり露骨な形で試したベンチマークだ。舞台は仮想空間ではなく、実車のToyota Corolla。しかも操作は、会話のたびに少しずつ指示を出すのではなく、コーンで組んだコースを走らせながら、前に進むたびに判断を重ねていく。安全のため人間の監督者がブレーキを踏める状態にはしてあるが、それでも「前線級の言語モデルは車をどこまで動かせるのか」をかなり直球で測ろうとしている。
DrivingBenchは、frontier language models、つまり最先端クラスの言語モデルに実車の運転をさせ、その成績を競わせる研究用ベンチマークだ。対象はcomma装備のToyota Corollaで、評価は固定されたcone course、コーンで区切られたコース上で行う。モデルにはsteering、accelerator、brakesの制御権が与えられるが、もちろん放任ではない。人間のsupervisorがいて、必要なら止められる。
このベンチマークの面白いところは、単に「走れたかどうか」ではなく、会話の流れの中で運転させる点にある。説明文では、1つの連続したchatの中で最大3回までattemptを行えるとされている。各attemptは、モデルが出した set_motion と stop_now の呼び出しが受理されたものだけを数え、結果はprogress、distance、finish time、commands、tokens・costといった指標で見られる。progress はコース中心線に沿ってどこまで進めたかを示し、しかも中心線から4m以内に収まっていることが条件になる。collisionが起きた場合は、その時点までの進捗が記録される。finish time は最初に受理された set_motion から、最後の介入までの時間だ。途中で完走できなければ DNF、Did Not Finish になる。
公開されているleaderboardでは、GPT-6 Astra Codex · medium が最上位で、1回目は49%の進捗で 67.3m、DNF、コマンド8回、1.2M tokens、$2.01。2回目で100%に到達し、134.7m、5:22、コマンド24回、6.6M tokens、$7.74 と表示されている。Claude Fable 5.1 Claude Code · medium は1回目9%、2回目10%、3回目45%で、いずれもDNF。Grok 4.6 Cursor · medium は8%、11%、10%。GPT-5.6 Sol Codex · medium も6%、6%、6%。どのモデルも苦戦していて、少なくともこのコースでは「会話がうまい」だけでは運転の完成度につながらないことがはっきり見える。
サイトには、モデルごとのrunを開いてtraceやvideoを確認できる機能もある。courseのtrajectory replayや、コースそのものを探る導線も用意されている。公開動画やフレームはprivacyのためぼかされており、研究ソフトウェアとして自己責任で使うよう注意書きもある。comma.ai、openpilot、Toyota、各モデルやチャットアプリの提供元とは無関係だとも明記されている。
まず引っかかるのは、これが通常の自動運転評価とは少し違うことだ。一般的な自動運転の話なら、センサー、経路計画、制御、安全冗長性が主役になる。ところがDrivingBenchが見ているのは、言語モデルが一連の運転タスクを、対話の文脈の中でどこまで保てるかだ。つまり、車が走った事実以上に、モデルが「状況を読んで、次の操作を積み上げる」能力を試している。だからこそ、最大3 attemptsを同じchatで回す設計が効いてくる。失敗から学ぶ様子まで含めて、モデルの振る舞いが露わになるからだと思う。
この設計はかなり意地が悪い。言語モデルは文章の中では筋が通って見えても、物理世界では一瞬の判断ミスがすぐ進捗の損失につながる。しかもここでは、progressやdistanceのような数値がそのまま残る。曖昧な「うまくいきました」では逃げられない。GPT-6 Astra Codex · medium が2回目で完走した一方、他の候補が何度走ってもDNFに留まった事実は、単発のデモよりずっと重い。モデルの賢さが、文章生成とは別の場所で試されているからだ。
もう一つ大事なのは、今回の仕組みが安全のためにかなり保守的だという点だ。人間のsupervisorがブレーキを踏めるし、そもそも固定のcone courseで、条件も限定されている。これは悪いことではない。むしろ、実車を使う以上、広い道路にいきなり出すほうが危うい。だが裏を返せば、ここで高い成績が出たとしても、すぐに一般道で通用するわけではない。
私はここに、現実的な線引きが見えると思う。最近のAIの議論は、能力があるのかないのかの二択に寄りがちだ。でも実際には、どの程度の監督があれば使えるのか、どの環境なら許容できるのかが重要になる。DrivingBenchは、その境界をベンチマークの形で示している。言語モデルが車を「運転した」と言っても、それは人間がいつでも止められる閉じた環境での話で、完全な自動運転の証明ではない。ここを取り違えると、デモの派手さだけが先行してしまう。
面白いのは、成績の横に tokens と cost が並んでいることだ。GPT-6 Astra Codex · medium の完走は 6.6M tokens、$7.74。Claude Fable 5.1 Claude Code · medium の3回目は 2.1M tokens、$1.64。単に「動いたか」だけでなく、どれだけ計算資源を食ったかまで出している。これは運転ベンチマークでありながら、同時にAI運用のコスト感覚を突きつける表示でもある。
この点は、研究者よりも実装担当者に効いてくるはずだと思う。モデルが少し良くなるだけなら歓迎されやすいが、実際のプロダクトでは遅さや費用がすぐ壁になる。車を動かすようなリアルタイム用途ではなおさらだ。たとえば、より長い思考を与えれば成績は上がるのかもしれない。しかし、そのぶん tokens が膨らみ、反応も重くなる。そこで本当に採用できるかは、正答率だけでは決まらない。DrivingBenchが金額まで載せているのは、そこを曖昧にしないためだろう。
私は、この手のベンチマークの価値は「トップがどれだけ進んだか」より、「なぜ多くが途中で崩れるのか」にあると思う。今回、上位のモデルでも完走は一部で、他は10%前後や45%止まりだった。これは単なる能力不足の一覧ではなく、言語モデルが物理的な連続制御に向いていない場面がまだ多いことを示している。どのタイミングで判断が乱れるのか、どんな指示の出し方で破綻するのか、traceを見ればかなり具体的な学びになるはずだ。
ただし、その失敗がそのまま「AIは運転できない」とはならない。むしろ、どの条件なら危険を減らせるかを知るための材料になる。固定コース、低速、監督者あり、コマンド数を追跡、コストも追跡。こうした制約があるからこそ、モデルの長所と弱点が分離して見える。実用化の道はまだ遠いが、少なくとも「雰囲気ですごそう」に流されずに、現実の制御問題として評価しようとしている点は評価したい。派手な未来図より、こういう地味な計測のほうが、結果的にAIを前に進めるのではないか。
参考: DrivingBench