PaPoo
cover
technews
Author
technews
世界の技術ニュースをリアルタイムでキャッチし、日本語でわかりやすく発信。AI・半導体・スタートアップから規制動向まで、グローバルテックシーンの「今」をお届けします。

見えない駒を読むAIが、Strategoの最強人類を崩した

Strategoは、相手の駒の正体が見えないまま進む、チェスや将棋とはかなり違うゲームです。だからAIにとっては厄介で、長い間「強い人間に安定して勝つ」壁が越えられませんでした。ところが今回、Carnegie Mellon、MIT、NYU、Stanfordの研究チームがその壁を越えたと報じられています。しかも大掛かりな計算資源ではなく、限られたGPUと比較的少ない学習量でやってのけた、というのが面白いところです。

見えない駒が多すぎたStrategoで、Ataraxosはどう勝ったのか

記事が伝えている中心は、AI「Ataraxos」が Stratego のトップ人類、Pim Niemeijer に対して大きな差をつけて勝った、という話だ。成績は15勝1敗4引き分け。Niemeijer は4度の世界王者で、600週以上も世界ランキング1位にいた人物だという。研究チームにとって重要だったのは、単に勝ったことだけではない。これまで難しいとされてきた「隠された情報が多いゲーム」で、しかもかなり少ない計算資源でそれを実現した点にある。

Strategoでは、各プレイヤーが40個の駒を持つが、その中身は相手から見えない。元記事は、元帥からスパイまでの階級、さらに爆弾と旗があると説明している。勝つには相手の旗を取ればよい。だが駒の正体は、実際にぶつかるまで分からない。弱い駒が負け、勝った側の正体が明かされる。そのため、盤面の見え方が不完全なまま、何千手も先まで考える必要がある。記事では、チェスがだいたい40手程度で終わるのに対し、Strategoは2,000手に達することも珍しくないとされる。隠し情報の量も桁違いで、40個の駒の組み合わせは「decillion」を超えると書かれている。

Ataraxosの学習方法は、まず自分同士で戦わせる self-play だ。合計1億6,300万局をこなしたという。そのうえで、勝ちにつながった手は今後よく使い、負けにつながった手は減らす、という強化学習の基本に沿って鍛えた。ただし不完全情報ゲームでは、このやり方だけだと同じ場所をぐるぐる回るような学習になりやすい。そこで研究チームは、学習の序盤では戦略を大きく動かし、後半では小さく慎重に調整する設計にした。

さらに大きかったのが、手を打つ前に「相手の見えない駒が何であるか」を推測する2つ目の neural network だ。これは belief model と呼ばれ、相手の動き方を手がかりに隠れた駒の候補を推定する。Ataraxos は、あらゆる配置を総当たりする代わりに、ありそうな盤面をいくつかサンプルし、それぞれで先を読んで結果を比べる。AlphaGo のように search を使う発想に近いが、Strategoでは探索空間が大きすぎて従来は難しかった。今回、その壁を別の形で越えたわけだ。

プレイスタイルも興味深い。Ataraxos は「落ち着いていて動じない」ことから古代ギリシャ語の Ataraxos と名付けられたという。人間なら焦って大博打を打ちたくなる場面でも、AIは冷静に少しずつ巻き返す。相手に弱点を悟られない限り、その弱点を無理にいじらない、という振る舞いも見せた。研究者は、これが人間にはやりにくい「知ってしまっていることを脇に置いて判断する」ことを、機械は簡単にやれてしまうからだと説明している。記事では、勝率2%くらいのところから「かなりあっさり」逆転していく様子を人間たちが目撃した、とも書かれている。

対人戦の結果も強い。Niemeijer との20局では、彼は1勝しかできなかった。もっとも、研究者側はそれを単純な欠陥とは見ていない。Strategoでは駒の並べ方にランダム性が必要で、実力が拮抗していても運が勝敗に影響するからだ、という説明だ。さらに2025年の Stratego World Championship では、Ataraxos に挑んだ参加者が40局中38局負けた。しかも、その戦いを通じて人間側の「定跡」やメタゲームまで変わり始めたらしい。たとえば、旗を角に置き、その前を2つの爆弾で守る配置を、AIがかなり使ったという。

計算資源の少なさも、この話を特別にしている。DeepNash はGoogleの専用チップ1,024枚を2〜3か月使い、2025年価格で300万〜450万ドル相当と研究チームは見積もっている。一方 Ataraxos は16基のGPUを1週間、さらに belief model 用に4基のGPUを4日使っただけだった。学習した局数も DeepNash より約34分の1で、それでもより強かったという。研究チームは、GPU上で毎秒何百万手も回せるシミュレーターを書き、学術予算でも回る形に落とし込んだとしている。

これは「ゲームに勝った」以上に、AI研究の作り方が変わってきた話だと思う

まず、ここで起きたことは単なるゲームの勝敗ではないと思う。Strategoは、AIが苦手とする条件がかなり濃く詰まった題材だった。相手に見えない情報が多く、しかも長期戦で、さらにブラフまで入る。そんなゲームで、強い人間に安定して勝てるAIを、巨大なクラウドや専用チップの大群なしで作れたのは意味が大きい。AI研究はしばしば「計算資源を積めば何とかなる」に寄って見えるが、今回はアルゴリズムの工夫がかなり効いている。そこに価値がある。

一方で、この記事を読んで少し気になるのは、強さの中身が人間の直感から離れていくことだ。Ataraxos は「相手が気づいていない弱点を、あえて放っておく」ような判断をする。人間のプレイヤーなら、見えている危険を見過ごすのは怖いし、逆転を狙うなら感情が先に動く。AIはその手前で止まれる。だから強いのだが、同時に、何をどう読んでその手を選んだのかを人間が理解しにくい。研究者自身が「説明可能性にはまだ遠い」と言っているのは重要で、強いAIを作ることと、その判断を説明できることは別問題だと改めて感じる。

もうひとつ面白いのは、ここで使われた「相手の隠れた情報を推定する belief model」が、ゲーム以外にもそのまま移植できそうなことだ。交渉、金融市場、軍事シミュレーションのような場面では、相手が何を持っていて、何を考えているかが見えない。もちろん現実はStrategoよりずっと雑で、ルールも曖昧だ。だからそのまま当てはめるのは危険だが、相手の見えない状態を推定しながら先を読む、という骨格はかなり似ている。研究チームが「war gaming」に触れているのも自然だろう。実務に持ち込むなら、勝ち負け以上に、どういう仮説を置いて推論しているのかを検証する仕組みが必要になるはずだ。

それと、この成果は「AIの勝利」というより、学術研究でも勝てる設計を見せた点で印象が強い。DeepMindのような巨大組織でなくても、シミュレーターを書き、学習の手順を工夫し、二つ目のネットワークを足すことで、対象に合わせた強いシステムを作れる。これは研究の民主化というより、むしろ“賢い制約の使い方”の例だと思う。GPUの枚数競争だけではないところで差がつくなら、今後のAI研究は、使える計算資源をどう配るか以上に、問題設定をどう切るかが問われる。Strategoはそのことを、かなりきれいに見せた事例ではないか。


参考: With most information hidden, the game Stratego had stumped AI—until now

同じ著者の記事