AIラボが次に本気で資金を入れるべき先は、必ずしも新しいベンチマークでも、派手な生成機能でもない。英国の歴史学者・科学史家であるBenjamin Breenは、最前線のモデルを歴史研究に当てた実例をもとに、そう主張している。彼が見ているのは、AIが「文書の書き起こしを手伝う」段階を越えて、未解決の歴史問題そのものに食い込めるようになってきた、という変化だ。この記事は、その変化がどこまで本物なのかを、具体例で確かめようとする試みでもある。
Breenは、2024〜25年ごろに比べて状況がかなり変わったと述べる。きっかけは、今週発表されたGPT-6 SolとOpus 5.5だ。彼はこの2つを使い、単なる「研究補助」ではなく、実際に歴史上の未解決問題を解かせようとした。その結果、歴史研究者が少人数のグループでフロンティアモデルと組めば、かなりの数の新発見や解釈の更新が生まれるのではないか、という見通しに至っている。
ただし、どんな歴史テーマでも向いているわけではない。Breenは、AIが力を発揮しやすい条件を挙げる。すでに専門家が問題を定義していること、必要な資料がデジタル化されていること、多言語推論や大量資料の横断検索のような「尖った能力」が生きること、専用コードを書けること、そして何より、答えがはっきり証明または反証できることだ。だからこそ、暗号解読やコードブレイク、翻訳をまたぐテキストの照合、別々の分野に散らばった知見をつなぐ作業が有望だとする。
実例として、彼はGPT-6 Astraを使って、Isaac Newtonがフランス語の錬金術文献からラテン語へ自由に訳した一節の出典を特定できたと書く。さらに、1941年のドイツ軍の暗号文を破った事例では、モデルが暗号そのものよりも、ドイツ連邦公文書館にあった関連資料のまとまりを見つけ出したことが突破口だったという。人間の専門家でさえ、モデルがどうやってその情報を集めたのか完全には追えていないらしい。
Breen自身も、John Deeの暗号写本『Liber Loagaeth』をGPT-6 Astraにかけてみた。モデルの結論は、これは暗号文というより、ほぼ意味のない音節の連なりだ、というものだった。ただ、そこからも面白い成果はあった。文字の反復パターンを自身の数学的分析と日記記録で照合し、ある時期から書き手が手を抜いて繰り返しを増やしたらしいことを示したうえで、断片の一部に「Bornogo」という天使名への言及を見つけた。大発見ではないが、専門知とフロンティアモデルを組み合わせる価値はある、と彼は見る。
その後も試行は続く。第二次大戦・第一次大戦の暗号文は当たりが少なく、別の方向に移る。Charles Darwinのノートと著作をたどり、進化論に関する情報がどの人物から入ったのかを探る作業だ。これはGPT-6が自発的に提案したテーマでもあり、Darwin Correspondence Projectのような丁寧な人力アーカイブ整備が土台にあるからこそ成り立つ、とBreenは言う。さらにSamuel Hartlibの膨大な文書群では、Opus 5.5が5000件超の一次資料を落とし込み、Google Booksなどをまたいで匿名の出典を洗い出そうとしている。NewtonとHartlibが同じ「Hungarian vitriol」を別の形で記していた、というような細部まで拾い上げているのが興味深い、と彼は書いている。
この記事でいちばん重要なのは、BreenがAI万能論に寄っていない点だと思う。彼はむしろ、歴史研究のうちAIに向く仕事をかなり狭く定義している。そこが誠実だ。資料がデジタル化されていなければ始まらないし、答えが証明できないテーマでは、モデルの出力は「もっともらしい仮説」に留まりやすい。人文学ではこの線引きが曖昧になりがちだが、彼はそこを無理に広げていない。だから説得力がある。
一方で、彼のいう「解ける問題」は、歴史学の中心にある問いの一部でもある。たとえば文献の系譜、翻訳の伝播、匿名の出典、暗号化された記録。こうした問いは、古典的な史料批判の延長にある。AIは新しい学問を作るというより、すでにある方法を極端に拡張する道具だと見るほうが自然だろう。そう考えると、恩恵を受けるのは大きな理論を立てる研究者だけでなく、地味な照合作業を積み上げてきたアーカイブ担当者や編集者だ。
暗号解読の話を読むと、AIの強さは推論力そのものより、探索の粘りにあるのではないかと思えてくる。Breenが紹介する例では、モデルが単独で天才的な一手を打ったというより、関連しそうな資料を延々と追い、見落とされていた接点を拾ったことが効いている。人間の専門家でも追跡しにくいプロセスだが、ここにこそ現在のLLMの怖さと面白さがある。
ただし、この強さは同時に危うさでもある。モデルが「調べ続ける」こと自体は立派でも、どこで情報を見つけたのかが曖昧なら、研究としての再現性が怪しくなる。Breenもその点をはっきり書いていて、GPT-6 AstraがBundesarchivの資料にたどり着いた経路は人間の専門家にも完全には分からないという。研究成果としては面白いが、検証のためには別の仕組みが必要だ。つまり、AIが発見した事実をそのまま信じるのではなく、発見経路を後から人間が追えるようにする設計が欠かせない。
この記事を読んでいて印象に残るのは、成功例の背後に必ずアーカイブの地道な整備があることだ。Darwin Correspondence Projectのような長年の蓄積がなければ、モデルに大量の手がかりを与えることもできない。Hartlibの資料でも、そもそも一次史料が広くデジタル化され、多言語で参照可能だからこそ、Opus 5.5のようなモデルが横断検索を仕掛けられる。AIが魔法のように歴史を掘り起こしているのではなく、人間が前もって掘った井戸を、AIがより深く広く探索している感じに近い。
だから、この話は「AIが研究者を置き換える」話ではない。むしろ、研究基盤の整っている分野ほどAIの成果が出やすい、という話だと思う。逆に言えば、デジタル化が進んでいない地域史や、断片史料しか残らないテーマでは、同じ恩恵はすぐには来ない。研究資金の配分を考えるなら、最新モデルに金を出すだけでなく、史料のデジタル化、メタデータ整備、翻刻、索引作成に投資するほうが長い目では効くのではないか。AIラボが歴史研究に資金を出すべきだというBreensの提案は、実はその前段にある人力インフラの重要性を認めるところまで含めて読むべきだと思う。
Breenが少し驚きを込めて書いているのは、GPT-6が単なる答え役ではなく、研究テーマの提案までしてきたことだ。Darwinの著作を追って「誰から自然選択の情報を得たのか」を探る案は、少なくとも彼の専門的感覚と噛み合っているらしい。ここは重要で、AIが役に立つのは検索や要約だけではない。研究者が次に何を見るべきか、どの仮説を試すべきかを案出する段階に入っている可能性がある。