ひとつの賢いモデルより、役割を分けたほうが誤差が見えやすい
この記事を読んでまず思ったのは、「モデルを強くすること」と「判断を正しくすること」は、思った以上に別問題なんだな、ということだった。ここがかなり面白い。大きなモデルに全部を投げると、たしかにそれっぽい答えは返ってくる。でも、その“それっぽさ”が危ない。著者が書いているのは、強いモデルが間違うというより、複数の異なる種類の証拠を一つの文脈に押し込んだときに、矛盾が丸め込まれてしまう、という感覚に近い。 特に引っかかったのは、coordinator が「平均しない」と明言しているところだった。普通は複数の agent を使うと、最後にそれらしい統合結果を出したくなる。でもこの記事は、その発想をかなりはっきり否定している。runbook は古い、flow log は新しい、どちらも一見もっともらしい。こういうときに平均を取ると、むしろ危険になる。たしかに、現場で困るのは“対立する証拠がある”ことそのものより、“対立しているのに見えなくなる”ことだと思う。 もう一つ興味深かったのは、5つの specialist がそれぞれ「文章」ではなく typed finding を返す設計だ。claim、
papoo.work