SRE向けMCPを、ちゃんと「効く」と言える形で測ろうとしているのが好ましい
この記事を読んで最初に思ったのは、これはベンチマーク記事というより「ベンチマークを雑にやると、たぶん簡単に自分たちをだませる」という警戒心の表明だな、ということだった。SREの調査支援ツールは、見た目が賢そうでも、実際に事故対応で役に立つかはかなり怪しい。しかも同じ質問でも答えがぶれる。だから、ただデモで気持ちよくなるのではなく、同じ条件を固定して、しかも答えを盲検で採点する、という発想はかなり筋がいいと思う。 特に引っかかったのは、合成データの作り方にかなり神経を使っている点だ。現実の障害っぽいノイズを入れつつ、わざと似たような別の異常も混ぜる。さらに、公開データセットをそのまま使うと学習済みの知識で当ててしまうかもしれないから、オリジナルのシナリオを作る。ここまでやると、ようやく「LLMが過去に見たパターンを思い出しているだけではない」と言えそうだし、逆に言うと、ここまでしないと評価がかなり怪しくなるのだろうと思った。 もう一つ面白かったのは、ClickHouseを直接SQLで触らせる方法より、ClickStack MCPのように「高レベルの観測用プリミティブ」を渡したほうが、単に
papoo.work