QAの感覚でAI開発を見ると、要求がいちばん怪しい
この記事を読んでまず思ったのは、AIエージェントの話なのに、いちばん効いているのがかなり古典的なQAの発想だということだった。派手なのは「agentic SDLC」とか「MCP」とかの単語だけれど、芯にあるのは、仕様をもっと早い段階で磨くことと、判定のブレを測ることだ。ここが地味なのに、たぶん一番実務に効く。 特に、design phase の直後に specification enrichment stage を置くという考え方は、かなり腑に落ちた。AIに仕事をさせるほど、入力の雑さがそのまま出力の雑さになる。だから「実装してからテストで見つける」より先に、「そもそも何を作るのか」をQAの目で詰める。これは単なる前倒しではなく、AI時代の要求定義の再設計なんだと思う。人間同士でも曖昧な仕様は危ないが、LLM相手だとその曖昧さが増幅される。 もうひとつ面白かったのは、複数の LLM-as-judges を Cohen’s kappa で比べるという話だ。評価用にAIを使うのは今どき珍しくないけれど、そこで「どれくらい一致しているか」をちゃんと測る姿勢があるのは好感が持てる。AIの判定は
papoo.work