いちばん最初に思ったのは、これは派手なアプリというより、地味だけど毎日効く道具だな、ということだった。会議の文字起こしはもう珍しくないけれど、匿名の Speaker 1, Speaker 2 が並ぶだけだと、あとで読み返しても結局つまずく。そこに名前が付くだけで、検索のしやすさも、記録としての使い勝手もかなり変わるはずだ。こういう「小さい不便」を潰す用途に、coding agent がよくハマっている感じがする。
面白かったのは、著者が「新しいものを全部毎回判定する」のではなく、いったん音声を埋め込みとして保存して、似ている話者なら自動でつなぐ設計にしているところだ。埋め込みは、ざっくり言うと音声を数値の地図に置き換えて、近いもの同士を探すやり方だと思えばよい。人間が毎回同じ人の声を聞いて判別する代わりを、機械にやらせている。発想としては地味だけれど、これが「一度ラベルを付けたら次から楽になる」仕組みを支えている。
一方で、少し引っかかったのは、匿名の transcription をかなり信頼している点だった。実際には会議音声って、かぶり話しや雑音やマイク品質の差があるので、そこをどこまで自動化できるかは現場次第だと思う。記事では高精度を前提にかなりうまく回っているように読めたけれど、そこは環境依存が大きそうだ。だからこそ、完全自動を目指すより「自信があるときだけ自動、怪しいときは人に聞く」という割り切りが現実的なんだろう。
それと、プロンプトをかなり長く一発で投げ込んでいるのも印象に残った。昔なら、仕様を詰める前に実装し始めて後で崩れがちだったところを、先に考えを言葉にしておくことで、かなり手戻りを減らせる。ここで大事なのは、自然言語で雑に頼むことじゃなくて、最初に自分の頭の中の設計をできるだけ具体化することなんだろうと思う。coding agent の強みは「勝手に全部やってくれる」より、「こちらの曖昧さをどこまで減らせるか」にあるのかもしれない。