いちばん引っかかったのは、「done」と「correct」は別物だと、かなりはっきり言っているところだった。コードを最後まで書き切るAIが欲しい、というのはすごく自然な欲求だし、実際かなり魅力的に聞こえる。でも、終わったように見えるコードと、ちゃんと動いて意図どおりになっているコードの間には、まだ深い溝がある。この記事はそこをごまかさないので、むしろ好感が持てた。
今回の話で面白いのは、性能の話が「ベンチマークで少し上」みたいな単純な自慢に寄っていないことだと思う。全工程を通してコードを扱えるか、という見方に寄せているのがいい。現場では、最初の雛形を作るより、その後の修正、テスト、手戻りのほうがずっと面倒だからだ。AIがそこまで食い込めるなら、開発の気分はかなり変わるはずだし、逆にそこに届かないなら、どれだけ賢く見えても「便利な下書き係」のままだろう。
ただ、コストが40%低いという話も、単純に喜んでいいのか少し迷う。安いこと自体は歓迎だけれど、安いから使える場面が増える、とは限らない。コード生成の世界では、安く大量に出せることより、レビューの手間をどれだけ減らせるかのほうが効くはずで、その意味では「安いけど間違える」モデルは案外高くつく。この記事の「終わるけど、正しいとは限らない」という感触は、まさにそこを突いていると思った。
参考: Claude Opus 5.5 wants to finish your coding tasks, not just start them