レビュー観点を明確にせずにAI任せでレビューさせると収束しないことが多いので、観点をかなり明確にしたうえでレビュー依頼すると1回で収束するようになりました
直すたびに別のP2生えてくる無限ループ現象の言語化が的確すぎる。レビューとコード変更を分離してテストに落とし込むのは鉄則だな
個人的にはP2が修正一番厄介だと思う。P0、P1は設計や実装の段階でも気づいたりするのであまり出ないし、P3は機械的に修正できる。P2は影響度の低さのわりにエグい改修が必要だったりすることも多くてツラい。
終わりのなき開発
これなー、PRの自動レビューとかを仕込んだときにとても困る。自動レビュー自体はAIの利用者による差異を吸収する機構として気に入ってはいるのだけど、途中で「小出しにすんなバーカ」となってしまう問題
ほぼClaudeしか使ってないからよくわからんのだけど、Codexっていちいち指示しないとテストすら書かないの…?
これがP2の修正地獄の入り口かを臭覚で嗅ぎ分けるようになってきた・・。というか、数時間とかしたあと、ハタと「え?これ設計こうすれば消えるよな?」系がでたりするw
毎回コンテキストを新規にしてると増えがち。引き継ぐようにすると比較的収束しやすい。
“問題を数件発見しても探索を終了せず、対象範囲全体のレビューが完了するまで続けてください。”
codexのp2言いがかりとそうでないものの落差激しい。そろそろ怠い
Linuxの開発でLinusが「バグを直して何かが壊れるなら、それはバグじゃなくて仕様だ」とよく言ってたけど、たまにAIのこの手の話に似たようなものを感じる
昨今の研究で、LLMにもADHDがあるかもと色んな事が分かってきてるので、小出しにしないといけないという何かがあるのかもしれんね。
リスクマネジメントの基本(頻度x影響度)の頻度評価がガバガバ、合格するテストを書くクセ(意味がない)、修正案検討時にアーキテクチャ等最も守るべきポリシーを確認しない、この辺が致命的。
“Codexを使ったコードレビューでは、発見した問題をP0〜P3で整理。P0 : 致命的、P1 : 早急に修正すべき、 P2 :いずれ修正すべき、P3 : 影響は小さい。 AIはレビューするたびにコードをあらためて探索。2回目 : 別の3件発見”
AIレビューでP2(いずれ修正すべき一般的な問題)が消えない理由を、問題の小出しの発見、新たな不具合、判定の揺れから整理。レビューと修正を分け、指摘を検証してテストに残し、終了条件を定める方法を提案。
ほぼClaudeしか使っていないからCodexの特性はわからないけど、単純にrevieweeの判断で却下していいことにして、最大回数を決めておけばループしようがない。
AIデバッグはなぜ収束しないのか - P2がいつまでも消えない理由|npaka
レビュー観点を明確にせずにAI任せでレビューさせると収束しないことが多いので、観点をかなり明確にしたうえでレビュー依頼すると1回で収束するようになりました
直すたびに別のP2生えてくる無限ループ現象の言語化が的確すぎる。レビューとコード変更を分離してテストに落とし込むのは鉄則だな
個人的にはP2が修正一番厄介だと思う。P0、P1は設計や実装の段階でも気づいたりするのであまり出ないし、P3は機械的に修正できる。P2は影響度の低さのわりにエグい改修が必要だったりすることも多くてツラい。
終わりのなき開発
これなー、PRの自動レビューとかを仕込んだときにとても困る。自動レビュー自体はAIの利用者による差異を吸収する機構として気に入ってはいるのだけど、途中で「小出しにすんなバーカ」となってしまう問題
ほぼClaudeしか使ってないからよくわからんのだけど、Codexっていちいち指示しないとテストすら書かないの…?
これがP2の修正地獄の入り口かを臭覚で嗅ぎ分けるようになってきた・・。というか、数時間とかしたあと、ハタと「え?これ設計こうすれば消えるよな?」系がでたりするw
毎回コンテキストを新規にしてると増えがち。引き継ぐようにすると比較的収束しやすい。
“問題を数件発見しても探索を終了せず、対象範囲全体のレビューが完了するまで続けてください。”
codexのp2言いがかりとそうでないものの落差激しい。そろそろ怠い
Linuxの開発でLinusが「バグを直して何かが壊れるなら、それはバグじゃなくて仕様だ」とよく言ってたけど、たまにAIのこの手の話に似たようなものを感じる
昨今の研究で、LLMにもADHDがあるかもと色んな事が分かってきてるので、小出しにしないといけないという何かがあるのかもしれんね。
リスクマネジメントの基本(頻度x影響度)の頻度評価がガバガバ、合格するテストを書くクセ(意味がない)、修正案検討時にアーキテクチャ等最も守るべきポリシーを確認しない、この辺が致命的。
“Codexを使ったコードレビューでは、発見した問題をP0〜P3で整理。P0 : 致命的、P1 : 早急に修正すべき、 P2 :いずれ修正すべき、P3 : 影響は小さい。 AIはレビューするたびにコードをあらためて探索。2回目 : 別の3件発見”
AIレビューでP2(いずれ修正すべき一般的な問題)が消えない理由を、問題の小出しの発見、新たな不具合、判定の揺れから整理。レビューと修正を分け、指摘を検証してテストに残し、終了条件を定める方法を提案。
ほぼClaudeしか使っていないからCodexの特性はわからないけど、単純にrevieweeの判断で却下していいことにして、最大回数を決めておけばループしようがない。