注目★★★★★Hacker News
AI生成コード、冗長さは人間の約2倍
30秒で把握
- 1LLM生成コードは人間のコードより冗長性と複雑化指標が高い
- 2verbosity 0.33対0.15、erosion 0.68対0.31を記録
- 3反復評価では最先端モデルも全チェックポイント通過率0%
要約
著者は、LLMが生成するコードは動作しても、不要な抽象化や重複を含む「slop」を自力で解消できないと論じた。SlopCodeBenchでは、エージェントのコードは人間のリポジトリに比べ、冗長性が0.33±0.10対0.15±0.06、複雑な関数への偏りを示すerosionが0.68±0.20対0.31±0.17だった。コード評価をLLMに任せる手法は不安定で、LOC増分、verbosity、erosionなどの定量指標にも限界がある。反復的な指示とテストで評価すると、最先端モデルでも全チェックポイント通過率は0%になり、コード量の急増だけでは品質を維持できない前提が崩れる。
あなたへの影響
AIエージェントで大量のコードを生成する日本の開発チームは、機能テストだけでなくverbosityやerosion、コード変更量を次のスプリントから確認すべきです。
推奨:コードの量産が続けば複雑化と保守負債が蓄積し得るため、人手レビューの対象範囲と品質ゲートを再設計する必要があります。