What Makes Software Issue Resolution Tasks Difficult for Agents? 精读
这篇 ESEM 2026 论文回答一个基准测试长期回避的问题:对编码智能体而言,一个 issue 修复任务到底难在哪里、难度可否预知?作者在 CoderForge-Preview 的 45,769 个任务、1,553 个仓库上,用补丁、仓库、提示词三组共 54 个确定性静态特征预测智能体成功率,AUC 达 0.863、可解释 41% 的通过率方差。消融发现补丁碎片化与仓库规模几乎承载全部难度信号,而提示词的语言特征只有在中等难度区间才浮现(进入 top-5 贡献者占 70.3%),呈现清晰的分层结构。本精读覆盖其动机、特征体系、实验设计、根源解释与可迁移灵感。