ExecuCritic × AgentGuard × RepoAtlas × Protocol Trimming 精读:编码智能体可靠性四重奏
四篇互补的 coding agent 可靠性研究合读:Intel×北大的 ExecuCritic 给 RLVR 加’校准 critic 塑形’——ρK 秩相关门控让 critic 失准自动坍缩,SWE-bench Lite +3.7pp 且 sandbox 执行省 42%;York 的 AgentGuard 从 642 条异常轨迹自动学条件激活护栏,异常执行率 69.0%→26.7%(代价:过度拒绝 19.3%);北航 RepoAtlas 用 select-project-refresh 演化多模态仓库视图,三 VLM 一致 +2.4pp 且 token -5.8%;Intuit 工程报告量化协议保持裁剪——常规裁剪成功率 66.6-77.3% vs 协议感知 92.2%/自适应护栏 96.0%,临界阈值随复杂度上移。合读视角:可靠 coding agent 的四层防线——训练时(奖励塑形)、执行时(护栏)、探索时(上下文视图)、压缩时(协议保持)。