<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>软件工程 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E8%BD%AF%E4%BB%B6%E5%B7%A5%E7%A8%8B/</link><description>Recent content in 软件工程 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 30 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E8%BD%AF%E4%BB%B6%E5%B7%A5%E7%A8%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>Gagar × SWE-MILE × CRR：代码智能体强化学习的细粒度信用分配三重奏 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-credit-assignment-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-credit-assignment-trio-paper-reading/</guid><description>本文合并精读 2026 年 9 月底三篇聚焦「代码智能体 RL 细粒度信用分配」的论文：小米+人大+北大+港大的 Gagar 用组内 agentic 评审排出补丁质量层级，再以保和重分配把质量偏好注入 GRPO 优势，DeepSWE 从 50.2% 提到 62.2%；中科院自动化所+国科大+腾讯的 SWE-MILE 定义导航势与验证势两个运行时势函数，以势差做过程奖励塑形，SWE-bench Verified 63.8 全面超越五条过程奖励基线；北邮+卢森堡大学的 NeurIPS 2026 论文 CRR 利用沙箱可 fork 的物理性质真实执行反事实动作，把「续走终局的回报差」作为免费过程奖励，Verified 41.7% vs GRPO 36.4%。三篇论文回答同一个问题——终态二值奖励下如何区分好坏决策——却给出质量对比、运行时信号、反事实执行三条机制迥异的路线。每篇覆盖背景、关联工作、问题、解法、证据、根源（含外部交叉验证）、知识反推与通用灵感。</description></item><item><title>RepoReuse × VulContextBench：代码智能体的复用行为与安全证据审计 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-process-audit-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-process-audit-duet-paper-reading/</guid><description>本精读一次读两篇互补论文：北大等六机构的 RepoReuse 审计 coding agent 在多轮迭代开发中『写了什么』——是复用仓库既有代码还是重复造轮子（recall 饱和但 self reuse 仍从 83.9% 跌到 69.1%，Cdup 升至 51–69%，pass 率却纹丝不动）；新加坡管理大学等三机构的 VulContextBench 审计安全审查中『看了什么』——浏览 86.3% 金标准行却只申报 12.9%，37–73 个百分点的『看到但不上报』差距。二者共同宣告：功能测试通过 ≠ 过程正确，viewed vs declared、recall vs reuse 的分离测量是过程可信的关键仪器。</description></item><item><title>SWE-Game × CUA-SWE：软件工程基准的游戏化与视觉化扩展 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-next-gen-swe-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-next-gen-swe-duet-paper-reading/</guid><description>当「写代码」不再是软件工程的唯一通道，SWE 评估如何保持确定性？本精读合并解读两篇 2026 年 9 月的新基准论文：SWE-Game 把评估对象扩展到游戏构建/修复/移植，用共享仪表接口与确定性运行时检查把缺陷检出率做到 94.25%（视频 VLM 裁判仅 75.40%）；CUA-SWE 把信息通道扩展到运行中应用的视觉界面，用 code-only 与 Hybrid CUA 配对对照及 S/M 规格来源分层，证明 GUI 的价值不在「看」而在「恢复只存在于应用材料中的规格」（M 任务 +42~48pp）。二者共同回答：交互维度扩展之后，确定性验证依然是 SWE 基准的定海神针。</description></item><item><title>WideSWE × AsynCodeBench × RepoMAS：超越单仓库的软件工程智能体三重维度 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-beyond-single-repo-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-beyond-single-repo-trio-paper-reading/</guid><description>同日挂出的三篇 arXiv 论文从三个正交维度宣判了传统 SWE 基准的「单仓库、单 Agent、单次规格」范式已经不够用：浙大+清华的 WideSWE 首次把「一个需求横跨多个仓库协同修改」做成可执行基准，最强配置任务成功率仅 42.50%，但至少完成一个仓库的比例高达 83.33%——连乘判定暴露出被单仓库评估遮蔽的范围缩窄与交付中断；休斯顿大学牵头六校的 AsynCodeBench 用显式依赖图+可执行 Checker 直接度量异步多 Agent 的「协作」本身，发现 TestPass 48.0% 而 ADPR 仅 18.8%、Qwen 三代模型单体编码能力大涨而协作能力停滞；哈工大的 RepoMAS 定义「渐进式指定任务」并提出 Issue 驱动的仓库状态维护框架，ProgSpec 44.7 分且结构化 Issue 消融直降 13.9 分。本文按九部分结构合并精读三篇论文，并给出统一结论：软件工程 Agent 的评估单元正在从仓库走向生态、从结果走向依赖轨迹、从静态规格走向可修订规格。</description></item><item><title>FLARE：用生成式奖励模型为长程编码智能体提供全生命周期稠密监督 —— 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-flare-grm-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-flare-grm-paper-reading/</guid><description>深度精读北京大学、南京大学、北京邮电大学与独立研究者联合提出的 FLARE。它通过 RADAR 双轨数据合成训练一个 4B 生成式奖励模型（GRM），输出结构化的步级风险诊断（风险等级+错误类+修复建议），在推理时做断点再生、训练时做 SFT 筛选与 RL 稠密奖励，首次把测试时干预与训练时对齐闭环到同一套诊断信号。F2P Pass@1 14.10% 近乎翻倍于全局重采样 7.80%，token 省 5×；ROC-AUC 75.74%；SFT 相对提升 19.13%，RL 平均提升 9.19%。</description></item><item><title>ReqEvolve 精读：ASE 2026 上的用户驱动软件自演化范式</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-12-reqevolve-user-driven-self-evolution-paper-reading/</link><pubDate>Sat, 12 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-12-reqevolve-user-driven-self-evolution-paper-reading/</guid><description>UCD+CNR 提出“用户驱动自演化”新范式：终端用户用自然语言表达需求，软件在执行中自动生成并集成新功能。ReqEvolve 实现（需求解释→代码生成→运行时集成）在 72 个演化案例/18 项目基准上 Pass@1 89.2%，超 SpecFix +18.8pp（大效应量 r=0.79）。ASE 2026 已录用。</description></item><item><title>VP-Control 精读：Agent 提交门的“证据血统比模型多样性重要 3.6 倍”</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-12-vp-control-commit-gates-paper-reading/</link><pubDate>Sat, 12 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-12-vp-control-commit-gates-paper-reading/</guid><description>WashU+SMU 发布 VP-Control：Agentic AI 提交门的代价感知验证组合设计。2880 场景确定性基准+2×2 因子实验证明：共享证据的跨模型投票批准 62.9% 不安全提案，独立证据源仅 22.9%——源效应 40.9pp vs 模型效应 11.3pp。共模数据失效让“多模型投票”这一直觉失效，组合控制器以部署可观测元数据实现 1.9% 不安全执行。</description></item><item><title>A-JIT: Agentic Just-In-Time Software Construction 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-11-a-jit-agentic-software-construction-paper-reading/</link><pubDate>Fri, 11 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-11-a-jit-agentic-software-construction-paper-reading/</guid><description>Kentucky×UCL 的这篇范式论文把 JIT 编译的思想搬到软件交付层：A-JIT 应用=代码+运行时 harness+内嵌 agent 的活组装体，语言层显式标注&amp;rsquo;留待 JIT 构建的部分&amp;rsquo;（code holes），agent 持续观察系统使用与执行轨迹，像 JIT 编译器特化机器码那样按需特化软件逻辑、工作流与工具接口。传统&amp;rsquo;先构建后部署&amp;rsquo;的静态范式被&amp;rsquo;按需即时构建、持续适应&amp;rsquo;取代，软件从固定制品变成会生长的有机体。本文精读其三支柱设计（语言标注/运行时支持/实现新定义）与 Bosque 原型上的 trace 驱动人-AI 协同构建。</description></item><item><title>RealSWE 精读：真实用户请求正在让编码 Agent 榜单失真</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-06-realswe-realistic-user-requests-paper-reading/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-06-realswe-realistic-user-requests-paper-reading/</guid><description>RealSWE（成均馆大学）用六类信息分类学×四维语言风格对照 SWE-chat 真实用户 prompt 与 SWE-bench 任务，发现 88% 真实请求只带问题描述而基准任务仅 7%；据此构建 381 个多变体任务族，测得 7 个主流模型在真实输入下平均掉 6.4pp 且排行榜改写——MiMo V2.5 Pro 反超更贵模型升到第 2。控制变量消融进一步证明：Desired Behavior 字段值 8pp，复现步骤与环境信息几乎一文不值。</description></item><item><title>Requirements After the First Edit 精读：需求晚到正在让 Agent 会话里的代码作废翻倍</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-06-requirements-after-first-edit-paper-reading/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-06-requirements-after-first-edit-paper-reading/</guid><description>KIT×早稻田×阿德莱德在 3,553 个真实 SWE-chat 会话上首次把&amp;rsquo;需求晚到&amp;rsquo;与&amp;rsquo;行级代码作废&amp;rsquo;在同一会话内关联：新需求到达后，Agent 删除的先前代码量约为无需求编辑的 2 倍，且该负担随会话推进无衰减；受控实验进一步显示延迟披露只是把实现工作搬到披露之后、并未增加额外返工。需求工程 30 年的 volatility 教训在 agentic 编码场景被压缩进单一会话重演。</description></item><item><title>When Models Edit Too Much 精读：编码 Agent 的过度编辑病与保真度评测轴</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-06-over-editing-minimal-code-edits-paper-reading/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-06-over-editing-minimal-code-edits-paper-reading/</guid><description>NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架，系统刻画 over-editing：GPT-5.5 高 Pass@1 与大改动并存，一行 bug 修出 60 行代码；一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3；SFT 过拟合已见损坏模式，RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。</description></item><item><title>SWE-Gate 精读：通过功能测试对软件工程 Agent 并不够</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-05-swe-gate-paper-reading/</link><pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-05-swe-gate-paper-reading/</guid><description>SWE-Gate（中山大学/浙大/重大）从真实 PR 评审评论中提取约束并构造 303 个仓库级修复实例，发现 644 个通过功能测试的补丁中 221 个（34.3%）违反评审约束——SWE-bench 式功能唯一评测系统性高估了 Agent 的真实修复能力。本文基于全文逐页阅读，拆解其约束提取管线、双测试设计与 221 个隐藏失败的分布规律。</description></item><item><title>Agent如何发现、阅读与书写技术文档：行为实证研究 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-agent-friendly-documentation-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-agent-friendly-documentation-paper-reading/</guid><description>北大团队用557个真实Agent编码会话的94,813个事件与33,097个Agent PR的69万条文件变更，首次系统测量了编码Agent与技术文档的真实交互。四大发现颠覆行业直觉：60.5%的文档交互指向AGENTS.md等Agent自有工件而非经典技术文档；读文档→写代码的关联在数据上未获解析；零次显式文档验证；文档产出速率达咨询的0.87倍却始终滞后于代码。论文据此提出双瓣循环模型，并指出「可操作性」「可验证性」两大agent-friendly文档假设缺乏行为支撑。</description></item></channel></rss>