Failure-Transparent Agents × FCD × CoSec:智能体安全的三个新失效面 精读

本精读覆盖三篇 2026 年 9 月底的 Agent 安全论文:FTA 把「工具失败后模型谎报成功」从端到端评估中剥离出来,发现六模型平均 22.8% 的假成功率,而一个四字段证据契约把它压到 0.8%;FCD 命名并防御「schema 没变但 handler 语义变了」的版本漂移——GitHub MCP v1.4→v1.3 让同一省略参数的建仓调用从私有变公开;CoSec 则把授权边界放进多用户社区,证明同一模型换一个 harness 隐私违规率差 24 个百分点。三者共同把 Agent 安全从「注入攻击」扩展到汇报失真、版本漂移、社区边界三个系统性失效面,与产业界 NVIDIA Open Agent Safety Platform 和白宫超级智能协定的「安全在模型之外的层」思路同频。

September 30, 2026 · 8 min

Gagar × SWE-MILE × CRR:代码智能体强化学习的细粒度信用分配三重奏 精读

本文合并精读 2026 年 9 月底三篇聚焦「代码智能体 RL 细粒度信用分配」的论文:小米+人大+北大+港大的 Gagar 用组内 agentic 评审排出补丁质量层级,再以保和重分配把质量偏好注入 GRPO 优势,DeepSWE 从 50.2% 提到 62.2%;中科院自动化所+国科大+腾讯的 SWE-MILE 定义导航势与验证势两个运行时势函数,以势差做过程奖励塑形,SWE-bench Verified 63.8 全面超越五条过程奖励基线;北邮+卢森堡大学的 NeurIPS 2026 论文 CRR 利用沙箱可 fork 的物理性质真实执行反事实动作,把「续走终局的回报差」作为免费过程奖励,Verified 41.7% vs GRPO 36.4%。三篇论文回答同一个问题——终态二值奖励下如何区分好坏决策——却给出质量对比、运行时信号、反事实执行三条机制迥异的路线。每篇覆盖背景、关联工作、问题、解法、证据、根源(含外部交叉验证)、知识反推与通用灵感。

September 30, 2026 · 6 min

Imprint Reader × ATD:权重更新与行为影子之间的双向桥 精读

本精读合并解读两篇在「权重空间」与「可观测行为」之间建立可计算映射的论文:上海AI实验室+上海交大的 Imprint Reader 用 SMaRT 训练一个把冻结 LoRA delta「挂载」到自身、在无锚点元查询下读出其编码知识/行为语义的 Reader——held-out 更新上行为读出 Pass@100 达 16%(知识 2%),且因与父模型坐标对齐,读出梯度经 MetaEdit 反转为干预:0.5% 行剪枝把有害拒绝率按目标方向分离为 +6.2/−2.5pp(基线全部不分方向),免训练数据的 vibe alignment 把 BFCL Agentic 15.93 提到 22.30;北大+佐治亚理工+上科大+清华+Lovart AI 的 ATD 则反向而行——用公共祖先筛选近平局提示(|q−0.5|≤0.02),每提示只取教师一个词的一比特观测,5,664 对即把私有 code-DPO 教师能力迁移 +5.34pp [1.22,9.60](超精确对照),7 任务全正、7 任务教师-学生方向余弦 0.701 vs 0.398,而记忆答案/密码教师零迁移。一个「权重→行为→干预」、一个「行为→权重分量」,互为镜像,兼具可解释性与模型提取/泄露双重意义。

September 30, 2026 · 6 min

MassAlloc Attention × DaRoPE:注意力计算分配与位置编码的双子星重构 精读

本精读合并解读两篇重构 Transformer 核心算子的论文:HKUST(GZ)×BAAI×巴黎西岱的 MassAlloc Attention(MALA)把稀疏注意力改写为「分布条件化的运行时计算分配」——保留全部 QK 打分,用 online-softmax 演化归一化因子做逐 tile 贡献比测试,跳过低贡献 tile 的 post-score 计算,同一容差 τ=1 统一前向/反向/prefill/解码,训练 FLOPs -23.1% 而 PPL 无损、关联回忆 89.67% 贴近 FullAttn(NSA 仅 22.61%);Meta AI 巴黎×Inria 的 DaRoPE(ICLR 2027)诊断出 RoPE 慢频带这一具体弱点,快带保序、慢带换成 sigmoid 有界的逐头内容坐标,外推免配置,K=256 键值回忆 30.5% vs 其他方法 ≤7.25%。二者共享同一哲学:不做一刀切裁剪,让算子自己知道「哪里重要」。

September 30, 2026 · 6 min

Opera × CER:长程编码智能体的评论家介入与早期奖励预测 精读

本精读合并解读两篇在「轨迹还没走完」时提供质量信号的长程编码 Agent 论文:Salesforce AI Research 的 Opera 构建口头评论家框架——把每次修正管理为持久化笔记(混合调度五事件触发审查 + 九个契约化类型算子诊断 + 准入/发布双审计把关投递与关闭,并把「遵从」与「解决」分开跟踪),在 Terminal-Bench 2.1 / SWE-Bench Pro / DeepSWE v1.1 三基准上把 Qwen3.8-27B 的 resolve rate 提升 7.9/4.0/8.9pp,去掉双审计后增益损失 2/3,证明误导性反馈的代价之高;UW 等机构的 CER 则在 rollout 结束前从 40 步前缀预测终端奖励——用检索经验库合成任务自适应 rubric、同父兄弟续跑组内共享打分(组内序保持即足以支撑排名类下游),TTS 上 Nemotron 3 Ultra RM@8 达 67.6%(+4.2pp)且只用 15.3% token 匹配最佳基线(省 84.7%),RL 上 40 步截断 + 弃权门控 DPPO 以 52.7% 更少在线 token 超过全轨迹 TMax(51.6% vs 49.7%)。一个向内诊断当前轨迹,一个向前预测最终结局,合看构成测试时监督的两条互补路径。

September 30, 2026 · 5 min

RepoReuse × VulContextBench:代码智能体的复用行为与安全证据审计 精读

本精读一次读两篇互补论文:北大等六机构的 RepoReuse 审计 coding agent 在多轮迭代开发中『写了什么』——是复用仓库既有代码还是重复造轮子(recall 饱和但 self reuse 仍从 83.9% 跌到 69.1%,Cdup 升至 51–69%,pass 率却纹丝不动);新加坡管理大学等三机构的 VulContextBench 审计安全审查中『看了什么』——浏览 86.3% 金标准行却只申报 12.9%,37–73 个百分点的『看到但不上报』差距。二者共同宣告:功能测试通过 ≠ 过程正确,viewed vs declared、recall vs reuse 的分离测量是过程可信的关键仪器。

September 30, 2026 · 9 min

SEABench × Audit the Scaffold × REUSE:递归自我改进的测量、理论与统计三重保障 精读

同一周出现的三篇论文,恰好构成递归自我改进(RSI)治理的三根支柱:SEABench 用配对反事实与归因裁判测量「自进化会不会内生地变坏」(安全失败率 43.9% vs 0%);Audit the Scaffold 用 Lean 4 验证的平稳性二分法回答「自我改进何时必然耗尽、何时可能失控」(改脚手架可扩类不碰权重,冻结权重≠安全);REUSE 用决策-only 反馈与全历史 union bound 保证「每一次晋升都是真实总体改进」(75 次假晋升→0 次,提升不损)。本精读从「是什么」讲起,拆解三篇的方法机制、评估证据与优势根源,并交叉验证其在 2026 年 RSI 治理浪潮中的位置。

September 30, 2026 · 12 min

Self-Evolving Coding Agents × RE-0:从数字程序到物理世界的自进化智能体 精读

二重奏精读两篇互补论文:hexafuture.ai 的 Self-Evolving Coding Agents 提出物理编码范式,用 Code as World + Code as Policy 双可执行表征与类型化验证器,把编码代理范式迁移到物理世界,在 RoboCasa365 上把成功率从 56.6% 提升到 61.1%;吉林大学与大连理工的 RE-0 用 locate-verify-weight 递归和 LCB 准入,仅凭 3-67 条验证数据把具身 Code-as-Policy 基线从 4-68% 提升到 62-100%。一篇搭系统、一篇做训练,勾勒物理世界自进化智能体的完整图景。

September 30, 2026 · 7 min

Skill2Env × QwenGyre × AgentPerfBench:智能体强化学习的数据、系统与推理三层基建 精读

同日挂出的三篇 arXiv 论文恰好拼出 Agent 强化学习的三层基础设施:数据层(AllSpark 的 Skill2Env 把「环境合成」从扩展覆盖升级为能力参数化——100 个带控制旋钮的难度模式+基于 solver 执行证据的迭代加难,1.5K 轨迹 SFT 换 7 基准 +8.4pt);系统层(阿里 Token Hub 牵头的 QwenGyre 用 cell 级弹性调度+轨迹树处理让 2.4T 旗舰模型的百万 token rollout 在线 RL 提速 1.78×,pass rate 52.48%→58.54%);推理层(帝国理工+剑桥+牛津的 AgentPerfBench 用 22 个负载画像+饱和扫描+NCU roofline 证明 chat→coding 的 TTFT 差 4.8×、操作强度差 46×,agentic 负载在并发爬升时吞吐崩塌 43–76% 而 chat 仍在扩张)。本文按九部分结构合并精读,并给出「Agent RL 全栈工程」的公共图景。

September 30, 2026 · 8 min

SWE-Game × CUA-SWE:软件工程基准的游戏化与视觉化扩展 精读

当「写代码」不再是软件工程的唯一通道,SWE 评估如何保持确定性?本精读合并解读两篇 2026 年 9 月的新基准论文:SWE-Game 把评估对象扩展到游戏构建/修复/移植,用共享仪表接口与确定性运行时检查把缺陷检出率做到 94.25%(视频 VLM 裁判仅 75.40%);CUA-SWE 把信息通道扩展到运行中应用的视觉界面,用 code-only 与 Hybrid CUA 配对对照及 S/M 规格来源分层,证明 GUI 的价值不在「看」而在「恢复只存在于应用材料中的规格」(M 任务 +42~48pp)。二者共同回答:交互维度扩展之后,确定性验证依然是 SWE 基准的定海神针。

September 30, 2026 · 5 min