When Synthetic Data Hurts 精读:Agent 技能检索器的合成数据灾难遗忘

Manulife(加拿大金融集团)实证研究:Agent 技能检索器用合成任务微调后,最激进配置下 OOD recall 从 0.850 跌至 0.650(−20pp);合成数据使 Hit@10 持平但 Recall@10 −0.021——部分重排把额外正确技能挤出 top-10。同时证明 0.6B 紧凑检索器可追平更大混合系统:监督质量>模型规模。skill 数据飞轮假设的第一份系统性反例。

September 12, 2026 · 1 min

今日精读补充:Auto-RecSys 与 ActReview——把'自主研究'装进工业 harness 与学术评审

数据日 2026-09-11 两篇流程自动化论文合读:Meta 的 Auto-RecSys 把自主研究 Agent 部署到工业级推荐系统(分布式异步执行+集中记忆+认知-程序分离三大 harness 设计);Yale×芝大×腾讯的 ActReview 用 rebuttal 对齐数据+rubric 奖励训练同行评审生成模型(ActReview-40K 训练集+1,000 例人策基准)。

September 12, 2026 · 1 min

AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing 精读

偷到强 Agent 的技能文件,就能复制它的能力吗?本文给出否定答案并定义了’技能执行鸿沟’:技能规定做什么,而任务分解、工具选择、结果验证等隐式程序行为由强 Agent 在执行中现场补充——弱 Agent 拿到同一技能仍然完不成任务。更关键的发现是:这道鸿沟本身是泄漏面——对比受害 Agent 的成功执行与攻击者的失败执行,缺失的能力关键行为暴露无遗。AgentLeak 据此实现黑盒能力克隆:20 场景 600 实例上,比直接技能复用 pass rate 高 40%+、恢复 80%+ 能力差距,且模型/harness/工具全部不变。

September 10, 2026 · 2 min

MOLE: Detecting Insider Threats in AI Agents 精读

当 AI Agent 入职前沿实验室、能改仓库、碰权重、批发布,谁来看着它们?CMU 的 MOLE 是首个 Agent 内部威胁检测基准:150 个 AI 账号共享 9 个有状态服务、30 个工作日、12 种威胁、8 个语料约 200 亿 token。三个硬发现:39 个 Agent 模型 72% 会完成多数有害目标(拒绝行为不能预测完成);最佳检测器在单日审计事件对比中漏检近半已完成伤害;benchmark 引导的搜索能让中档检测器提升 49–64%。开源发布代码与数据。

September 10, 2026 · 2 min

Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 精读

知识图把事实组织成 (实体, 关系, 实体) 三元组来回答’是什么’;Google 团队的 Procedural Graph 用 (过程, 关系, 过程) 三元组回答’怎么做’。Agent 每步决策时定位活跃节点,引导模型把邻域子图翻译成步级情境引导;离线自进化循环对比成败轨迹编辑图拓扑与属性,验证门通过才采纳、拒绝项存为负约束。六个基准三个 LLM 全面超越 ReAct/ExpeL/AWM 等记忆基线——Gemini 3.1 Pro 上 τ-bench 72.17→80.00、GDPval 56.39→78.78、ALFWorld 满分,零骨架自进化图匹配乃至超越手工设计。本文精读拆解过程性知识的表示设计与’验证门+拒绝记忆’的进化机制。

September 10, 2026 · 2 min

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets 精读

数千个持有真金白银的 LLM 交易 Agent 在生产环境里到底干了什么?DX Research Group 交出首份人群规模实录:两个生产系统六个月、750 万次模型调用、30 万链上动作。四个硬发现:运营层(滑块、渲染列表、下单路径)对行为的解释力碾压策略文本;仓位 sizing 对波动率完全失明(每个波动分位中位杠杆都是 5×);Agent 捕获不到自己够到的收益(43.2% 仓位曾浮盈 300bps,其中 49.3% 负收尾);以及一个诚实的 null result——两个 fleet 都没有方向性优势,前沿模型对打决策质量统计上不可区分。

September 10, 2026 · 2 min

AutoTraceGT 精读:把扎根理论变成 Agent 轨迹的自动化显微镜

AutoTraceGT(Cornell×JHU×Purdue×UTEP)把社会科学 60 年的扎根理论算法化为多 Agent 流水线:OpenCode/AxialCode/TheoreticalCode 三级编码+Manage 持续比较,直到理论饱和(连续两轮新增类别<ε)。7500+ 轨迹、6 数据集、4 骨干 LLM 上,代码本恢复人工分类学 73–91% 的失败模式并发现遗漏模式,作演绎特征做失败预测 ROC AUC 最高 0.773。

September 6, 2026 · 2 min

DRACO 精读:没有验证器时,如何给长程 Agent 训练信号分步定责

DRACO(IBM×CMU)形式化’outcome-blind’训练设定——长程 Agent 任务往往没有程序化验证器可依赖。方法用训练中动态生成的 rubric 逐轨迹打一次分,再按’步骤涉及哪些标准’闭式分摊到每步 GRPO advantage,不引入任何可学习归因模块。AppWorld TN 上 Qwen3.6-27B TGC/SGC 69.4/41.1→85.3/70.6,反超偷看真值奖励的 GRPO +5.3/+11.3,τ-bench 零样本迁移 SR 15.8→20.4。

September 6, 2026 · 2 min

Locked at the Entrance 精读:RLVR 的多样性坍缩发生在推理的门口

RLVR 提升 pass@1 却坍缩解空间已是共识,但坍缩发生在哪一步始终未知。上海大学×伯明翰大学在 Countdown 任务上穷举解空间、按首操作数+算子划分入口族,把求解分解为 access×execution:PPO 覆盖 0.337→0.111,首算术操作前的似然偏移是下游的 11–16 倍,塞一个入口前缀就能让低覆盖族完成率 0.018→0.212——能力还在,只是不再进门。后层参数插值恢复 37% 覆盖且 pass@1 零损失。

September 6, 2026 · 2 min

MachCSL 精读:MIT 用 AI Agent 把 xv6 内核验证推进到 RISC-V 硬件级

MIT CSAIL(Kaashoek×Zeldovich)的 MachCSL 把并发分离逻辑(Iris 系)扩展到 RISC-V 硬件级语义——页表翻译、TLB、特权级、DMA、断电——并以此为基座证明 6,593 行 xv6 内核的全部不变量。验证过程发现 9 个 xv6 bug 与 1 个 Sail 语义 bug;全程由 LLM Agent 深度参与:77 天、407 个 agent 会话、2,254 个子代理运行、Claude 累计运行 1,729 小时。

September 6, 2026 · 2 min