Praxist: From Experimental Artifacts to Solution Lineages 精读

自主 R&D Agent 已经会写代码、跑实验、改工件,但多数系统把每次尝试当作近乎独立的事件——日志记下了「发生了什么」,却没建立「哪个设计元素带来了提升、证据是否经受住验证、如何与其他元素重组」。长周期研究于是反复重学同样的教训。Sapient Intelligence 联合南洋理工、清华、CMU、UPenn 的 PRAXIST 提出「证据继承」:把可复现工件与评估结果转化为类型化的发现(正/负/诊断/不确定/程序性)、四车道 frontier(confirmed/candidate/diagnostic/validation)与世代议程,失败与诊断成为一等证据。MLE-bench 全 75 题拿下 60 枚奖牌(49 金),花费 3,054 美元——约为 Claude Code+Opus 4.8 基线(38,370 美元、55 枚、34 金)的十二分之一;火箭着陆案例从 4.03% 起步做到 12,288/12,288 满分。

August 27, 2026 · 4 min

Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows 精读

AI 金融分析师能从 10 万 token 的年报里逐字背出契约阈值,但这条风险披露真的影响它的投资判断吗?Boston College 与 Columbia 商学院团队用固定信息集设计发现:随着无关上下文从 2K 扩到 128K token,一条风险披露对卖出倾向的影响从 +0.032 跌入实验噪声地板,而直接检索保持 12/12 公司满分——“读到了“与“用上了“彻底分离。机制实验定位到两条传输通道:固定容量的运行摘要与注意力查找,均随长度稀释。工作流实验给出解法:extract-then-decide 把 128K 下的影响保留率从 12% 提到 67%,而通用分块摘要在所有长度(含 2K)都将影响归零。核心教训:检索式评估会认证一套“证明了读得到、实际上不用“的判断系统。

August 27, 2026 · 3 min

Recuris: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 精读

Recuris(NUS × Stanford × Oxford × Princeton)把递归自我改进从『改模型/改智能体』收缩到『只演化外置记忆控制层』:工作记忆维护经检查器验证的任务状态并按需调用技能,跨任务的固定 Meta-Agent 读结构化轨迹、把失败归因到 E/W/ρ/C 四组件之一并只修补被归因组件,经修复源任务且不回退开发集的验证门才准入。在 4 个长程基准 × 10 个模型上 35/37 完成的模型-基准对成功率提升,GPT-5.6 Sol +17.8、Claude Opus 5 +15.6、最长任务 +32.2 分,六类长程失败模式下降 20–86%;机制上证明长程失败是执行问题而非检索问题,技能价值是『调用条件性』的,结构化轨迹使故障定位从 13.0% 提升到 64.8%。

August 27, 2026 · 3 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

当多智能体系统(MAS)执行失败后,重跑一遍、自我反思、批评家反馈这些「修复」方法,究竟是真的修好了 bug,还是仅仅靠 LLM 采样的随机性碰巧撞对了答案?这篇来自华东师范大学等四所高校的论文用 SymTrace 回放框架与 536 条人工标注失败轨迹的 SymFail 数据集给出了冷峻的答案:无引导全量重跑的修复率仅 6.90%,自我反思 4.29%、批评家 3.73%,与随机重采样无异;而基于症状定位的选择性回放干预单次即修复 20.15%。本精读拆解其「冻结上游随机性」的受控评估方法论,并讨论它对整个 Agent 可靠性研究范式的冲击。

August 27, 2026 · 3 min

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards 精读

RePolicy(中科大+NUS+浙大等)把 agent 安全防护的关键一步——从动态策略库中调用适用安全策略——变成可优化的动作:rollout 结构为「策略调用→内容注入→有据推理→安全判断」,冷启动 SFT 后用 GRPO 配三项可验证奖励(格式/策略命中/判断正确)加策略上下文扰动(注入诱饵策略)训练。4B 模型在六个 agent 安全基准上 Overall Unsafe F1 达 88.15,超最强外部通用模型 Claude Sonnet 4.6 达 3.98 分、超最强专用 guard 达 8.46 分;策略命中率从 94.4% 升至 98.5%,诱饵选中率全程低于 1%。本精读拆解其任务形式化、数据构造与「调用-检索-推理」多算力换均衡错误权衡的机制因果链。

August 27, 2026 · 3 min

ReproAgent: Contract-Guided Paper-to-Code Reproduction 精读

ReproAgent(北航+上交+北大等纯高校合作)把论文复现代码生成失败归因于「split-specification」:显式的论文义务在长 agent 轨迹中漂移丢失,隐式的框架默认与仓库惯例根本不在论文里。它用持久化双通道实现契约对症下药——需求通道把论文片段钉成带 id 的代码义务,证据通道从参考文献仓库检索内容与结构证据,双双绑定到文件级契约并贯穿 Prepare–Plan–Generate–Repair 四阶段。在 PaperBench Code-Dev 上以 Claude-Sonnet-4.5 达到 73.7 分刷新纪录,同骨干对比超最强基线 9.2 分,通道消融显示去掉任一通道平均掉 14+ 分。本精读拆解其契约机制、覆盖不变量设计与两通道分工的因果证据。

August 27, 2026 · 3 min

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 精读

提示注入被 OWASP 列为 AI 智能体的头号威胁,而现有“安全 LLM“在自适应攻击下攻击成功率接近 100%。UC Berkeley 团队提出 SecOPD,把在线策略蒸馏(OPD)改造为注入防御训练信号:学生在被攻击输入上滚动生成,冻结的初始模型在对应干净输入上给同一 token 打分,实现 token 级信用分配。在 SEP + PISmith 自适应攻击下,防御后的 Qwen3.6-27B 攻击成功率仅 9.0%,比此前最强防御 Meta-SecAlign 的 94.0% 低一个数量级;同时七项效用基准平均 88.1%,与未防御模型持平。本精读覆盖问题定义、方法机制、实验证据、效果根源解释与可迁移灵感。

August 27, 2026 · 3 min

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents 精读

RL 训练的 LLM Agent 大多是’健忘’的:每个 episode 从零开始,过往经验无法沉淀。阿里高德(AMAP)团队提出的 SkillForge 让技能库在训练中持续进化——prompt 只注入紧凑技能目录,agent 用 <skill_call> 标签按需调用,每次调用成为轨迹中可观测、可归因的离散事件,GRPO 因此能同时优化环境动作与技能调用决策;证据驱动的技能验证(EMA 成功率+使用次数计算欠效分数)让低效技能被 reflexion 及时改写,多路径归纳从成功/失败/对比三通道合成新技能。在 ALFWorld/WebShop/AppWorld 三基准上全面超越 SkillRL(AppWorld SGC 近 3 倍),且 4B 小模型进化出的技能库迁移到 30B 模型能反超其自进化库——技能存的是可迁移知识而非模型私有产物。

August 27, 2026 · 4 min

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments 精读

深度精读 ServiceNow 与 Mila 的企业环境 harness 进化研究——在模型权重完全冻结的前提下,用分层搜索自动进化面向特定企业环境的 agent harness(提示词/工具接口/skills/MCP/子agent/执行循环)。通过按基线失败模式分层采样构建紧凑进化池、proposer 可见搜索集与隐藏选择集分离、test-flip 门控 + 严格爬山接受,在 ITBench SRE / EnterpriseOps-Gym ITSM / AutomationBench Finance 三个基准上较默认 harness 提升 20-35 个百分点,且冻结迁移到 Qwen/GPT 全系列模型仍有效。21 个被接受 patch 归结为三类修复:接口修复、环境约定显式化、压缩搜索的操作知识。

August 27, 2026 · 4 min

SwarmWorld: Stigmergic technological evolution in societies of language-model agents 精读

去中心化的同质 LLM Agent 群落,能在没有预设角色、配方与技术目录的条件下,仅靠共享一个可被改造的物理世界,构建出功能性的技术生态并超越同计算量的独立搜索吗?MIT 的 SwarmWorld 给出受控答案:Agent 只获局部观测并提主张,确定性模拟器独自判定后果(提议-后果分离);评估时移除全部 Agent、冻结世界克隆 8 份施加未见扰动。结果是「有界群体优势」:共享世界在组合韧性、验证发明数上几乎全面超越逐端点 best-of-N 独立包络(发明 5.75–7.00 vs 2.75),但最强单件仍属独立搜索(0.3488 vs 0.2380);约 95% 的技术采纳始于物理观察而非直接交流——共享物理基底而非通信本身才是群体能力的主要来源。

August 27, 2026 · 3 min