Praxist: From Experimental Artifacts to Solution Lineages 精读

自主 R&D Agent 已经会写代码、跑实验、改工件,但多数系统把每次尝试当作近乎独立的事件——日志记下了「发生了什么」,却没建立「哪个设计元素带来了提升、证据是否经受住验证、如何与其他元素重组」。长周期研究于是反复重学同样的教训。Sapient Intelligence 联合南洋理工、清华、CMU、UPenn 的 PRAXIST 提出「证据继承」:把可复现工件与评估结果转化为类型化的发现(正/负/诊断/不确定/程序性)、四车道 frontier(confirmed/candidate/diagnostic/validation)与世代议程,失败与诊断成为一等证据。MLE-bench 全 75 题拿下 60 枚奖牌(49 金),花费 3,054 美元——约为 Claude Code+Opus 4.8 基线(38,370 美元、55 枚、34 金)的十二分之一;火箭着陆案例从 4.03% 起步做到 12,288/12,288 满分。

August 27, 2026 · 4 min

Prefix Sliding for efficient test-time scaling 精读

斯坦福、华盛顿大学联合 Prime Intellect 等机构提出 Prefix Sliding:推理时只保留前缀(系统指令+prompt,充当注意力锚点)+ 最近数千 token 滑动窗口,丢弃中间推理 token。基于「中间 token 完成子任务后即失去重要性」的注意力概率观察,免训练即可让现有模型提速 3 倍而性能不降;配合截断反向传播,RL 可训练 10 万 token 级长推理轨迹。方法极简但解决了「无限测试时扩展必须有界每 token 成本」这一根本问题。

August 27, 2026 · 4 min

Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows 精读

AI 金融分析师能从 10 万 token 的年报里逐字背出契约阈值,但这条风险披露真的影响它的投资判断吗?Boston College 与 Columbia 商学院团队用固定信息集设计发现:随着无关上下文从 2K 扩到 128K token,一条风险披露对卖出倾向的影响从 +0.032 跌入实验噪声地板,而直接检索保持 12/12 公司满分——“读到了“与“用上了“彻底分离。机制实验定位到两条传输通道:固定容量的运行摘要与注意力查找,均随长度稀释。工作流实验给出解法:extract-then-decide 把 128K 下的影响保留率从 12% 提到 67%,而通用分块摘要在所有长度(含 2K)都将影响归零。核心教训:检索式评估会认证一套“证明了读得到、实际上不用“的判断系统。

August 27, 2026 · 3 min

Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context 精读

深度精读 UC San Diego 的 SCALE-QA 与 TSIM 论文——针对真实助手使用形态「单线程多主题混杂的长对话」定义并测量 episode integrity failure:决定性证据明明在对话里,系统却检索到貌似合理的碎片而非让局部约束生效的完整 episode。SCALE-QA 用 3000 题反事实基准(防预训练泄漏)+ 确定性运行时打包(16k-1M);TSIM 以语义漂移在线分段 + 三视图 episode 索引,在三个后端全部第一(比最强基线高 5.6-17.6 点),1M 诊断中用约 1.3k token 达 96.5% 而 Full Context 用 1.05M token 只有 87.2%。本文拆解「找回 episode 而非答对问题」才是瓶颈的完整证据链。

August 27, 2026 · 5 min

Recuris: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 精读

Recuris(NUS × Stanford × Oxford × Princeton)把递归自我改进从『改模型/改智能体』收缩到『只演化外置记忆控制层』:工作记忆维护经检查器验证的任务状态并按需调用技能,跨任务的固定 Meta-Agent 读结构化轨迹、把失败归因到 E/W/ρ/C 四组件之一并只修补被归因组件,经修复源任务且不回退开发集的验证门才准入。在 4 个长程基准 × 10 个模型上 35/37 完成的模型-基准对成功率提升,GPT-5.6 Sol +17.8、Claude Opus 5 +15.6、最长任务 +32.2 分,六类长程失败模式下降 20–86%;机制上证明长程失败是执行问题而非检索问题,技能价值是『调用条件性』的,结构化轨迹使故障定位从 13.0% 提升到 64.8%。

August 27, 2026 · 3 min

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference 精读

香港四校合作提出 Reflection Steering:一个免训练的激活空间干预框架,用于抑制大推理模型中冗余的反思行为。方法通过 PCA 去噪、对共享推理方向正交化、逐层校准和有界投影删除四阶段,把「反思方向」从「通用推理方向」中解缠出来,在 6 个模型×基准设置中平均节省 16.9% 的思考 token,MATH-500 上精度统计等效。本精读完整拆解其方向净化机制、层校准协议与统计验证方法。

August 27, 2026 · 3 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

当多智能体系统(MAS)执行失败后,重跑一遍、自我反思、批评家反馈这些「修复」方法,究竟是真的修好了 bug,还是仅仅靠 LLM 采样的随机性碰巧撞对了答案?这篇来自华东师范大学等四所高校的论文用 SymTrace 回放框架与 536 条人工标注失败轨迹的 SymFail 数据集给出了冷峻的答案:无引导全量重跑的修复率仅 6.90%,自我反思 4.29%、批评家 3.73%,与随机重采样无异;而基于症状定位的选择性回放干预单次即修复 20.15%。本精读拆解其「冻结上游随机性」的受控评估方法论,并讨论它对整个 Agent 可靠性研究范式的冲击。

August 27, 2026 · 3 min

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards 精读

RePolicy(中科大+NUS+浙大等)把 agent 安全防护的关键一步——从动态策略库中调用适用安全策略——变成可优化的动作:rollout 结构为「策略调用→内容注入→有据推理→安全判断」,冷启动 SFT 后用 GRPO 配三项可验证奖励(格式/策略命中/判断正确)加策略上下文扰动(注入诱饵策略)训练。4B 模型在六个 agent 安全基准上 Overall Unsafe F1 达 88.15,超最强外部通用模型 Claude Sonnet 4.6 达 3.98 分、超最强专用 guard 达 8.46 分;策略命中率从 94.4% 升至 98.5%,诱饵选中率全程低于 1%。本精读拆解其任务形式化、数据构造与「调用-检索-推理」多算力换均衡错误权衡的机制因果链。

August 27, 2026 · 3 min

ReproAgent: Contract-Guided Paper-to-Code Reproduction 精读

ReproAgent(北航+上交+北大等纯高校合作)把论文复现代码生成失败归因于「split-specification」:显式的论文义务在长 agent 轨迹中漂移丢失,隐式的框架默认与仓库惯例根本不在论文里。它用持久化双通道实现契约对症下药——需求通道把论文片段钉成带 id 的代码义务,证据通道从参考文献仓库检索内容与结构证据,双双绑定到文件级契约并贯穿 Prepare–Plan–Generate–Repair 四阶段。在 PaperBench Code-Dev 上以 Claude-Sonnet-4.5 达到 73.7 分刷新纪录,同骨干对比超最强基线 9.2 分,通道消融显示去掉任一通道平均掉 14+ 分。本精读拆解其契约机制、覆盖不变量设计与两通道分工的因果证据。

August 27, 2026 · 3 min

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 精读

提示注入被 OWASP 列为 AI 智能体的头号威胁,而现有“安全 LLM“在自适应攻击下攻击成功率接近 100%。UC Berkeley 团队提出 SecOPD,把在线策略蒸馏(OPD)改造为注入防御训练信号:学生在被攻击输入上滚动生成,冻结的初始模型在对应干净输入上给同一 token 打分,实现 token 级信用分配。在 SEP + PISmith 自适应攻击下,防御后的 Qwen3.6-27B 攻击成功率仅 9.0%,比此前最强防御 Meta-SecAlign 的 94.0% 低一个数量级;同时七项效用基准平均 88.1%,与未防御模型持平。本精读覆盖问题定义、方法机制、实验证据、效果根源解释与可迁移灵感。

August 27, 2026 · 3 min