PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents 精读

Agent 的自我改进大多发生在一次任务结束之后——但那时这次运行已经救不回来了。AllSpark 团队的 PILOT 把自改进做成 live 的:监督者通过双向活通道在工作者执行中途重定向或中止(live steering),同时从活轨迹蒸馏可复用技能进持久 harness(live self-evolution),模型参数全程冻结。在 Terminal-Bench 2.0 上 PILOT 以 71.6 均分领先最强单 Agent 基线 5.3 个点;20 轮自改进迭代后 GLM-5.1 从 66.3 升至 80.9(+14.6pp),每任务输出 token 反降 42.9%。评测协议设计严谨:运行中零基准反馈,验证器只决定哪些更新进入下一轮。本文精读其监督者-工作者架构与两个中途纠偏案例。

August 28, 2026 · 4 min

Planting a Latent Variable in Natural-Looking Text: A More Realistic Test of Belief States in LLMs 精读

Transformer是否真的在学习贝叶斯后验「信念状态」?此前这只在玩具HMM token序列上被证明过。这篇来自Columbia的单作者论文设计了一个聪明的实验范式:让Gemma-2-2B教师模型写普通文本时,沿8个正交SAE方向做「阈下转向」,把一个由环形Markov链控制的潜变量植入自然语言;再让110M学生transformer从零训练在这批语料上。结果学生模型残差流中线性探针能恢复最优贝叶斯观测者后验(R²=0.49),且8个状态在表示空间中自发排成Markov链原序的环——首次把信念状态几何与概念流形形成机制实证关联起来。方法论亮点是「用转向植入受控潜变量」,让自然语言既保留自然性又拥有完整ground truth。

August 28, 2026 · 1 min

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems 精读

多智能体系统(MAS)失败后重跑一次就能修好?这篇论文用 SymTrace 可控回放框架和 536 条人工标注失败轨迹(SymFail)证明:现有任务级重跑方法的修复成功率仅 6.90%,且主要是靠 LLM 采样随机性’碰’出来的,而非真正修复了失败机制。作者提出的症状驱动节点级干预把单次干预修复率提到 20.15%(相对最强基线提升 191.89%)。本文精读其可控回放的数据集设计、实验证据与’因果修复 vs 随机修复’的方法论启示。

August 28, 2026 · 5 min

Same Model, Different Harness: Different Coding-Agent Results 精读

同一个模型、同一批任务,只换 Agent Harness 的配置,编码成功率能差多少?独立研究者 Sydney Lewis 用严格的配对实验给出答案:在 20,480-token 紧窗口下,SWE-bench Verified 的平均 F2PF 从 28% 涨到 49%,完全解决数从 43 到 72。treatment 只有三件机械武器:半衰期规则缩短旧工具结果、检测器打断重复劳动、命令防护。论文最有冲击力的结论是方法论层面的——模型加 harness 才是被测求解器,单报模型名字的编码评测并不完整。本文精读其实验设计、跨四模型迁移证据与机制分析(阅读边界翻倍)。

August 28, 2026 · 3 min

SARA: When Tool Outputs Become Commands 精读

深度精读中科院信工所的 Agent 安全论文 SARA。核心思想是把「动作诱导」与「执行授权」拆开:工具输出可以参与任务实例化,但绝不能自行获得执行权威。通过上下文隔离的 Action Probe、持久动作来源追踪、审计执行证据与参数级支持检查,SARA 在 AgentDojo 与 AgentDyn 上把间接提示注入攻击成功率压到 0.63% 以下,而良性任务代价远小于强隔离方案 CaMeL。

August 28, 2026 · 2 min

Scaling Model-Generated Distillation Data Can Make Latent Teacher Traits More Recoverable 精读

合成数据规模化通常被当作性能杠杆:数据越多、学生模型越强。这篇上海交大、复旦与上海 AI 实验室合作的论文揭示了第二效应——更多独立样本会让教师的隐藏特质在学生行为中更易检测、更特异。受 subliminal learning 启发的受控实验中,教师被诱导出目标特质后只生成纯数字补全这类严格离题数据(过滤一切显式线索),学生在不同规模数据上训练:动物偏好特质的正确定位数从 2/16 升至 14/16;evil 系统提示教师的学生的不安全率从 2% 涨到 33.7%;连跨模型身份迁移中 5 种假身份全部登顶。安全警示振聋发聩:小规模试点审计会系统性低估部署规模下的可学习风险——今天看似无害的离题数据,规模化后可能精确传递教师的不安全倾向。

August 28, 2026 · 2 min

SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models 精读

潜在思维链模型把中间推理从生成的文本搬进连续内部状态,代价是因果对象被藏了起来:无法再靠阅读推理文本验证忠实性。SCIT(Suffix Cache Interchange Test)把「干预潜步成功了吗」细化为「到底是哪个transformer对象在因果承载这个计算」——是hidden state、key cache、value cache,还是某个缓存段?通过构造精确的source-recipient反事实对并网格化移植cache切片,论文发现:在CODI-GPT2算术检查点上,反事实转移主要由中晚期value-cache后缀轨迹承载,而非hidden向量、key路由或可复用答案槽;且8B能力更强模型上载体整体迁移到prompt-prefix。方法层面「载体测试」将interchange intervention从预指定变量推广到发现承载对象本身。

August 28, 2026 · 1 min

SPA: Securing Persistent LLM Agents Across Queries with Plan-First Information-Flow Control 精读

深度精读南佛罗里达大学的持久化 Agent 安全论文 SPA。针对跨查询的延迟注入攻击——周一埋入的恶意账户潜伏到周二的付款请求中生效——SPA 采用计划先行架构:planner 每查询只调用一次、生成声明式 DSL 完整计划,工具输出与持久化 payload 永不进入 planner 上下文,再以 Bell-LaPadula+Biba 双格信息流控制静态验证计划。在 tool_knowledge 攻击下 ASR 降至 0%,但约 53% 的合法计划被完整性检查拒绝,暴露出强完整性的安全-效用张力。

August 28, 2026 · 2 min

TTPO: Test-Time Policy Optimization 精读

没有标签也能在测试题上直接训练模型?浙大与阿里的 TTPO 给出了一个干净的不对称方案:多数投票选出伪标签后,同意的 rollout 走蒸馏分支(OPSD 前向 KL + 降权已收敛 token),不同意的走 GRPO 惩罚分支(只罚高置信错误 token)。核心洞察是一个反直觉的数据事实——竞赛题上伪标签约 85% 是错的,但不同意它的 rollout 约 79% 本身也是错的,所以「惩罚不一致」不需要伪标签正确,而蒸馏会逐 token 放大标签错误。无标签 TTPO 在五个竞赛级基准上追平甚至超过用真标签的 OPSD,Qwen3-1.7B 从 38.0% 提到 45.2%,4B 版本达到 8B base 水平。本文精读其不对称目标设计与自进化机制。

August 28, 2026 · 1 min

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 精读

进化策略(ES)一直被视为 GRPO 的『省显存平替』——不用反向传播、显存开销低,但性能似乎差一截。这篇来自南方科技大学、华为诺亚方舟实验室等机构的论文系统性地推翻了这个刻板印象:理论上证明 ES 种群内 verifier 投影的 Jensen–Shannon 多样性直接利好 Pass@K;实证上发现 GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base 模型,而 ES 全面高于 base。更有趣的是 ES→GRPO 顺序训练同时拿下最高 Pass@1 与最高 Pass@32。论文还发现 ES 参数漂移是 GRPO 的 40 多倍,但抹掉 93% 的小幅更新后性能几乎不变——大漂移不等于灾难性遗忘。本文精读其理论框架、实验证据与 ES 作为独立后训练范式的定位。

August 28, 2026 · 3 min