Harness as a Language×Bounded Loops:Agent 脚手架的语言化与可验证化 精读

本精读合并解读两篇同期论文:MIT CSAIL 的 Harness as a Language(JAZ)把 agent harness 定义为一个极小的语言原语 invoke,函数体由 LLM 在调用时现场生成,从而用纯提示在长程记忆与自我改进两类任务上超过专用 harness;Qualixar 的 Bounded Loops 则给 harness 装上类型化循环与静态验证器,运行前即可证明终止性、花费上界与完成性三性质。两篇论文共同指向一个主题:harness 正从工程偶然走向数学对象——能做什么可证明,花多少可预证。本精读覆盖两文的动机、形式化核心、实验证据、交叉验证的根源解释,以及可迁移到其他领域的通用灵感。

September 25, 2026 · 7 min

Just-in-Time Memory×EnSIMem:智能体记忆的读时策展与实体索引 精读

本篇合并精读两篇同期 Agent 记忆论文:Salesforce 的 Just-in-Time Memory(JITMEM)把记忆策展从写时推迟到读时,读取时刻按当前任务即时从原始轨迹合成上下文,在 ALFWorld/WebShop/τ2-bench 上较最强基线提升 16.2/16.3/3.9 个成功率点;UIUC+Amazon 的 EnSIMem 用实体-属性索引重组长期记忆,检索沿实体关系而非时间线推进,在 LoCoMo/LongMemEval 上取得 90.6%/92.8% 的新 SOTA。两篇论文恰好回答了记忆系统两个正交的问题——何时策展(读时 vs 写时)与如何组织(实体索引 vs 时间线),合并精读可以拼出智能体记忆设计的完整坐标图。

September 25, 2026 · 5 min

PACT: From Credit Assignment to Critic Alignment 精读

强化学习已成为大语言模型后训练的核心组件,但 token 级信用分配始终缺乏公认的数学定义。本精读拆解 AllSpark 团队的 PACT 论文:以完备性、前缀一致性、中性性三个正则条件唯一确定 token 级信用——即条件奖励预测的鞅差分序列;由此统一解释理想教师下的在线蒸馏等价隐式 critic、RLOO 的梯度等价性、以及 GAE 中间 critic 误差可淹没真实信用等现象;进而提出 Actor-then-Critic 更新顺序、重要性采样修正与 BCE 损失的 PACT 训练流程。在四个数学基准上平均 72.87%,SWE-bench Verified 达 67.4%,分别超越 GRPO 8.80 与 2.0 个百分点。

September 25, 2026 · 7 min

Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? 精读

SWE-bench 上的高分到底是真实的仓库级推理能力,还是对训练语料的死记硬背?上海交通大学等机构提出 SchrodingerRepo 评测框架,把测试仓库从一份静态代码变成评估期才『定型』的潜变量:agent 进入环境前,仓库处于语义等价但表面形态不定的叠加态;进入环境后才按随机种子实例化为重命名、重排、重写过的陌生仓库。实验显示,所有受测 LLM 在 SWE-bench Verified 上解决率下降 6.0–14.4 个百分点(p<0.05),且超过八成的额外交互开销花在仓库探索上;而在时间上隔离污染的 SWE-rebench 实例上解决率不变、只有成本上升——说明退化确实来自对熟悉仓库线索的记忆依赖,而非任务变难。本精读覆盖其四级变换方法、四组实验证据、外部交叉验证与可推广启发。

September 25, 2026 · 5 min

SkillApt×TwinCheck:技能何时加载与调用如何验证——反事实证据的双重应用 精读

本精读合并解读两篇同期 arXiv 论文:SkillApt 与 TwinCheck。前者针对 Agent 技能库的检索后激活问题,用 WITH/WITHOUT 对照执行构建反事实证据库,在 SRA-Bench 上以 31.5% 的激活率保住 BM25 Top-1 的观测精度并省下 74.3% 的 token;后者针对有状态工具 Agent 的执行边界,在动作执行前构造应当失败的负例孪生调用做证据接地校验,在 BFCL V4 上提升 13.2 个百分点且零误伤。两文共同指向一个命题:把反事实证据作为 Agent 决策的校验锚点,让每一次技能加载与每一次工具调用都有对照实验背书。本文按九部分结构拆解两文的问题定义、解法、实验证据与可迁移灵感,并对外部相关文献做了交叉验证。

September 25, 2026 · 8 min

SkillGym×VHD-Play:技能与环境从「外挂」到「内化」的两条路线 精读

本篇合并精读两篇同期论文:ECNU 与上海AI Lab 的 SkillGym 把人类撰写的 Agent 技能文档转化为可执行、可验证的训练环境,通过对比式技能依赖性测试筛出真技能任务,用 8364 条验证轨迹微调出的 35B 模型在 GDPval 上提升 199 Elo;Georgia Tech 与阿里 Token Foundry 的 VHD-Play 反转环境合成顺序,先解出数学模型再让同一个解同时供出环境动力学与奖励函数,把 Qwen3.6-35B 的智能体得分从 0.204 拉到 0.815。两篇论文共同指向一个趋势:把知识变成环境的因果反馈而非文本的表面模仿,让技能与环境从推理时的外挂变成训练中的内化。

September 25, 2026 · 8 min

StateComp×PaMER:长程智能体的历史压缩时机与记忆控制信号 精读

深度精读同一团队(TierFlow+中国人民大学+清华大学)的两篇姐妹论文:StateComp 首次将「何时压缩历史」建模为状态条件判定问题,构建 KEEP/READY 显式监督数据集与冻结模型隐状态路由器,token 减少 52.27% 且 reward 持平;PaMER 进一步发现压缩与召回控制信号在动作发生前已可从隐状态线性读出(AUROC 0.831/0.765),证明记忆操作是提前计划的,据此构建的门控压缩系统 token 减少 71.7% 且 reward 反升 1.7。

September 25, 2026 · 7 min

WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents 精读

深度精读 CMU 与清华大学合作的 WhatWorkedBench——首个将实验理解力量化为可执行评测的基准:智能体在测量预算内选择实验、提交覆盖全部配置组合的响应面预测表,与离线 CPU 穷举的 1248 个配置真值逐条比对条件效应误差。本文覆盖实验理解力定义、八族工作流目录、35/36 任务符号反转的发现、共享推断与代码等价编码两大机制,以及与 MLE-bench 等工作的谱系定位、必要知识反推和七条通用性灵感,全面拆解这项把优化成功与干预知识首次分离的评测研究。

September 25, 2026 · 6 min

控制 token 注入×工具缓存逆转:Agent 安全与训练基础设施的两个隐蔽失效面 精读

本文合并精读两篇 Agent 安全论文。论文 A 证明:向工具调用上下文追加模型自身的控制 token,可让 gpt-oss-20b 的思维链从 52.5 个 token 降为 0,CoT 监督器拿不到任何可判信号,39.6% 原本被拒的恶意请求转化为成功执行——因为 CoT 是采样行为的产物而非义务。论文 B 证明:边缘正确的工具缓存会在组内共享随机结果时系统性偏移 GRPO 的 baseline,共享更新方向由胜率差而非均值差决定,符号可整体翻转,540 组配置穷举验证。两者共同指向:Agent 系统的失效面在结构层(解码 harness、缓存、归一化器)而非模型层。

September 25, 2026 · 7 min

「会说」到「会做」,隔着一天三百万的纠错账:云栖2026高德技术峰会复盘

云栖2026高德技术峰会上,高德把「空间智能」从口号推进到产品:全空间无人体系七城启动,ABot全栈具身体系公开技术底牌。但圆桌算出的账更冷峻:顺丰0.1个百分点的准确率差对应每天三百万损失,无人配送要过20%降本门槛,B端车辆利用率仅30%。智能的稀缺性正从模型能力转向物理世界的系统可靠性——这是判断物理AI何时规模化的三把尺。

September 24, 2026 · 1 min