ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读

深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot:一个主动上下文管理框架。针对现有方法工具集贫乏(只有搜索/删除/摘要)、探索低效(上下文编辑动作影响悬殊却被均匀采样)、信用分配粗粒度(轨迹级奖励平摊给所有编辑动作)三大缺陷,它扩展出规划、长期记忆、软卸载三类工具,并用上下文变化量+熵变化识别关键编辑决策做分支采样(context-aware partial rollout),再用所有后续分支的平均回报估计动作级优势(细粒度信用分配,方差降为 1/n)。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85;深搜任务上每轮输入 token 稳定在 8-10K(基线线性涨到 30K);消融证明细粒度信用分配贡献最大且在全部基准一致提升。

August 31, 2026 · 5 min

Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense 精读

滑铁卢大学与Vector Institute提出跨会话分解攻击:攻击者在互不关联的会话中提出看似良性的子问题,事后在模型外重组为有害目标。论文首次将其形式化为组合安全风险,证明风险转移定理——部署模型与参考环境的组合风险之差由允许子查询上的超额损失控制,说明缩放会把潜在组合风险转移到部署模型。配套600意图实验显示同族内更大模型重组后危害更高,而22M参数的IntentAlign-MiniLM意图对齐检索器以少25倍的参数超越0.6B嵌入模型,并证明检索是防御的主导杠杆。本精读覆盖其理论推导、双轨实验证据与防御设计的因果链条。

August 31, 2026 · 3 min

HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees 精读

深度精读蚂蚁集团的 HARTS 训练系统。Agentic RL 的 rollout 呈不规则树状、轨迹共享长前缀,逐轨迹独立训练重复计算共享前缀(实测冗余约 5.63 倍);而现有树结构训练系统只支持全注意力模型。HARTS 首次在真实混合注意力模型(MLA+KDA 的 Ling-3.0-tiny)上实现任意 rollout 树的前缀共享:联合微批规划、线性时间的最少调用执行规划、可微状态交接与语义多重性恢复 RL/MoE 目标。实测前向/反向/梯度加速 4.81–4.87 倍,logit 余弦相似度大于 0.9997,在线训练奖励趋势与基线一致。

August 31, 2026 · 4 min

Logos: An Agent Harness on a Cross-Process Bus 精读

深度精读 Sussex、浙江工商大学与上海书缘信息技术合作的 Logos(AAMAS 2027)。针对单进程 agent 框架插件与会话共存一个进程的单点故障问题,论文用四个引理证明时空可组合性演算的可逆性保证可跨进程成立——可靠性不变量只定义在状态空间上,而模型推理是无状态的;再构建 ROS 风格跨进程 harness:插件即进程、路由器只存路由表、唯一共享状态是 append-only 转录。80 个会话在四个击杀点上全部冷切换恢复且零重复效应,总线跳 0.215ms 仅为首 token 的 1/823;同故障下单进程停机 547.1ms 中断全部会话,对等构造只影响一个节点。

August 31, 2026 · 4 min

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 精读

深度精读阿里 DreamX 团队联合北邮、UNSW Sydney 与 Data61 CSIRO 推出的 LoopArena:首个把『模型作为运行时循环控制者』的编排能力本身作为被评测对象的基准。它冻结 Worker 编码智能体与全部执行环境,只比较 Controller 模型在 advance/verify/stop 三类决策上的表现;Type I/II/III 三级成本递减设置使其可低成本诊断循环控制能力。关键发现:完整任务上最强 Controller(GPT-5.5)Strict Success Rate 仅 24.69%,机械重复目标的 fixed control 在全任务上与无控制持平(18.52%),证明有用的循环控制必须随运行状态自适应切换;Type II 切片评估平均省 64.4% 成本且与全任务排序高度一致(Spearman ρ=0.9747)。

August 31, 2026 · 5 min

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper 精读

深度精读北邮、北大与腾讯微信AI合作的 VERA-RL。论文研究’无预设问题、无预设证据’的全文科学错误检测:构建 Reason–Verify–Scan 三阶段课程链数据集 VERA-13K(12,900 样本、6 类错误),用 DAPO 算法与三维奖励(推理完整度+证据对齐+错误精确度)训练 Qwen3-VL-8B,Scan 综合分从 2.0 升至 19.5,超过 235B-Thinking 模型;消融证明单奖励训练会让 Scan 崩溃、纯 Scan 训练反而更差,三维奖励与混合课程缺一不可。

August 31, 2026 · 4 min

openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents 精读

深度精读华为开源的 openJiuwen 编码智能体 harness。论文把 agent harness 提升为一等系统层,用两大设计原则回应长时程编码的挑战:结构可组合性(共享 Inner Loop/Outer Loop 执行基座 + Rail 生命周期钩子上的有序能力组合,同一执行语义从单智能体复用到子智能体与 Swarm Flow 多智能体流)与运行时适应性(在固定模型策略周围改变框架控制的运行时状态:Context Management 渐进压缩、Goal Mode 语义化验收停止、LSP 被动反馈闭环修正、Self-Reflection 跨任务经验蒸馏)。SWE-bench Verified 达 82.6%(超最强榜单 3.4 个百分点)、Terminal-Bench 2.1 达 87.19%;模型对齐对比下 1-4 小时长任务 52.38% vs mini-swe-agent 同设定 35.71%,佐证上下文管理在长轨迹上保住了深推理收益。

August 31, 2026 · 5 min

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems 精读

深度精读北京大学、小米 LLM-Core、香港大学与中国人民大学合作的 PersonaForge。真实 agent 使用中 75.9% 为多轮交互(中位 10 轮用户消息、均值 99 次工具调用、38.7% 含显式纠错),而训练数据几乎全按『首条消息信息完备』合成——供需严重脱节。PersonaForge 用四维人物空间、SOUL 行为控制与逆向深度构建(从真实种子查询反推画像)合成 6.3K 多轮训练数据,并构建 138 题人工标注基准。SFT 后 Qwen3.5-27B 综合分 +4.1%、MiMo-V2-Flash +15.7%,交互轮数与工具调用显著减少;消融证明连接记忆是最关键组件。

August 31, 2026 · 4 min

SPT: Skills as Pre-Training Data for Agentic Language Models 精读

深度精读北京邮电大学与清华大学论文 SPT。论文提出把公开的多文件技能包当作预训练中段(mid-training)数据:清洗 ClawHub 上 38,040 个技能包构建 SkillCorpus(约 3.48 亿 token),用 Reference Insert 序列化策略把被引用文件插入到指令首次提及处,使引用距离缩短 94.92%。7B 模型四个 Agent 基准平均分从 28.50 提升到 53.46(+24.96),通用能力几乎无损,30% 技能混合配比效果最佳。

August 31, 2026 · 4 min

String: An Agentic OS Where Every App Is a Markdown File 精读

LLM Agent 正在成为一种新的软件用户,但它们用的界面全是为别人设计的:网页为人眼而生,JSON schema 为程序而生,而 Agent 每一轮都要为自己看到的每样东西重新付费。首尔国立大学与 H1R.AI 的 String 开源运行时把这个问题当成操作系统问题来解:一个 SFMD(String 风格 Markdown)文档声明应用的视图、类型化动作、导航与凭证,运行时负责发现、校验、执行、状态与机密,Agent 只需两个动词——/open 看与 /act 做。SkillsBench 87 任务上六个模型成功率与精选技能持平(51.8% vs 50.5%)且完成片段 token 平均省 33.5%;常驻接口稳定在 53 token 对比全 schema 的 103,518;分阶段披露被因果实验证明有效——tier-2 细节提前一轮展示就损失 11.6 至 23.3 个准确点。

August 31, 2026 · 5 min