HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees 精读

深度精读蚂蚁集团的 HARTS 训练系统。Agentic RL 的 rollout 呈不规则树状、轨迹共享长前缀,逐轨迹独立训练重复计算共享前缀(实测冗余约 5.63 倍);而现有树结构训练系统只支持全注意力模型。HARTS 首次在真实混合注意力模型(MLA+KDA 的 Ling-3.0-tiny)上实现任意 rollout 树的前缀共享:联合微批规划、线性时间的最少调用执行规划、可微状态交接与语义多重性恢复 RL/MoE 目标。实测前向/反向/梯度加速 4.81–4.87 倍,logit 余弦相似度大于 0.9997,在线训练奖励趋势与基线一致。

August 31, 2026 · 4 min

Logos: An Agent Harness on a Cross-Process Bus 精读

深度精读 Sussex、浙江工商大学与上海书缘信息技术合作的 Logos(AAMAS 2027)。针对单进程 agent 框架插件与会话共存一个进程的单点故障问题,论文用四个引理证明时空可组合性演算的可逆性保证可跨进程成立——可靠性不变量只定义在状态空间上,而模型推理是无状态的;再构建 ROS 风格跨进程 harness:插件即进程、路由器只存路由表、唯一共享状态是 append-only 转录。80 个会话在四个击杀点上全部冷切换恢复且零重复效应,总线跳 0.215ms 仅为首 token 的 1/823;同故障下单进程停机 547.1ms 中断全部会话,对等构造只影响一个节点。

August 31, 2026 · 4 min

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 精读

深度精读阿里 DreamX 团队联合北邮、UNSW Sydney 与 Data61 CSIRO 推出的 LoopArena:首个把『模型作为运行时循环控制者』的编排能力本身作为被评测对象的基准。它冻结 Worker 编码智能体与全部执行环境,只比较 Controller 模型在 advance/verify/stop 三类决策上的表现;Type I/II/III 三级成本递减设置使其可低成本诊断循环控制能力。关键发现:完整任务上最强 Controller(GPT-5.5)Strict Success Rate 仅 24.69%,机械重复目标的 fixed control 在全任务上与无控制持平(18.52%),证明有用的循环控制必须随运行状态自适应切换;Type II 切片评估平均省 64.4% 成本且与全任务排序高度一致(Spearman ρ=0.9747)。

August 31, 2026 · 5 min

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems 精读

深度精读北京大学、小米 LLM-Core、香港大学与中国人民大学合作的 PersonaForge。真实 agent 使用中 75.9% 为多轮交互(中位 10 轮用户消息、均值 99 次工具调用、38.7% 含显式纠错),而训练数据几乎全按『首条消息信息完备』合成——供需严重脱节。PersonaForge 用四维人物空间、SOUL 行为控制与逆向深度构建(从真实种子查询反推画像)合成 6.3K 多轮训练数据,并构建 138 题人工标注基准。SFT 后 Qwen3.5-27B 综合分 +4.1%、MiMo-V2-Flash +15.7%,交互轮数与工具调用显著减少;消融证明连接记忆是最关键组件。

August 31, 2026 · 4 min

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests 精读

编程智能体的能力几乎都用 SWE-BENCH 系基准衡量,但其任务来自精修的 GitHub issue——长、结构化、信息丰富;真实用户请求却往往短、随意、信息稀疏。成均馆大学团队先定义六类信息分类学与四个语言学维度,量化出残酷的错位:仅含问题陈述的请求占真实提示的 88% 却只占基准任务的 7%,87% 的真实提示口语化而 94% 的基准问题书面化。据此构造 381 个多变体任务族(族内共享任务与 gold patch、只变信息组合与风格),评估七个模型发现真实输入平均拉低解析率 6.4 个百分点、足以改变排名;受控消融进一步定位:期望行为 [D] 与动机 [M] 是关键信号(+6.8 到 +9.9pp),复现步骤与环境信息只增加 token 却无可测收益,语言风格几乎不影响性能。本文按九部分结构精读这个『表达方式可被逐字段归因』的评估范式。

August 31, 2026 · 4 min

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读

多模态搜索智能体常被环境拖后腿:许多搜索环境只把网页转成文本喂给模型,工具返回的图片直接丢弃,号称多模态的轨迹实际退化成纯文本推理;长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness,把检索图像注册为可寻址的持久状态并跨轮回灌,配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench,基于 30B 模型在 8 个基准上取得 55.97% 平均分,媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。

August 31, 2026 · 4 min

When Evidence Shapes Collaboration: Knowledge-Conditioned Topology Generation for Multi-Agent Systems 精读

深度精读华中科技大学的 K-GAT(神经符号框架)。论文指出现有动态多智能体系统按『先规划后检索』范式仅凭查询语义生成协作拓扑,导致结构失配:证据充足一致时过度规划、证据稀疏冲突时验证不足。K-GAT 反转顺序为『证据先行』:先从 Wikipedia 构建溯源知识图谱检索证据,再以自回归方式逐节点逐边生成以证据为条件的 DAG 协作拓扑,用执行评分+结构剪枝+分布匹配的课程优化训练生成器,辅以 KG-Verifier 验证中间输出。7 基准平均 78.68% 为 8B 规模最强,GPQA 上 50.75% 超 LLM-Debate 15.7 个百分点且 token 消耗减半以上。

August 31, 2026 · 4 min