LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 精读

深度精读阿里 DreamX 团队联合北邮、UNSW Sydney 与 Data61 CSIRO 推出的 LoopArena:首个把『模型作为运行时循环控制者』的编排能力本身作为被评测对象的基准。它冻结 Worker 编码智能体与全部执行环境,只比较 Controller 模型在 advance/verify/stop 三类决策上的表现;Type I/II/III 三级成本递减设置使其可低成本诊断循环控制能力。关键发现:完整任务上最强 Controller(GPT-5.5)Strict Success Rate 仅 24.69%,机械重复目标的 fixed control 在全任务上与无控制持平(18.52%),证明有用的循环控制必须随运行状态自适应切换;Type II 切片评估平均省 64.4% 成本且与全任务排序高度一致(Spearman ρ=0.9747)。

August 31, 2026 · 5 min

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper 精读

深度精读北邮、北大与腾讯微信AI合作的 VERA-RL。论文研究’无预设问题、无预设证据’的全文科学错误检测:构建 Reason–Verify–Scan 三阶段课程链数据集 VERA-13K(12,900 样本、6 类错误),用 DAPO 算法与三维奖励(推理完整度+证据对齐+错误精确度)训练 Qwen3-VL-8B,Scan 综合分从 2.0 升至 19.5,超过 235B-Thinking 模型;消融证明单奖励训练会让 Scan 崩溃、纯 Scan 训练反而更差,三维奖励与混合课程缺一不可。

August 31, 2026 · 4 min

openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents 精读

深度精读华为开源的 openJiuwen 编码智能体 harness。论文把 agent harness 提升为一等系统层,用两大设计原则回应长时程编码的挑战:结构可组合性(共享 Inner Loop/Outer Loop 执行基座 + Rail 生命周期钩子上的有序能力组合,同一执行语义从单智能体复用到子智能体与 Swarm Flow 多智能体流)与运行时适应性(在固定模型策略周围改变框架控制的运行时状态:Context Management 渐进压缩、Goal Mode 语义化验收停止、LSP 被动反馈闭环修正、Self-Reflection 跨任务经验蒸馏)。SWE-bench Verified 达 82.6%(超最强榜单 3.4 个百分点)、Terminal-Bench 2.1 达 87.19%;模型对齐对比下 1-4 小时长任务 52.38% vs mini-swe-agent 同设定 35.71%,佐证上下文管理在长轨迹上保住了深推理收益。

August 31, 2026 · 5 min

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems 精读

深度精读北京大学、小米 LLM-Core、香港大学与中国人民大学合作的 PersonaForge。真实 agent 使用中 75.9% 为多轮交互(中位 10 轮用户消息、均值 99 次工具调用、38.7% 含显式纠错),而训练数据几乎全按『首条消息信息完备』合成——供需严重脱节。PersonaForge 用四维人物空间、SOUL 行为控制与逆向深度构建(从真实种子查询反推画像)合成 6.3K 多轮训练数据,并构建 138 题人工标注基准。SFT 后 Qwen3.5-27B 综合分 +4.1%、MiMo-V2-Flash +15.7%,交互轮数与工具调用显著减少;消融证明连接记忆是最关键组件。

August 31, 2026 · 4 min

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests 精读

编程智能体的能力几乎都用 SWE-BENCH 系基准衡量,但其任务来自精修的 GitHub issue——长、结构化、信息丰富;真实用户请求却往往短、随意、信息稀疏。成均馆大学团队先定义六类信息分类学与四个语言学维度,量化出残酷的错位:仅含问题陈述的请求占真实提示的 88% 却只占基准任务的 7%,87% 的真实提示口语化而 94% 的基准问题书面化。据此构造 381 个多变体任务族(族内共享任务与 gold patch、只变信息组合与风格),评估七个模型发现真实输入平均拉低解析率 6.4 个百分点、足以改变排名;受控消融进一步定位:期望行为 [D] 与动机 [M] 是关键信号(+6.8 到 +9.9pp),复现步骤与环境信息只增加 token 却无可测收益,语言风格几乎不影响性能。本文按九部分结构精读这个『表达方式可被逐字段归因』的评估范式。

August 31, 2026 · 4 min

SPT: Skills as Pre-Training Data for Agentic Language Models 精读

深度精读北京邮电大学与清华大学论文 SPT。论文提出把公开的多文件技能包当作预训练中段(mid-training)数据:清洗 ClawHub 上 38,040 个技能包构建 SkillCorpus(约 3.48 亿 token),用 Reference Insert 序列化策略把被引用文件插入到指令首次提及处,使引用距离缩短 94.92%。7B 模型四个 Agent 基准平均分从 28.50 提升到 53.46(+24.96),通用能力几乎无损,30% 技能混合配比效果最佳。

August 31, 2026 · 4 min

String: An Agentic OS Where Every App Is a Markdown File 精读

LLM Agent 正在成为一种新的软件用户,但它们用的界面全是为别人设计的:网页为人眼而生,JSON schema 为程序而生,而 Agent 每一轮都要为自己看到的每样东西重新付费。首尔国立大学与 H1R.AI 的 String 开源运行时把这个问题当成操作系统问题来解:一个 SFMD(String 风格 Markdown)文档声明应用的视图、类型化动作、导航与凭证,运行时负责发现、校验、执行、状态与机密,Agent 只需两个动词——/open 看与 /act 做。SkillsBench 87 任务上六个模型成功率与精选技能持平(51.8% vs 50.5%)且完成片段 token 平均省 33.5%;常驻接口稳定在 53 token 对比全 schema 的 103,518;分阶段披露被因果实验证明有效——tier-2 细节提前一轮展示就损失 11.6 至 23.3 个准确点。

August 31, 2026 · 5 min

TACIT-SWITCH: Cost-Aware Model Escalation for LLM Agents from Censored Supervision 精读

深度精读北师大统计学院与香港理工大学合作的 TACIT-SWITCH。论文研究 LLM Agent 运行中何时把控制权从便宜小模型永久移交给强模型这一停时问题,把医学统计的生存分析工具箱搬进 agent 路由:配对 Cheap-Strong 双 rollout 结局加教师标注的粗移交窗口构成区间删失监督,混合治愈模型拆开两个不确定性——强模型能否救回与累积风险何时越过阈值,部署时无需教师。机制仿真 73.52% 对三类基线提升 7.39-11.12 个百分点;ALFWorld 4B→27B 上 48.5% vs 22.4%,DABench 73.1% 且成本最低。统计学家跨界的范例之作。

August 31, 2026 · 5 min

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning 精读

长时程智能体 RL 的核心难题是信用分配:稀疏的终端奖励被广播给轨迹里每个动作,成败的原因被抹掉了。现有方法从 rollout 侧构造代理信号(重复状态、轨迹图、语义邻近、事后复盘、分支采样)估计动作重要性,却把判定成败的验证器当成一个标量奖励丢掉了内部结构。清华大学、西安交通大学与嘉兴南湖大学提出 VICT,把程序化验证器拆解为可执行原子,通过写入/揭示/提交/违例四类见证谓词把原子回溯到具体动作,仅沿这些证明边重分配组相对优势。ALFWorld 93.7%、WebShop 严格成功 83.6%,消融排除了稠密原子奖励、仅提交信用、时间邻近等简单解释,且可与 rollout 侧方法叠加。本文按九部分结构精读其机制与证据。

August 31, 2026 · 4 min

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读

多模态搜索智能体常被环境拖后腿:许多搜索环境只把网页转成文本喂给模型,工具返回的图片直接丢弃,号称多模态的轨迹实际退化成纯文本推理;长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness,把检索图像注册为可寻址的持久状态并跨轮回灌,配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench,基于 30B 模型在 8 个基准上取得 55.97% 平均分,媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。

August 31, 2026 · 4 min