On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification 精读

Salesforce AI Research对记忆式自改进agent做系统性重评测,揭露被忽视的可靠性问题:多次运行量化显示叠加自改进循环后71%的情形方差增大、同实验最好最差运行差可达10个百分点;默认任务顺序构成隐式课程——按默认顺序+1.5%改进,随机打乱后反而-4.5%。人工检查记忆提出欠规约(underspecification)假说:agent在缺乏清晰规约时生成’看似合理但不可用’的记忆(如纯浏览器环境推荐API用法),rubric与环境反馈注入可部分收窄退化。

August 20, 2026 · 1 min

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs 精读

厦门大学联合上海交大、南洋理工提出PlanPO——解决组相对优化中的优势坍缩(advantage collapse)问题:成功轨迹获得相同结果奖励,迂回成功与高效成功优势无差,组内梯度信号消失。PlanPO在组相对结构内引入粗到细优势信号——轨迹级长度差异+成功条件下的轮级响应长度差异,无需价值模型与人工启发式,在ALFWorld、WebShop、SciWorld三个多轮基准上平均超GRPO 27.2%,额外训练开销可忽略。

August 20, 2026 · 1 min

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC联合KUKA、上海交大、浙大发布SemaPLC——一个项目接地、验证门控的PLC代码生成agent harness。它由常规工具组装而成,却由一条严格的完成纪律统治:agent不许凭自判断宣布完成,只有工具日志确认的规格审计、编译、运行时三类外部检查全部过关才准交付;任何编辑作废全部旧判定并重跑全部检查。在117个独立POU任务上它让全部7个模型拿到最高严格通过率(均值72.6%,超最强基线8.8个百分点);在65个真实工厂项目任务上,其动态行为分52.2碾压基线最高31.4——静态分相近的方法在运行时被彻底分离。编译通过≠跑得对,执行才是生成控制逻辑最忠实的检验。

August 20, 2026 · 6 min

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 精读

SemComp-Bench由中国科学技术大学联合FrameX.AI与中山大学提出,定义了结果导向的语义任务完成视频生成任务:给定参考图像与指令,要求生成视频既达成指定结果,又与参考保持任务相关的语义接地(如把钞票折成乌龟,结果必须是那张钞票折成的乌龟)。团队从Koala-36M约2万条视频经四阶段管线构造1273个结构化实例,并设计OA/GR双维度VLM评测协议。七个代表模型中最高OA仅37.8%,I2V全面碾压T2V(37.8% vs 4.4%),brief指令下OA暴跌至1.7%,GR与OA排名显著错位,揭示了当前视频生成模型会生成却不会完成任务的系统性缺口。

August 20, 2026 · 4 min

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution 精读

上海交通大学顾晓东组提出SkillForge——面向项目特定issue解决的自蒸馏框架。核心洞察是冷启动问题:agent在特定仓库上缺乏项目知识,历史驱动方法依赖过往issue信号、在线方法每题付出昂贵探索成本。SkillForge反其道行之:主动重新实现仓库中带测试覆盖的核心功能来合成项目特定issue,解决后把经验蒸馏为实体锚定技能。SWE-bench Verified上DeepSeek-V3.2达72.2%(+5.8超基线,超最强对手+3.0),GPT-5-mini 60.6%(+5.6),SWE-bench Pro上同样领先,单issue成本仅$0.069-0.087。

August 20, 2026 · 2 min

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学与小红书合作的论文诊断了agent技能选择失败的结构性根因——selector credit starvation:在广播式序列级优势下,命名技能的少数token在损失中份额趋零、继承的信用随轨迹变长而日益错号(选择正确但执行失败时正确选择被惩罚)。SkillGate把token支持划分为两个不相交信用通道:结果信用只达执行token、动作局部优势只达技能命名token(仅当轨迹唯一一次读取是oracle时为正)。5个agent基准、16候选技能档位下,9B策略试验成功率从40.8%提升到53.2%,超同预算outcome-only RL受控对照,误导技能暴露减少三分之二,读取技能更少。

August 20, 2026 · 5 min

SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

当高质量人类文本接近耗尽,LLM 训练的瓶颈正转移到『训练环境的供给』上。SPADE 让一个 LLM 同时扮演环境设计者与推理智能体两个角色:设计者把完整的长程可执行环境写成带 reset()/step() 接口的 Python MDP 代码,并用『有提示与无提示奖励差』这一 hint-based regret 信号被 RL 训练,从而持续瞄准学习者能力边界出题。在 30B 规模上,SPADE 在八个 held-out 基准上平均超过最强固定环境基线 +5.3,工具使用场景 BFCL v4 多轮 +5.7、ACEBench-Agent +13.9。这篇精读拆解它的双角色自博弈机制、regret 信号设计、语料接地与环境记忆两大组件,以及为什么『把环境设计变成可学习组件』可能改写 agentic RL 的 scaling 逻辑。

August 20, 2026 · 6 min

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents 精读

哈佛大学联合Raycaster AI、斯坦福等机构提出StagedWorkspace——为知识工作agent建立版本化工作区。论文形式化workspace-state contract概念:agent检索的解析视图、编辑的原生文件、审阅的diff、提交的制品可能指向同一工作产物的不同版本,这是PDF/表格/幻灯片等非代码制品长期缺乏的契约。内容哈希绑定使视图与版本显式关联,OfficeQA Pass@1提升8.3-12.1点,SW-AGENT用Gemini 3.1 Pro达OfficeQA 63.9%(同模型已发表分数仅29.3%),证明工作区状态是被忽视的实验变量。

August 20, 2026 · 2 min

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows 精读

字节跳动Seed联合南京大学发布StartupBench——首个从市场验证的AI创业产品反推任务的E2E agent基准。方法论颠覆在于任务来源:不是研究者预设什么能力重要,而是系统研究哪些AI产品已被真实付费采用,把其工作流翻译为六领域(医疗/金融/法律/管理/STEM/教育)多格式交付任务,以细粒度rubric评分。结果揭示’高分低完成’剪刀差:Kimi-K3平均73.67%但严格达标完成率仅29.55%,无模型超1/3——瓶颈已从执行工作流转移到稳定产出可直接商用的交付物。

August 20, 2026 · 2 min

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读

阿里云端云智能计算团队发布Wuying-Browser-Agent——开源长程浏览器agent新SOTA(WebVoyager 80.6%、Online-Mind2Web 66.7%、自建BrowserBench 65.1%)。核心论点是’对齐每一层’而非单点规模:结构化浏览器harness提供稳定执行原语、RUIC-SFT显式训练错误恢复轨迹(仅用成功数据的SFT只能恢复8.5%的错误步骤)、DAO-GRPO用势函数奖励塑形+发散感知步加权解决长程功劳分配,并发布双语真实网页基准BrowserBench(350任务均37.9步)。

August 20, 2026 · 2 min