HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety 精读

UNC教堂山分校Tianlong Chen组联合UCF、密歇根州立发布HarnessRisk——首个覆盖agent harness全生命周期的安全基准:把harness安全组织为配置/能力扩展/运行时/状态持久化/动作控制/事件恢复六个运营阶段,128个沙箱案例每个配对良性用户目标与嵌入不可信工作流制品的对抗指令。14个模型-harness配置的评估揭示:攻击成功率12.6%-80.9%波动,配置阶段最脆弱,同一模型跨harness的ASR差4.3倍——安全是部署配置的属性而非模型属性,且风险识别不等于安全行动。

August 20, 2026 · 2 min

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents 精读

华为LegoX团队联合港中文发布LEGO-RL——在不修改原生编码agent harness内部控制流的前提下接入可扩展策略梯度训练。三大支柱:进程内LLM代理捕获原始生成流实现token级对齐与训练端logprob重算(即使harness压缩/重序列化上下文)、Nydus镜像缓存+分级防御抑制reward hacking、插件化校验监控+Live UI轨迹诊断。训练Qwen3.5-35B-A3B(GSPO)在三大harness上全面提升:OpenHands SDK 64.0%→70.4%、Claude Code 62.4%→68.2%、OpenCode 57.2%→66.6%,rollout-训练概率相关性保持0.99以上。

August 20, 2026 · 2 min

MoNe: Modular Neural Memory for Efficient Long Context Inference 精读

三星研究院提出MoNe——附加到任意冻结预训练Transformer上的模块化神经记忆,实现O(N)预处理+O(1)查询的长上下文推理。两阶段设计:测试时以固定分段读入上下文、快权重神经记忆网络做层局部梯度更新;推理时仅从查询token生成KV,不再重读任何上下文token。128K token时计算与峰值显存较ICL均降约80%(参数开销仅6.4%),RULER上S-NIAH 128K达0.96(ICL仅0.28、MK-NIAH上ICL完全归零而MoNe保持),且可泛化到骨干原生窗口远之外的长度。

August 20, 2026 · 2 min

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 精读

NUS 与牛津团队提出 OmniScientist——一个全生命周期感知驱动的全模态跨学科 AI 科学家。论文诊断现有系统的通病:workflow-complete 却 evidence-incomplete——数据经由人选择的文本/代码/标签/摘要进入 agent,科学上决定性的空间、时序、跨通道、程序性关系在接口处丢失。框架由感知层加三个自主 agent(ideation/experiment/writeup)组成,外层是确定性管线,配以 idea/rigour/claim 三重代码化检查(OpenAlex 先行检索、统计校正、数值溯源)。36 个真实数据案例覆盖 5 学科族与 4 类证据模态,Claude Sonnet 5 在全部案例完成『原始数据→编译 PDF』全流程,综合均分 6.3/10;配对盲评中感知版全 7 维占优、直接胜率 85%。机制分析显示感知系统把研究问题锚定在原始观测独有属性上——这是文本接口系统原则上无法到达的假设空间。

August 20, 2026 · 5 min

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification 精读

Salesforce AI Research对记忆式自改进agent做系统性重评测,揭露被忽视的可靠性问题:多次运行量化显示叠加自改进循环后71%的情形方差增大、同实验最好最差运行差可达10个百分点;默认任务顺序构成隐式课程——按默认顺序+1.5%改进,随机打乱后反而-4.5%。人工检查记忆提出欠规约(underspecification)假说:agent在缺乏清晰规约时生成’看似合理但不可用’的记忆(如纯浏览器环境推荐API用法),rubric与环境反馈注入可部分收窄退化。

August 20, 2026 · 1 min

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs 精读

厦门大学联合上海交大、南洋理工提出PlanPO——解决组相对优化中的优势坍缩(advantage collapse)问题:成功轨迹获得相同结果奖励,迂回成功与高效成功优势无差,组内梯度信号消失。PlanPO在组相对结构内引入粗到细优势信号——轨迹级长度差异+成功条件下的轮级响应长度差异,无需价值模型与人工启发式,在ALFWorld、WebShop、SciWorld三个多轮基准上平均超GRPO 27.2%,额外训练开销可忽略。

August 20, 2026 · 1 min

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC联合KUKA、上海交大、浙大发布SemaPLC——一个项目接地、验证门控的PLC代码生成agent harness。它由常规工具组装而成,却由一条严格的完成纪律统治:agent不许凭自判断宣布完成,只有工具日志确认的规格审计、编译、运行时三类外部检查全部过关才准交付;任何编辑作废全部旧判定并重跑全部检查。在117个独立POU任务上它让全部7个模型拿到最高严格通过率(均值72.6%,超最强基线8.8个百分点);在65个真实工厂项目任务上,其动态行为分52.2碾压基线最高31.4——静态分相近的方法在运行时被彻底分离。编译通过≠跑得对,执行才是生成控制逻辑最忠实的检验。

August 20, 2026 · 6 min

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 精读

SemComp-Bench由中国科学技术大学联合FrameX.AI与中山大学提出,定义了结果导向的语义任务完成视频生成任务:给定参考图像与指令,要求生成视频既达成指定结果,又与参考保持任务相关的语义接地(如把钞票折成乌龟,结果必须是那张钞票折成的乌龟)。团队从Koala-36M约2万条视频经四阶段管线构造1273个结构化实例,并设计OA/GR双维度VLM评测协议。七个代表模型中最高OA仅37.8%,I2V全面碾压T2V(37.8% vs 4.4%),brief指令下OA暴跌至1.7%,GR与OA排名显著错位,揭示了当前视频生成模型会生成却不会完成任务的系统性缺口。

August 20, 2026 · 4 min

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution 精读

上海交通大学顾晓东组提出SkillForge——面向项目特定issue解决的自蒸馏框架。核心洞察是冷启动问题:agent在特定仓库上缺乏项目知识,历史驱动方法依赖过往issue信号、在线方法每题付出昂贵探索成本。SkillForge反其道行之:主动重新实现仓库中带测试覆盖的核心功能来合成项目特定issue,解决后把经验蒸馏为实体锚定技能。SWE-bench Verified上DeepSeek-V3.2达72.2%(+5.8超基线,超最强对手+3.0),GPT-5-mini 60.6%(+5.6),SWE-bench Pro上同样领先,单issue成本仅$0.069-0.087。

August 20, 2026 · 2 min

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学与小红书合作的论文诊断了agent技能选择失败的结构性根因——selector credit starvation:在广播式序列级优势下,命名技能的少数token在损失中份额趋零、继承的信用随轨迹变长而日益错号(选择正确但执行失败时正确选择被惩罚)。SkillGate把token支持划分为两个不相交信用通道:结果信用只达执行token、动作局部优势只达技能命名token(仅当轨迹唯一一次读取是oracle时为正)。5个agent基准、16候选技能档位下,9B策略试验成功率从40.8%提升到53.2%,超同预算outcome-only RL受控对照,误导技能暴露减少三分之二,读取技能更少。

August 20, 2026 · 5 min