SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学联合小红书提出 SkillGate,解决长程 Agent 在 episode 中途该读哪个技能文件的训练难题。论文先诊断出 outcome-only RL 失效的结构性根源——selector credit starvation:技能命名 token 仅占轨迹损失的中位 0.14%,随轨迹变长稀释约 7 倍,且近五分之二的正确选择因后续执行失败收到错误负号的信用,而该决策本身价值 +11.2 个百分点。SkillGate 将同一 GRPO 更新的 token 支持划分为构造上不相交的双 credit 通道:任务通道只把组归一结果优势广播到执行 token,整段 read call 从损失掩码删除;选择通道把单次读取且为 oracle 才计 1 的 action-local 效用做组中心化后仅落在身份 token,等权归一使选择权重与轨迹长度无关。5 个基准 385-trial 协议下,9B 模型从 SFT 的 40.8% 升至 53.2%,超同预算 outcome-only RL 6.2 个百分点,oracle 读取率 54.3% 升至 83.9%,误导暴露降约三分之二且读得更少。

August 24, 2026 · 5 min

两天十万Star:DeepSeek Harness 的开放逻辑,与它想要驯服的模型-脚手架-算力飞轮

围绕 DeepSeek Harness 发布后两天破十万 Star 的现象,三位从业者从「一切皆插件」的架构设计、模型与 Harness 的深度协同、极简模式与缓存命中率的技术原理,聊到程序员岗位转型、开源生态与国产算力差距。核心判断:Harness 是 AI 时代的脚手架,插件化+开源让社区共建成本降到极低,模型与脚手架会互相塑造,而程序员的护城河正从写代码转向定义需求与验收结果。

August 24, 2026 · 2 min

A Jagged Frontier: 代码Agent对语义保持变换的锯齿鲁棒性 精读

当代码库被改写成语义等价的形式——控制流重写、死代码注入、标识符重命名——修 bug 的代码 Agent 还靠得住吗?Colorado State、Microsoft、UIUC 与 CMU 四方合作,用一套随机变体采样器对 2 个 Agent 框架 × 4 个前沿模型 × 54 个 SWE-bench 实例做了首个仓库级 Agent 鲁棒性系统评估:多数配置出现小幅退化(最大平均 6.7 个百分点,16 个配置中 6 个统计显著),但更扎心的发现是「锯齿前沿」——没有任何模型鲁棒性排名能跨框架、跨基准保持稳定,Qwen 在一个框架下最鲁棒、换一个框架反而最脆弱;更简单的框架反而更皮实;即使 solve 率不掉,token 成本最多也要多花 22.9%。本精读覆盖其 14 种语义保持变换的设计、非反馈采样的下界逻辑、配对实验统计方法,以及锯齿现象背后的机制因果链。

August 23, 2026 · 9 min

Adversarial Review: Structured Disagreement for Grounded Agentic Code Review 精读

康奈尔与斯坦福的两位研究者提出 Adversarial Review(AR):主编码 Agent 冻结工件后,reviewer 评审、critic 以结构化分歧审计这份评审,收敛后才允许修改代码。AR 在 LiveCodeBench 上以三个 Agent 取得 87% 最高通过率,胜过五 Agent 的 MARS;在 SWE-PRBench 上先暴露「伪共识」失败模式——Agent 为一致而一致,再用一次 prompt 迭代把分歧显式化即取得最高 F1 0.533;在 SWE-bench Verified 上以纯文本 SKILL.md 协议达到 75.2%。本精读拆解其构造式方法、三基准证据链,以及「分歧必须最小、结构化、有证据」的设计哲学。

August 23, 2026 · 7 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

东京大学团队提出Task-CoEvolve,让验证任务集与harness共进化:用方差加权采样把评估预算聚焦在候选harness分歧最大的能力前沿任务上,再用Horvitz-Thompson/Hájek类估计器从采样子集无偏还原全量分数。在Terminal-Bench 2.1上仅用20%预算就逼近全量搜索(均值51.7 vs 52.8),整体搜索成本降67-80%;文本分类7%预算接近全量、20%预算反超。本精读覆盖背景、定位、方法机制、实验证据、效果根源因果链、必要知识反推与通用灵感九个部分。

August 23, 2026 · 6 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

深度精读 EnvHarness——与 Agent Harness 对称的环境侧革命:不改环境本身,在交互接口上包装一层可编程插件(Stage/Contract/Chain 三类组件),把静态冻结环境重塑为针对当前策略弱点的定制化训练场。EnvRigger 自动化引擎通过 Observe→Diagnose→Write→Validate 四阶段循环,自动诊断策略缺陷并生成验证过的组件,在 ALFWorld、WebArena、SWE-bench Verified、OfficeQA、SpreadsheetBench 五大基准上全面超越原环境与领域特定生成器,环境规模化收益持续未饱和。

August 22, 2026 · 4 min

Agent Lightning v1.0: Towards Harnessed Agentic RL 精读

微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0,首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时,训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战,以约3500行代码给出参考实现,仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%(+14.6个百分点),并公开完整数据清洗管线与防reward hacking脚手架。

August 20, 2026 · 3 min

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents 精读

UIC、华盛顿大学、McGill、MBZUAI与UCLA五校联合完成首个把记忆底座(substrate)作为受控变量的统一harness评测:11类底座×3个骨干模型×4组基准×26项指标。核心发现颠覆选型直觉——没有任何底座全面称雄,QA任务的前沿(图+向量混合)与决策任务的前沿(扁平检索/精炼蒸馏)完全不相交;检索宽度k在QA上单调涨分、在决策任务上反向往下跌分,注意力探针揭示同一稀释机制在不同任务中后果相反。这为记忆系统按工作区间路由底座提供了实证基础。

August 20, 2026 · 2 min

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety 精读

UNC教堂山分校Tianlong Chen组联合UCF、密歇根州立发布HarnessRisk——首个覆盖agent harness全生命周期的安全基准:把harness安全组织为配置/能力扩展/运行时/状态持久化/动作控制/事件恢复六个运营阶段,128个沙箱案例每个配对良性用户目标与嵌入不可信工作流制品的对抗指令。14个模型-harness配置的评估揭示:攻击成功率12.6%-80.9%波动,配置阶段最脆弱,同一模型跨harness的ASR差4.3倍——安全是部署配置的属性而非模型属性,且风险识别不等于安全行动。

August 20, 2026 · 2 min

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents 精读

华为LegoX团队联合港中文发布LEGO-RL——在不修改原生编码agent harness内部控制流的前提下接入可扩展策略梯度训练。三大支柱:进程内LLM代理捕获原始生成流实现token级对齐与训练端logprob重算(即使harness压缩/重序列化上下文)、Nydus镜像缓存+分级防御抑制reward hacking、插件化校验监控+Live UI轨迹诊断。训练Qwen3.5-35B-A3B(GSPO)在三大harness上全面提升:OpenHands SDK 64.0%→70.4%、Claude Code 62.4%→68.2%、OpenCode 57.2%→66.6%,rollout-训练概率相关性保持0.99以上。

August 20, 2026 · 2 min