Up and Down the Abstraction Ladder: Code-Based Skills for Language Agents 精读

华沙大学与 Princeton 等九机构团队在 NetHack 上系统量化了「代码技能 vs 原始动作 vs 混合」三种动作抽象层级对语言智能体的影响:跨 14 个模型,技能让游戏进度近 3 倍、推理成本降 86%;RL 设定下学习增益达 7.2 倍;混合接口保留 95% 收益的同时保留原语回退能力。本精读覆盖 CodeHack 的 78 个 Python 技能与统一运行时设计、zero-shot/SFT/RL 三设定受控实验全表、优势根源因果链与外部文献交叉验证,并附面向 Agent 工程的通用灵感。

September 29, 2026 · 6 min

WeEnv: The Environment for Agentic Reinforcement Learning at WeChat 精读

腾讯微信 AI 提出 agentic RL 的「环境税」:环境初始化独占迭代时间 53.4%,比训练本身还慢。WeEnv 对环境做打包-初始化-供给的全生命周期管理——layer group 活页夹式组合把 39,471 个镜像缩到 133 个、按需拉取让环境 10.6 秒启动(E2B 要 150.6 秒)、弹性配额化解秒级 47 倍的资源突发。本精读覆盖动机量化、三大设计的机制因果链、与 E2B/AgentENV/SkyRL 的外部交叉验证,以及企业生产部署视角的通用启发。

September 29, 2026 · 6 min

训练机制三重奏精读:对数线性稀疏注意力、置信度停止与跨段信用分配

本文合并精读 2026 年 9 月下旬三篇聚焦「训练时机制创新」的论文:上交+字节 Seed 的 PISA 把块稀疏注意力的选择阶段压到 O(N log N) 并用 LSE 打分提升选块质量;马里兰+Capital One 的 ConfSFT 只监督置信度、不监督长度,就让四家族模型推理 token 下降 10%~19%;北大+深大+腾讯的 SLCA-GRPO 识别并结构性消除工具调用 RL 中的跨段信用错配,7B/8B 上 τ2-Bench 分别提升 9.15/10.03 个百分点。每篇覆盖背景、关联工作、问题、解法、实验证据、优势根源(含外部交叉验证)、知识反推与通用灵感九部分,最后合并讨论「选择、停止与信用分配」这一共同主题。

September 29, 2026 · 9 min

Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 精读

Salesforce AI Research 提出 JITMEM,把智能体记忆的「塑形」时机从写时推迟到读时:写时零损耗保存原始轨迹,读时由 curator LLM 联合当前任务与检索轨迹合成任务自适应 payload,用后即焚。因为 payload 在当前任务上被立即消费,curator 可用 GRPO 直接以任务原生得分训练,信用分配零步延迟。在 ALFWorld、WebShop、τ²-bench 上分别领先最强基线 16.2、16.3、3.9 个成功率点,输入 token 省约一半。本精读覆盖其问题定义、方法拆解、实验证据、根因分析与可迁移灵感。

September 27, 2026 · 4 min

Agent-Editing World Model 精读

人大高瓴学院 AEWM 论文精读。论文把语言世界模型的预测目标从「重建环境观测」重构为「预测决策效果并直接编辑 agent 状态」,用 Action Judge 三分类(CRITICAL/EXPLORATORY/NOISY)+ State Revision 推理动作联合编辑组成推理时闭环 EditAct,再用 AEWM-RFT 把编辑能力内化回 agent。Action Judge 基准 macro-F1 70.5% 超最强基线 10.6pp;六基准三骨干平均提升 3.2–6.7 分;9B+EditAct 反超 35B+ReAct。本精读覆盖动机、方法、证据链、外部交叉验证与可迁移灵感。

September 26, 2026 · 7 min

PACT: From Credit Assignment to Critic Alignment 精读

强化学习已成为大语言模型后训练的核心组件,但 token 级信用分配始终缺乏公认的数学定义。本精读拆解 AllSpark 团队的 PACT 论文:以完备性、前缀一致性、中性性三个正则条件唯一确定 token 级信用——即条件奖励预测的鞅差分序列;由此统一解释理想教师下的在线蒸馏等价隐式 critic、RLOO 的梯度等价性、以及 GAE 中间 critic 误差可淹没真实信用等现象;进而提出 Actor-then-Critic 更新顺序、重要性采样修正与 BCE 损失的 PACT 训练流程。在四个数学基准上平均 72.87%,SWE-bench Verified 达 67.4%,分别超越 GRPO 8.80 与 2.0 个百分点。

September 25, 2026 · 7 min

SkillGym×VHD-Play:技能与环境从「外挂」到「内化」的两条路线 精读

本篇合并精读两篇同期论文:ECNU 与上海AI Lab 的 SkillGym 把人类撰写的 Agent 技能文档转化为可执行、可验证的训练环境,通过对比式技能依赖性测试筛出真技能任务,用 8364 条验证轨迹微调出的 35B 模型在 GDPval 上提升 199 Elo;Georgia Tech 与阿里 Token Foundry 的 VHD-Play 反转环境合成顺序,先解出数学模型再让同一个解同时供出环境动力学与奖励函数,把 Qwen3.6-35B 的智能体得分从 0.204 拉到 0.815。两篇论文共同指向一个趋势:把知识变成环境的因果反馈而非文本的表面模仿,让技能与环境从推理时的外挂变成训练中的内化。

September 25, 2026 · 8 min

WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents 精读

深度精读 CMU 与清华大学合作的 WhatWorkedBench——首个将实验理解力量化为可执行评测的基准:智能体在测量预算内选择实验、提交覆盖全部配置组合的响应面预测表,与离线 CPU 穷举的 1248 个配置真值逐条比对条件效应误差。本文覆盖实验理解力定义、八族工作流目录、35/36 任务符号反转的发现、共享推断与代码等价编码两大机制,以及与 MLE-bench 等工作的谱系定位、必要知识反推和七条通用性灵感,全面拆解这项把优化成功与干预知识首次分离的评测研究。

September 25, 2026 · 6 min

控制 token 注入×工具缓存逆转:Agent 安全与训练基础设施的两个隐蔽失效面 精读

本文合并精读两篇 Agent 安全论文。论文 A 证明:向工具调用上下文追加模型自身的控制 token,可让 gpt-oss-20b 的思维链从 52.5 个 token 降为 0,CoT 监督器拿不到任何可判信号,39.6% 原本被拒的恶意请求转化为成功执行——因为 CoT 是采样行为的产物而非义务。论文 B 证明:边缘正确的工具缓存会在组内共享随机结果时系统性偏移 GRPO 的 baseline,共享更新方向由胜率差而非均值差决定,符号可整体翻转,540 组配置穷举验证。两者共同指向:Agent 系统的失效面在结构层(解码 harness、缓存、归一化器)而非模型层。

September 25, 2026 · 7 min

当智能体替人跑一整天:PAI 分论坛上,AI 基础设施的三次换轨

2026 云栖大会「人工智能平台 PAI」分论坛全程复盘。PAI 负责人周文超用负载、范式、边界三个词定义 Agentic AI 对基础设施的重塑:推理调用次数增长数百倍使 KV cache 命中率成为第一指标,RL 算力消耗逼近预训练把「稳」变成生产化门槛,具身智能则把战场拉回数据质量。文中串联小米广告 +8 个点收入、大众故障归因数天级压缩、SciMaster 六小时顶博士三个月、圆桌「一千小时低质数据不如一小时高质量」等关键证据,提炼出从压榨算力到压榨数据、从模型精度到迭代周期的观察坐标。

September 24, 2026 · 3 min