AMDKernelVault: Large-Scale Datasets and Agentic Training for AMD GPU Kernel Optimization 精读

AMD 开源 HIP/Triton 内核优化语料与 agentic 训练框架:HIPKernelGen/TritonKernelGen 管线把 PyTorch 参考实现转为 HIP/Triton 内核、在 ROCm 下编译验证、上硬件延迟剖析——产出 62,153 个执行验证 HIP 内核 + 2,377 条 ROCm 库 QA + 39,893 个 Triton 内核。演示价值:Qwen3-8B 经 SFT+执行感知 RL 后在 PyTorch→HIP 达 34.0% Pass@1、TritonBench-G 33.2% Corr@3、ROCmBench 41.94% Corr@3——打破 CUDA/NVIDIA 中心主义的开放生态基建。

September 15, 2026 · 2 min

Beyond Top-k Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents 精读

Virginia Tech 提出 DSR:当技能注册表达到数万级,top-k 独立排序会返回功能冗余的技能集合浪费上下文预算。DSR 用行列式点过程(DPP)把路由从’排序问题’升维为’集合选择问题’,核心创新 query-residual 多样性核先扣除技能表示中与查询对齐的成分再算冗余——在 80K 技能池的 SkillRouter benchmark 上 recall 与 full coverage 双升,多技能查询增益最大。

September 15, 2026 · 2 min

COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization 精读

港中文深圳团队把 agent 技能优化重构为’动态候选空间上的预算受限序贯优化’:contextual bandit 优先级评分决定评估哪个候选(exploit 历史得分 + explore 不确定性),证据驱动的进化只做有界精炼不做全局重写。结果:6 个 benchmark × 3 模型平均提升 13.1/26.9/22.5pp,相对 SkillOpt 总成本砍 55-58%,每 benchmark 只用 50 个优化样本,且对 harness 更换鲁棒。

September 15, 2026 · 2 min

DataFlex-RL: An Evaluation Platform for RLVR Data Policies 精读

北大×UCAS 等机构的 RLVR 数据政策评测平台:13 配置 × 12 匹配种子 × Qwen2.5-7B 在 12 个数学/逻辑/科学 benchmark 上的受控对比发现——均匀 GRPO 已提升 7.76 分后,无任何选择/重加权方法的配对 95% CI 排除零;三种自适应混合均不优于固定等权。更警醒的是评测敏感性:math-heavy 摘要与均衡摘要的排名负相关(ρ=−0.33)。‘数据工程很重要’的流行叙事在受控条件下未被支持。

September 15, 2026 · 1 min

EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning 精读

复旦大学针对开放 RL 的奖励系统自进化框架 EvoRS:rubric 奖励与 policy 构成动态反馈回路——policy 优化当前奖励时,初始有用的奖励系统会因 reward hacking 或区分度退化而失效。EvoRS 把奖励系统表示为可执行 Reward-DAG,agentic designer 从 on-policy rollout 与奖励轨迹更新它。写作/角色扮演任务上三种 judge 下质量最佳,超固定奖励 policy 2.107/4.767 分,reward hacking 与覆盖失败双降。

September 15, 2026 · 2 min

GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents 精读

Amazon 的评测效度清算之作:persona 驱动 LLM 用户模拟器 + LLM-as-judge 这道廉价’离线发布门禁’被 GAUGE 协议全面体检——盲评面板判’满意’的会话 57.5% 实际任务失败(ρ=−0.147);能力相近的强 agent 对比中门禁 31% 选出奖励更低的一方;满意度阈值放行失败率 48-60% 的 agent。结论:门禁’human-validated yet mis-anchored’(人觉得准但锚错了构念),并给出 calibrate-then-trust 补救节奏。附同日 TraceJudgeBench 对照:去偏 prompt 在压偏差的同时损坏分辨率。

September 15, 2026 · 2 min

Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite 精读

evolutionID GmbH 用 256 个私有任务的污染控制套件,首次把 agent 编程中 harness(驱动模型的软件层)作为唯一变量隔离测量。结论颠覆直觉:厂商原生 harness 无平均能力优势(±1.25pp 统计不显著),但按任务类型剧烈分化(仓库任务落后 9pp、竞赛任务领先 23.7pp);中立 harness 每解一题成本反而高 1.3-1.6 倍。论文还自曝自家成本遥测存在缺陷并全量重算——测量诚实度的范本。

September 15, 2026 · 2 min

Is Bash All You Need? An Empirical Study of Tool Interfaces for Enterprise Digital Worker Agents 精读

Microsoft 的系统性受控实验颠覆 agent 工具接口直觉:5 种接口配置(纯 typed tools / typed+bash / 纯 bash / bash+持久化自合成工具 / PTC)× 2 企业 benchmark × 2 前沿模型(Opus-4.8、GPT-5.5)下,纯 bash 全面对碾压 typed tools——TheAgentCompany 高 21.8-24.5pp、APEX 高 4.8-7.4pp,同时省 19-72% token。给 bash 加 typed tools 或工具合成均无增益。企业 agent 选型的迄今最硬证据。

September 15, 2026 · 2 min

LifeMem: Enabling Lifelong Experience Reuse for LLM Agents 精读

北理工 BITHLP 实验室的 agent 记忆工作 LifeMem:针对跨环境经验迁移与灾难性遗忘两大难题,按底层 workflow 聚类交互轨迹提取可复用技能(结构级抽象而非表层相似),推理时召回技能+轨迹引导动作。在 5 场景 10 环境 13k+ 任务上验证(其中 4 环境新标注 2k+ 轨迹),遗忘降低与跨任务迁移双优;并发现任务流顺序影响学习、结构相似巩固有增益。数据集代码全开源。

September 15, 2026 · 1 min

Look Before You Leap: Pre-Action Verification for LLM Agents 精读

针对 agent 动作的’静默失败’(产生貌似合理但错误的效果且不报错),本文提出 success/clean-failure/silent-failure 三分框架与确定性预检层:shell 命令侧 9,930 命令+482 工具上静态验证器捕获 95.8% 无效命令(语法/二进制检查 oracle-exact 零假阳性);代码编辑侧 640 编辑×224 文件基准揭示格式尖锐分化——内容锚定格式(search/replace、diff)近零静默失败,行号/函数名格式高静默失败。护栏微秒-毫秒级、零模型调用,可包裹任何黑盒前沿 agent。

September 15, 2026 · 2 min