AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification 精读

深度精读 AMD 与南方科技大学合作的 arXiv 2026 论文 AsmEvo:当 GPU 内核源码不可得、部署二进制是唯一行为基准时,用智能体直接在汇编级优化已编译的 AMDGPU code object。恢复可重汇编表示、profiling 定位热窗编辑、ABI 保持重建、差分验证门控接受,在 MI308X 上让 30 个 KernelBench 内核中的 29 个提速,几何均值 1.35 倍、最大 3.88 倍;MI300X 生产负载(AITer、vLLM、SGLang)全部提升且全程保持功能等价。

August 25, 2026 · 4 min

AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization 精读

深度精读 AUSO 论文——中科大 × UNSW × 国科大 × 西交利物浦跨国合作提出的动作级统一技能优化框架。从技能角色随策略演化而变化的洞察出发,拆解任务级路由的噪声困境与轨迹内技能效应异质性问题,详解三阶段渐进优化(师从内化 → 结果探索 → 双上下文动作级利用)、JSD 信息增益信号与不确定性门控的设计逻辑,结合 ALFWorld / WebShop / SearchQA 三基准与五组件消融的证据链,反推出干预粒度下沉、生命周期感知训练、双上下文自对照三条通用性灵感。

August 25, 2026 · 4 min

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces 精读

AutoSaddler(Microsoft × POSTECH × KAIST × 南方科技大学)把 Agent harness(提示词/工具/中间件)的优化形式化为离线 mini-batch 学习问题:深度诊断 Agent 读执行轨迹定位根因、生成结构化 patch(Prompt/Tool/Middleware 三类九子型)、Reflection 提炼经验存入 EvoDAG 进化图、泛化感知选择防过拟合。GAIA2 +9.0pp、SWE-Bench Pro +9.6pp、Terminal-Bench 2.0 +10.0pp 全面超越人工与自动基线,且学习轨迹只需最强基线的 1/10。

August 25, 2026 · 2 min

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis 精读

深度精读港中深与西安交大团队的微服务根因分析(RCA)轨迹级研究。指出现有评测只看“是否定位到责任服务”的终点指标,无法揭示诊断证据与故障传播路径。作者人工标注服务级故障传播路径,对齐分析3500条智能体诊断轨迹,发现答案正确性与诊断质量脱节,并将错误诊断归结为三类证据处理失败,进而设计DIAGGUARD两段防御(前置grounding+后置verification),在跨模型、跨基准、跨拓扑的独立验证集上把Acc@1从43.5%提升到52.5%。

August 25, 2026 · 3 min

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (ERPO) 精读

ERPO(阿里 AMAP × 西安交大 × 京东 × 北师大 × NUS 五机构产学研)重新定位了 LLM 强化学习训练崩溃的根源:不是策略(动作)分布漂移,而是策略诱导的查询分布漂移改变了有效训练环境。它把 KL 正则化从动作侧移到输入侧,Query-KL 的梯度严格不流经响应分布,从而在不牺牲探索的前提下根治高温解码崩溃——32B 模型在 T=1.5 下 GRPO 只剩 25.2%,ERPO 保持 80.8%。

August 25, 2026 · 2 min

CatchBench: When Can an Agent Failure Be Caught? 精读

CatchBench(USC,PyOD 作者 Yue Zhao)构建了首个在 PRE(运行前声明配置)/LIVE(运行中轨迹前缀)/POST(运行后完整轨迹)三种信息状态下统一评分 Agent 审计方法的竞技场:9 个计分板、72 个方法。它最大的贡献是方法学自律——公开每条标签的生成方式从而暴露自身语料的捷径(injecagent 源仅凭声明顺序即 F1=1.000)、给注入故障设’可采性门槛’、并如实发表 71/118 个无法分离的对比。‘分数在标签过程公开并检验其捷径之前不可解释’,这是对所有基准的警世恒言。

August 25, 2026 · 2 min

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? 精读

北大×BIGAI 提出 ContinualSkillBench,首次系统回答「Agent 技能库能否自主进化」:五个领域各 100 个按难度与技能依赖排序的关联子任务,三回合协议让 Codex CLI 与 Claude Code 在执行-反馈-反思中自建技能。15 组模型-领域设置中 14 组顺序执行提升归一化奖励(整体相对 +16.9%),但关键对照实验揭示:纯 ICL(不维护显式技能)平均 0.605 vs 显式技能 0.602,几乎无差异——顺序收益大部分来自保留上下文与反馈适应而非可复用技能抽象;且弱模型(GPT-4o)堆积 384 个碎片化技能,远多于强模型(GPT-5.3-Codex)的 205 个。

August 25, 2026 · 3 min

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces 精读

深度精读HKUST(GZ)与清华大学合著的DataSpace基准:把数据智能体放进散落着数据库、CSV、长PDF与视频的异构工作区,要求其返回完整表格并通过确定性评测。410个跨语言任务、7439个工件、15.01GB规模下,六前沿模型×五智能体框架的最好成绩仅66.34%,换框架即拉差15.36点,视频证据与join是所有模型的共同短板。该基准同时是KDD Cup 2026数据智能体赛道的官方评测。

August 25, 2026 · 2 min

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (Risa) 精读

Risa(复旦大学)首次把稀疏 MoE 模型的原生路由轨迹用作软件 Agent 测试时扩展的’行为坐标系’:把每层每 token 的专家路由权重积分成路由指纹,探索阶段选与历史最不相似的候选(disagree to explore),写补丁阶段在同伴收敛处提交,跨尝试仲裁取’决策 token’上一致性最高者(agree to commit)。SWE-bench Verified 宏平均 44.9%→48.2%,跨家族迁移到 Qwen3.6 仍 +3.5pp——全程无需外部 judge、无需测试执行。

August 25, 2026 · 2 min

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents 精读

深度精读新加坡国立大学 COTA 论文——用一个 0.5B 的微型比较器干预 8B 到 284B 的 LLM Agent。核心思想是把干预任务从「评估动作绝对价值」降维成「判断两个动作哪个更好」:配对比较加上建设性建议,九组实验全部提升,Qwen3-8B 在 WebShop 上从 0.3960 涨到 0.5630;而绝对 Q 评分加强制执行的组合只有 2%-9%,两要素缺一不可。

August 25, 2026 · 5 min