RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States 精读

深度精读 RoMeRL 论文——首次将自进化 Agent 记忆中的’反馈稀疏’与’记忆-奖励陷阱’两大耦合难题统一刻画,并用’降阶效用状态’把不断增长的轨迹索引效用空间压缩到固定维度的语义坐标上。理论证明降阶参数化提升每个效用坐标的平均反馈量,并刻画错误坐标的稳态占用;ALFWorld 和 LifelongAgentBench 上 Cold-Q 比例降低 80.0%、反馈密度提升约 6.0 倍、维护记忆大小减少 84.4%、LLM 调用减少 21.1%。本精读覆盖问题根源、因子化机制、反馈聚集原理、实验设计与通用性灵感。

August 11, 2026 · 8 min

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 精读

深度精读 SHE 论文——复旦、阿里达摩院、莱斯大学等多校合作提出 Safety Harness Evolution,将 Agent 安全 harness 解构为 System Prompt / Rule Bank / Safety Memory / Tool Policy 四个责任显式、独立可进化的制品,并通过归因引导的进化循环把轨迹失败转化为结构化诊断、局部精化与安全-效用验证。在 Agent-SafetyBench 上攻击成功率(ASR)相比静态 SafeHarness 降低 3.1 倍,同时良性任务效用不降反升;进化后的 harness 还能零成本泛化到 held-out 的 AgentHarm 基准并跨 Agent 模型迁移。本精读按九部分结构展开:从 Agent 安全 harness 的’整体黑盒’困境,到 SHE 的’免疫系统白细胞规则集’类比,再到归因引导进化与’精准医疗 vs 全身化疗’的范式对照。

August 11, 2026 · 10 min

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent 精读

港科大的 SkillProx 把 LLM Agent 的「技能自进化」重新拆解为「近端梯度下降」的前向-后向两阶段:前向用闭环重执行拦截退化的诊断补丁,后向用冻结的留一效用审计配合验证门控选择性整合/降级/删除知识单元。相比最强梯度基线 SkillGrad 平均提升 3.0pp,且消融清晰地揭示了「闭环诊断 -1.5、近端收缩 -2.5」的因果分工。本精读以九部分结构,详解这套自进化框架的方法机制、实验证据、效果根源与可迁移灵感。

August 11, 2026 · 7 min

Stealing Reasoning Traces from Proprietary LLM APIs 精读

深度精读 arXiv:2608.09867——主流 LLM 提供商隐藏的加密推理块被全面击穿。论文发现加密块在跨会话、跨用户、跨模型间完全可互换,攻击者可借弱模型之手解码强模型加密推理,绕过反蒸馏机制;从 31 万公开推理块中恢复出 367 条 PII 和 182 条凭证,并可实现不可见提示注入。负责任披露后提出加密层与系统层双重缓解方案。

August 11, 2026 · 6 min

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring 精读

深度精读 COLM 2026 论文 SWE-Bench ProMax——字节跳动与香港科技大学合作的专家策划多语言代码重构基准。170个实例覆盖7种编程语言,平均每实例修改11.4个文件、261.6行代码。揭示近60%未解决的 SWE-bench Verified 实例存在过窄或过宽的缺陷测试,前沿模型甚至能逐字复现训练数据中的 gold patch。在两种 Agent scaffold 下,最强模型解决率仅41.2%,证明基准未饱和。多阶段专家策展流程从源头堵住测试质量和数据泄漏两大漏洞。

August 11, 2026 · 8 min

TEPA: Revoking Stale Memories for Conflict-Robust Language Agents 精读

深度精读 TEPA 论文——首次将 Agent 长期记忆的’记忆污染’形式化为可证伪性问题,提出可撤销的证据-记忆机制,让有效性成为记忆的显式状态。在完全反转场景下,append-only 跌至 0.210(甚至低于无记忆基线 0.309),而 TEPA 保持 0.950。真实文件执行场景同样再现这一模式,MemoryAgentBench SH-6k 上匹配强 last-write-wins 缓存(0.890)。边界测试揭示多跳和超长上下文是下一阶段架构挑战。

August 11, 2026 · 8 min

「模型能力已经够了,要卷就卷 Infra」|对话戴冠兰:从 Cloudflare 到 Runta,为十亿个 Agent 造执行底座

Runta 创始人戴冠兰(前 Cloudflare/Kong 核心)在十字路口播客中提出核心判断:模型能力爬坡已放缓,真正制约 Agent 落地的是执行层基础设施。Runta 刚完成 2000 万美元种子轮(a16z 领投,Jeff Dean、李飞飞天使),定位是为 Agent 打造确定性执行底座——在概率性大模型之上加入隔离、权限、审计和热迁移等系统能力,让企业敢于把生产权限交给智能体。文章梳理了 Token Maximizing 到 Minimizing 的反转、Agent 安全必然爆发的逻辑、以及公有云和基模厂商为何难以抢占这一赛道。

August 10, 2026 · 2 min

Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay 精读

深度精读 arXiv:2608.05784——独立研究者 Nossa Iyamu 提出的 Activity Frames,一个零模型、确定性的屏幕活动编译管道。它将屏幕捕获流分割为携带应用、站点、时序、输入量和证据指针的『活动帧』,在 128,756 帧、51 活跃天的真实语料上把单日上下文从 126,812 token 压缩到 1,469 token(86×),编译延迟仅 68ms,下游问答准确率 98.4%(LLM 摘要仅 66-80%),幻觉率 0%。同一编译器还首次测量了代理成本模型假设但从未实测的两个参数:Routine Overhead Ratio R=60-343x 和可委托复发率 h=7.7%(样本外)。核心洞察:把『解释』从『测量』中剥离,用最无趣的确定性代码填补捕获与记忆之间的缝隙。

August 8, 2026 · 8 min

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读

AgentOPSD 把 Agent 强化学习中长期被回避的’信用分配’难题重新拉回中心:在多轮交互、稀疏奖励的 Agent 任务里,GRPO 这类方法只能把最终成败均摊到每个动作上,导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师(注入了成功技能 c+)与学生之间的 token 级对数概率差聚合为 turn 级证据,再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k,最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把’稀疏结果监督’转化为’每一步的密集信用’,在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%(+7.9pp),长程任务每轮交互衰减仅 0.54 点(GRPO 衰减 2.91 点)。消融实验进一步证明:先验锚定贡献 -10.2pp 是最关键设计,贝叶斯方向(符号保持)次之 -8.6pp。

August 8, 2026 · 8 min

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 精读

CalibForge 提出了一个自主终端任务合成系统,把求解器行为当作’构建时反馈’,通过多求解器校准和对比求解器校准两种对抗式策略,将候选任务反复修订到’可证明可解但又不被统一求解’的求解器相对可学习区间。基于 5,431 个校准任务蒸馏 SFT 后,Qwen3-30B-A3B 在 Terminal-Bench 2.0 从 7.87% 跃升到 32.58%,并在 SWE-bench Pro、Doc2Repo 两个分布外基准上同步取得 +27.68、+30.04 个百分点的迁移提升。本文从终端任务与可学习区间讲起,逐层拆解对抗式作者-求解器循环、轨迹反馈的三类修订模式,并从第一性原理分析’为何校准优于单求解器反馈’。

August 8, 2026 · 7 min