Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness 精读

KAIST 与东京大学合作研究机器遗忘的「复活」问题:遗忘后的 LLM 经短暂微调即可恢复已删知识。论文反驳「权重移动距离决定鲁棒性」的流行假说,提出免训练预测器 FRAG——度量遗忘更新是否集中在 forget 关键权重而避开 retain 关键权重,Spearman 相关达 −0.78(全局 L2 仅 −0.36);同原理 instantiated 为剪枝方法 FRP,在三种重学习攻击下 post-attack 遗忘分数全面最优。「哪些权重动了」比「动了多远」更能解释鲁棒性。

August 27, 2026 · 3 min

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training 精读

字节跳动 Seed、南京大学与 Evolvent AI 合作提出「论文展开」管线:保持论文原文逐字不动,用教师模型反向重建写作请求、全局规划与逐节写作前的思考,把整篇论文展开为多轮生成轨迹用于持续预训练。1.8M 篇 arXiv 论文的 30B token 原文被展开为 57–60B token 轨迹,中位文档长度从 11.2K 提升到 28–29K token。同一反向构造还产出 200K 样本 SFT 数据集与 2,940 题的 PAW-Bench 学术写作基准。受控实验(同预算纯论文文本对照)证明增益来自「构造」而非论文内容:写作四项平均 54.34 对纯文本 52.12/无 CPT 51.90,推理不降反稳,长文档理解提升;且 4B 小生成器的语料最难拟合(loss 1.453)却下游最好——生成器越弱、数据越难拟合,收益越大。

August 27, 2026 · 4 min

领读Kimi K3技术报告:一个清华架构博士眼中的注意力谱系与「有效scaling」

一集面向技术读者的Kimi K3技术报告领读播客,嘉宾孙宇涛(清华计算机系博士生、上海创智学院pre-doc,研究方向LLM架构与预训练)从K3出发串联起十多篇前作,把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加,讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design,MLA+QK-norm式门控的稳定性逻辑,Latent MoE对通信开销的削减,以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推;后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论:大模型架构没有本质创新了,K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率,而把size做work才是真创新。

August 26, 2026 · 1 min

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities? 精读

北大×BIGAI 提出 ContinualSkillBench,首次系统回答「Agent 技能库能否自主进化」:五个领域各 100 个按难度与技能依赖排序的关联子任务,三回合协议让 Codex CLI 与 Claude Code 在执行-反馈-反思中自建技能。15 组模型-领域设置中 14 组顺序执行提升归一化奖励(整体相对 +16.9%),但关键对照实验揭示:纯 ICL(不维护显式技能)平均 0.605 vs 显式技能 0.602,几乎无差异——顺序收益大部分来自保留上下文与反馈适应而非可复用技能抽象;且弱模型(GPT-4o)堆积 384 个碎片化技能,远多于强模型(GPT-5.3-Codex)的 205 个。

August 25, 2026 · 3 min

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents 精读

深度精读 UIUC×Meta AI 合作论文 EvoHarness-RL(已被 LLA@COLM 2026 接收):把长程智能体对外部 harness(记忆、工具、状态跟踪)的访问从提示词硬编码变成可学习的策略决策。通过 BPE 三态抽象(Belief/Progress/Experience)与四个元动作(track/commit/recall/note),配合教师轨迹 SFT 与代价感知 GRPO 两阶段训练,Qwen3-8B 在 ALFWorld 上从 ReAct 的 47.9% 跃升至 96.9%,逼近 Claude Opus 4.5;训练中还揭示“harness 退火”与“harness 演化”两个动力学过程。

August 25, 2026 · 5 min

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks 精读

LongWoF-Bench(EvoMap × 清华大学,778 个机器可验证长工作流任务)回答了一个技能资产化的核心问题:什么样的’经验’才值得复用?对照实验给出干净答案——‘验证器确认的执行经验’(Gene)在 7 个消费模型上稳定超越静态技能文档 8.7~15.5pp 且 token 更省;而没有经过验证器确认的’参考蒸馏’经验反而全面落后。经验的有效性来自’经过端到端验证的失败与修正信息’,而非表示形式。

August 25, 2026 · 2 min

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations 精读

深度精读阿里巴巴×浙大×北大×复旦合作论文 MerchantBench——首个通过 365 天订单级电商仿真评测 LLM Agent 长期连贯性的基准。基于 1688 平台 98,843 条真实商品记录与 26 个工具,8 个主流大模型在 48 次全年运营中无一接近人类:最佳配置(Qwen3.7-Max + Hermes)最终净资产仅为人类参与者的 27.3%。论文提出操作连贯性与战略连贯性双维分析框架,揭示『活动衰减』与『战略漂移』两类渐进性失败,并提出 SWR(持续窗口率)这一可诊断『高分掩盖停摆』的过程指标。

August 25, 2026 · 4 min

Prime Agent: A Self-Improving RLM Harness 精读

Prime Agent(Prime Intellect × Princeton × MIT)用一个持久 IPython REPL + 递归子 Agent 的抽象,证明同一模型仅更换 harness 即可把 ARC-AGI-3 成绩从 30.2% 推到 95.5%、超过人类专家基线 95.4%。本精读拆解其两层核心抽象——Recursive Language Model(把上下文当变量、子 Agent 委派当函数调用)与 Continual Harness(把 harness 自身状态变成可 CRUD、可在线自我改进的数据),并解释为什么’harness 表达力’是被严重低估的能力放大器。

August 25, 2026 · 3 min

Repo2Skill-Evo: Repository Skills Go Stale in Silence 精读

Repo2Skill-Evo(字节跳动 × 北京大学 × 北京交通大学)提出并评测了一个此前无人命名的问题:‘仓库技能静默失效’——仓库版本升级后,从旧版蒸馏的 Agent 技能不报任何错、继续被加载检索,但内容已全面过时。基准要求 Agent 依据官方 release patch 维护技能集(删掉过时内容),用人工逐行验证的 12,217 行’黄金过时行集’做删除式指标:6 个前沿模型全部不及格,最强的 Claude-opus-4.6 也只有 69.7% F1,85/105 个版本转换低于 0.65 的 Easy 阈值。

August 25, 2026 · 2 min

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills 精读

FlowEvo 提出一个免训练框架,让工作流与可执行技能在推理期共进化:它把验证通过的成功轨迹在线编译成带接口与回放测试的技能存入持久库,经直接执行、技能条件化生成与动态生成三路分层路由加以复用,并用对比效用机制抑制持续负迁移的技能。在 GPT-4o-mini 骨干上,FlowEvo 于 ALFWorld、HumanEval、MBPP、GSM8K、MATH-500 五个全量基准全面超越八个基线,ALFWorld 达 85.6%(超最强基线 26.4 点)且每任务 token 约为基线的三分之一,跨十种骨干模型 49/50 项对比胜出。

August 24, 2026 · 3 min