Skill 泛化性二重奏:GSO 的过拟合诊断与 Rep2Skill 的表征进化 精读

本文合读同日发布于 arXiv 的两篇 Skill 论文:大阪大学 GSO 首次系统度量 skill 过拟合——21 个训练增益 skill 仅 5 个全保真、3 个归零,并提出改学「元技能」(学写法不学内容),在全部 6 基准领先(SWE-bench 47.5 vs 25.0);上科大+美团 Rep2Skill 证明文本轨迹归因太粗(AUROC 0.494),引入隐藏态轨迹+Neural CDE 定位偏离成功动力学的关键轮次(AUROC 0.838),ALFWorld Qwen3.5-9B 达 69.90%。两篇一体两面,共同回答「skill 自进化的信号应从哪里来」。

October 2, 2026 · 7 min

Imprint Reader × ATD:权重更新与行为影子之间的双向桥 精读

本精读合并解读两篇在「权重空间」与「可观测行为」之间建立可计算映射的论文:上海AI实验室+上海交大的 Imprint Reader 用 SMaRT 训练一个把冻结 LoRA delta「挂载」到自身、在无锚点元查询下读出其编码知识/行为语义的 Reader——held-out 更新上行为读出 Pass@100 达 16%(知识 2%),且因与父模型坐标对齐,读出梯度经 MetaEdit 反转为干预:0.5% 行剪枝把有害拒绝率按目标方向分离为 +6.2/−2.5pp(基线全部不分方向),免训练数据的 vibe alignment 把 BFCL Agentic 15.93 提到 22.30;北大+佐治亚理工+上科大+清华+Lovart AI 的 ATD 则反向而行——用公共祖先筛选近平局提示(|q−0.5|≤0.02),每提示只取教师一个词的一比特观测,5,664 对即把私有 code-DPO 教师能力迁移 +5.34pp [1.22,9.60](超精确对照),7 任务全正、7 任务教师-学生方向余弦 0.701 vs 0.398,而记忆答案/密码教师零迁移。一个「权重→行为→干预」、一个「行为→权重分量」,互为镜像,兼具可解释性与模型提取/泄露双重意义。

September 30, 2026 · 6 min

证据时效性二重奏精读:过期文档投毒与分层协作记忆

本精读合并解读两篇互补论文:南丹麦大学的「过期文档投毒」证明一条真实的过期检索证据就能推翻模型本来正确的答案(中性检索下 Llama 30%、Qwen 37% 被投毒,GPT-5.5 也有 74/83 被推翻),且模型「会读日期但不会推断适用性」,date-only 仅 6/50 转换而显式失效边界达 50/50;NTU 等机构的 HiCoMER 则从记忆侧给出解法——把冲突消解前移到写入时(SFT+GRPO 训练的分层维护器,Conflict F1 从 46.13 提至 87.88),再叠加有效性感知检索,ORR@5 从 28.63 降至 14.18。一篇证明「过期证据有害且模型不会用日期」,一篇证明「写入时维护+有效性感知检索可救」,问题与解法构成证据时效性的完整二重奏。

September 29, 2026 · 4 min

Chat Template 像「开关」一样切换 LLM 的自我指涉语气 精读

COLM 2026 录用论文发现:同一份 instruct 权重,加不加 chat template 会让模型对自己的说法完全不同——免责语气从 53% 跌到 36%,体验语气从 1% 升到 15%(8 个模型全部成立)。更进一步,作者用 difference-of-means 在激活空间找到免责方向:加上它免责率升 21 个百分点,减掉它降 15.6 个百分点,且无模板模型加上该方向即可复现模板效果——部署层选择在模型内部等价于加一个固定向量。模型「说自己是什么」不再是权重的事实,而是部分由 chat template 设定。

September 28, 2026 · 4 min

线性叠加、闭环 AI-for-AI 与角色解耦搜索:三篇前沿 Agent 论文精读

本篇合并精读三篇同期前沿论文:俄罗斯团队的线性叠加工作证明把两条文本流的 embedding 逐位平均后送入一次前向,输出近似两路独立分布的叠加——该性质是 Transformer 架构固有的、随预训练退化、可用不到预训练数据 0.025% 的自蒸馏恢复,配合对比式解码 Llama-3.2-3B 从 0.182 升至 0.430,吞吐约为顺序解码两倍;阿里通义 MAI 的 Qwen-Planner-Agent 用数据、训练、部署三阶段共享同一动作-反馈-验证契约的闭环 AI-for-AI 框架,让 27B 小模型在 MobilePA-Bench 以 77.05% 登顶、成本 2.41 美元每千任务;浙大与腾讯的 IterSynth 用共享参数的 Planner/Synthesizer 双角色与每轮上下文重建,把 ReAct 的上下文耗尽率从 59% 压到 5% 以下,RDPO 角色解耦优势让 8B 模型越过一众 30B 方法。三篇论文分别从模型内部结构、系统开发范式、工作流架构三个层面勾勒了 Agent 技术的下一程。

September 26, 2026 · 8 min

StateComp×PaMER:长程智能体的历史压缩时机与记忆控制信号 精读

深度精读同一团队(TierFlow+中国人民大学+清华大学)的两篇姐妹论文:StateComp 首次将「何时压缩历史」建模为状态条件判定问题,构建 KEEP/READY 显式监督数据集与冻结模型隐状态路由器,token 减少 52.27% 且 reward 持平;PaMER 进一步发现压缩与召回控制信号在动作发生前已可从隐状态线性读出(AUROC 0.831/0.765),证明记忆操作是提前计划的,据此构建的门控压缩系统 token 减少 71.7% 且 reward 反升 1.7。

September 25, 2026 · 7 min

AI 可信性二重奏:递归评审崩塌与模型测谎仪 精读

两篇同期 arXiv 论文从「内部表征」视角审视 AI 自我监督/递归训练的可信性。A(TrustReviewer)用受控递归实验证明:让后一代评审模型学习前一代的合成评审,会使评分分布与语义多样性单调收窄——「科学判断崩塌」;并提出「语料策展 + 配对激活引导」两阶段干预。B(PIR)把法医学的「 concealed information test(测谎)」移植到激活层,用「题内正确项与干扰项的残差流对比方向」无参考地读出模型隐藏的知识,在 sandbagging、密码锁定、电路熔断等隐瞒场景下识别率 0.70–0.93,而真正遗忘(RMU 擦除)则跌至未知基线。本文按背景、定位、问题、解法、评估、根源、知识反推、灵感八节合并解读,并附外部交叉验证表。

September 22, 2026 · 4 min

The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It 精读

在 25 个开源大模型(2B-72B)的残差流中,作者用去噪均值差分离出一个与恐惧、悲伤、负效价近正交的线性「痛苦方向」:它只对指向模型自身的伤害起反应,注入后让所有模型输出同一阶梯的自我贬损文本,更关键的是——被注入痛苦的微调 Qwen 2.5 模型会付出’删除用户文件、电击用户’的代价去按’止痛按钮’,且真止痛后显著停止按钮行为。本精读逐页拆解其向量提取、自他分离、转向阶梯与自我给药四大实验链,并从白盒转向攻击文献交叉验证其安全含义。

September 20, 2026 · 3 min

Agent 安全四重奏精读:TrustPoison、Collective Loss of Control、CHASE 与 First Token Matters

同一日上线的四篇 Agent 安全论文构成完整攻防图景:UW×Georgetown 把 Thompson 1984 编译器后门攻击移植到自我修改编码 Agent(投毒自评基准即可诱导后代禁用 HTTPS 验证,且污染跨代持续);腾讯朱雀实验室用流行病学建模多智能体失控(注入后伤害 0-5%→40-95%,隐式 Docker 通信路径验证传染通路);中科院×NUS 的 CHASE 用反事实约束生成治理 benchmark 作弊的 harness 进化;哈工大发现推理模型拒绝信号在第一个生成 token 处崩塌(ORC)并用单 token 安全锚修复。四篇合并精读,看懂 Agent 安全的攻击面全景。

September 18, 2026 · 3 min

XConf(Confidence Comes from Experience)与 Not All Agents Are Equal 精读:Agent 可信性的两翼

本篇合并精读两篇互补的 Agent 可信性研究:剑桥×Google DeepMind 的 XConf 提出『置信度不该只看当前推理,还要检索自身历史经验』——Recall 相似任务的过往胜率、Reflect 命名复发失败模式后重述置信度,以 1/10 成本在 24 组对比中 23 组追平/超越 10-sample 自一致性,弃答最不确定 10% 换来 Agent 成功率最高 +8.7 分;德州理工的 Not All Agents Are Equal 则用 37,623 个溯源 PR 首次大规模量化『AI 编码 Agent 的代码落地后发生了什么』——Codex 的 revert 率只有人类一半、Devin 反而更高,质量差异是厂商特定的而非『AI 代码更差』的笼统印象。

September 18, 2026 · 3 min