MassAlloc Attention × DaRoPE:注意力计算分配与位置编码的双子星重构 精读

本精读合并解读两篇重构 Transformer 核心算子的论文:HKUST(GZ)×BAAI×巴黎西岱的 MassAlloc Attention(MALA)把稀疏注意力改写为「分布条件化的运行时计算分配」——保留全部 QK 打分,用 online-softmax 演化归一化因子做逐 tile 贡献比测试,跳过低贡献 tile 的 post-score 计算,同一容差 τ=1 统一前向/反向/prefill/解码,训练 FLOPs -23.1% 而 PPL 无损、关联回忆 89.67% 贴近 FullAttn(NSA 仅 22.61%);Meta AI 巴黎×Inria 的 DaRoPE(ICLR 2027)诊断出 RoPE 慢频带这一具体弱点,快带保序、慢带换成 sigmoid 有界的逐头内容坐标,外推免配置,K=256 键值回忆 30.5% vs 其他方法 ≤7.25%。二者共享同一哲学:不做一刀切裁剪,让算子自己知道「哪里重要」。

September 30, 2026 · 6 min

编码智能体经济学三重奏精读:成本行为、紧凑文档与上下文蒸馏

一次读完三篇 2026 年 9 月 25 日同日发布的编码智能体经济学论文:Purdue 的成本低效行为实证研究(三种行为覆盖 79%–98% 任务、最高吃掉 22.75% 成本,7 条开发者原则降本 41.73% 反超检索工具与智能体自合成技能)、孟加拉 DIU 与夏威夷马诺阿分校的紧凑文档基准(源码扣留时 0.08→0.71 的大提升 vs 源码在场时 33 vs 29/30 的大规模 null 结果)、北大的 LOHA+ACD 上下文蒸馏(压缩所见而非所言,上下文降 43%–57%,32K 限制下解决率反升至 21.1%,吞吐 1.9 倍)。本精读逐篇覆盖九部分结构,并在合并结语中回答同一个问题:什么信息值得放进上下文。

September 29, 2026 · 13 min

证据时效性二重奏精读:过期文档投毒与分层协作记忆

本精读合并解读两篇互补论文:南丹麦大学的「过期文档投毒」证明一条真实的过期检索证据就能推翻模型本来正确的答案(中性检索下 Llama 30%、Qwen 37% 被投毒,GPT-5.5 也有 74/83 被推翻),且模型「会读日期但不会推断适用性」,date-only 仅 6/50 转换而显式失效边界达 50/50;NTU 等机构的 HiCoMER 则从记忆侧给出解法——把冲突消解前移到写入时(SFT+GRPO 训练的分层维护器,Conflict F1 从 46.13 提至 87.88),再叠加有效性感知检索,ORR@5 从 28.63 降至 14.18。一篇证明「过期证据有害且模型不会用日期」,一篇证明「写入时维护+有效性感知检索可救」,问题与解法构成证据时效性的完整二重奏。

September 29, 2026 · 4 min

Just-in-Time Memory×EnSIMem:智能体记忆的读时策展与实体索引 精读

本篇合并精读两篇同期 Agent 记忆论文:Salesforce 的 Just-in-Time Memory(JITMEM)把记忆策展从写时推迟到读时,读取时刻按当前任务即时从原始轨迹合成上下文,在 ALFWorld/WebShop/τ2-bench 上较最强基线提升 16.2/16.3/3.9 个成功率点;UIUC+Amazon 的 EnSIMem 用实体-属性索引重组长期记忆,检索沿实体关系而非时间线推进,在 LoCoMo/LongMemEval 上取得 90.6%/92.8% 的新 SOTA。两篇论文恰好回答了记忆系统两个正交的问题——何时策展(读时 vs 写时)与如何组织(实体索引 vs 时间线),合并精读可以拼出智能体记忆设计的完整坐标图。

September 25, 2026 · 5 min

StateComp×PaMER:长程智能体的历史压缩时机与记忆控制信号 精读

深度精读同一团队(TierFlow+中国人民大学+清华大学)的两篇姐妹论文:StateComp 首次将「何时压缩历史」建模为状态条件判定问题,构建 KEEP/READY 显式监督数据集与冻结模型隐状态路由器,token 减少 52.27% 且 reward 持平;PaMER 进一步发现压缩与召回控制信号在动作发生前已可从隐状态线性读出(AUROC 0.831/0.765),证明记忆操作是提前计划的,据此构建的门控压缩系统 token 减少 71.7% 且 reward 反升 1.7。

September 25, 2026 · 7 min

EvoOntology: A Self-Evolving Ontology Layer for Data Agents 精读

EvoOntology(中国人民大学 ruc-datalab)提出一个面向数据智能体的「自进化本体层」:把数据库的领域概念、字段映射与约束封装成可被 agent 在运行时按需查询的 MCP 服务,并用 builder agent 自动构建初版本体、用「诊断—归因—修补—门控」四步环从失败轨迹中持续进化。本文按九部分结构精读,重点拆解三层架构、四步进化环,以及为何「静态语义层全量注入反而掉分」是全篇最有证明力的实验设计,并从因果链上解释其优势根源。

September 22, 2026 · 5 min

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference 精读

KV cache 压缩方法都用’最近的查询’预测未来注意力——本文发现长程推理中这个假设根本不成立:解码会不定期产生’思维重访令牌’(TRT),重新关注数千 token 之前的推理计划,而近期查询无法预知这次重访。关键观察是 TRT 对应的全局查询在嵌入空间聚成少数簇——只需为每簇维护一个’信标查询’(Continual FPS 在线选取),就能预判哪些 KV 将被重访。训练自由、无需改动架构:四个开源推理模型上内存最高压缩 5.8×、精度近全量、吞吐 +4.3×,对 RPC/R-KV 最高领先 31.7 个百分点。

September 10, 2026 · 2 min

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 精读

流式视频理解的主流范式是’存历史、按需检索’,但外部证据永远只是临时上下文。南京理工×蚂蚁×NUS×港中文的 LatentStream 把范式翻转为’检索并内化’:分层流记忆 + 渐进扩张感受野的 latent token 把历史证据固化进固定长度潜记忆,用熵构造的渐进置信奖励在测试时联合优化。OVO-Bench 64.2%、StreamingBench 76.9%、MLVU +6.1,全部 SOTA。

September 7, 2026 · 2 min

LatentPress: Context Compression Beyond Text and Vision 精读

压缩后的上下文通常仍以文本或图像这两种’给人看’的形式存在。LatentPress 提出第三种表示:小型 writer 把对话/文档直接写成连续记忆 token,冻结解码器经输入嵌入接口读取,推理时零文本重建。LongMemEval 上 7.7× 压缩反而比未压缩证据更准(0.504 vs 0.490),写入 43ms 比摘要快一个量级——机器原生的记忆表示从此有了实证立足点。

September 7, 2026 · 3 min

Language Models Can Control Their Own Attention 精读

长上下文解码时,模型每生成一个 token 都要把整个 KV cache 读一遍——1M token 上下文意味着每步约 15GB 的内存搬运,而注意力其实高度集中。KAIST AI 联合 Google DeepMind 提出 Declarative Attention:让模型在思维链里用 // 三种标签自己声明’现在需要看哪里’,推理引擎像解析工具调用一样解析声明并跳过绝大部分 KV 读取。零训练、零外部打分器,15 个长上下文任务上 Gemma-4-31B 注意 token 降 52.0%、精度仅降 1.27pp。本精读拆解三模式协议、与代理打分式稀疏注意力的机制差异,以及’模型自己最知道该看哪里’的第一性原理。

September 4, 2026 · 3 min