CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents 精读

首尔国立大学与卡内基梅隆大学提出针对RAG的伪装式知识库投毒攻击CamoDocs。现有投毒攻击(PoisonedRAG、PIA、CorruptRAG)依赖查询包含——把目标查询写进投毒文档以提升检索命中——但这留下词法与嵌入空间伪影,简单的查询检测即可把ASR压到12%以下。CamoDocs反其道而行:合成良性+对抗双草稿、均匀切块,在良性块上做梯度引导的弥散token替换,把投毒文档嵌入推离质心以瓦解聚类防御的几何前提,再用轻量语言模型困惑度做连贯性过滤控制可读性损失。在7种防御×3开源模型×3数据集上,CamoDocs是唯一全面有效的攻击(HotpotQA+Llama平均ASR 60.81% vs PoisonedRAG 43.87%),闭源模型GPT-5.4-mini上仍达61.80%;同时暴露TrustRAG类重擦除防御在检索依赖基准NeoQA上删除91.48%检索文档、干净准确率从29.13%崩到5.79%的实用性代价。本精读拆解其攻防双方的机制因果链。

August 31, 2026 · 2 min

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 精读

深度精读 MirroS 联合清华、北大、南洋理工的技术报告 Code as Worlds。论文提出用可执行代码表示物理世界的组成、演化与外观(EWR 三元组),把’从观测恢复世界表示’建模为溯因式的 agent 发现环:提出-实例化-执行-渲染-验证迭代修正。再用验证过的世界免费生成带精确物理量标签的 VQA 数据训练 VLM,9B 模型在 QuantiPhy 上 55.4 分超过 Gemini-3.1 Flash 的 54.8,27B 推理变体 58.6 分超过全部基线。

August 31, 2026 · 3 min

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读

深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot:一个主动上下文管理框架。针对现有方法工具集贫乏(只有搜索/删除/摘要)、探索低效(上下文编辑动作影响悬殊却被均匀采样)、信用分配粗粒度(轨迹级奖励平摊给所有编辑动作)三大缺陷,它扩展出规划、长期记忆、软卸载三类工具,并用上下文变化量+熵变化识别关键编辑决策做分支采样(context-aware partial rollout),再用所有后续分支的平均回报估计动作级优势(细粒度信用分配,方差降为 1/n)。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85;深搜任务上每轮输入 token 稳定在 8-10K(基线线性涨到 30K);消融证明细粒度信用分配贡献最大且在全部基准一致提升。

August 31, 2026 · 5 min

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases 精读

深度精读 Epiq AI Labs 与康奈尔大学联合发布的企业级问答基准 CorporateBench。论文用程序化生成的时序知识库(KB)构建四家虚拟公司(12 到 10210 名员工、共 26.3 万封邮件),并从 KB 用人工验证的 SPARQL 查询确定性导出标准答案,保证任意规模下的跨文档逻辑一致性。五个前沿模型测试显示:实体抽取基本不随规模衰减,但关系抽取与时序关系严重崩坏;KB 直连(SQL 工具)显著优于 RAG,且两者差距随规模从 0.24 扩大到 0.37,揭示大规模企业通信网络仍是当前 LLM 的重大短板。

August 31, 2026 · 3 min

Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense 精读

滑铁卢大学与Vector Institute提出跨会话分解攻击:攻击者在互不关联的会话中提出看似良性的子问题,事后在模型外重组为有害目标。论文首次将其形式化为组合安全风险,证明风险转移定理——部署模型与参考环境的组合风险之差由允许子查询上的超额损失控制,说明缩放会把潜在组合风险转移到部署模型。配套600意图实验显示同族内更大模型重组后危害更高,而22M参数的IntentAlign-MiniLM意图对齐检索器以少25倍的参数超越0.6B嵌入模型,并证明检索是防御的主导杠杆。本精读覆盖其理论推导、双轨实验证据与防御设计的因果链条。

August 31, 2026 · 3 min

Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers 精读

深度精读 Thomson Reuters Labs 与多伦多大学/Vector Institute 合作的 LLM 评分器顺序依赖论文。批式打分(reranker、奖励模型、多文档 QA)中每个分数都依赖候选排列顺序,论文发现排序质量相同的评分器在下游决策上大相径庭:五个 nDCG@10 差距不超过 0.010 的已训练评分器,重排后保留集重叠度横跨 0.656 到 0.835。提示词层修复(round-robin 划分、logit 校准)完全触达不到决策端;提出的 OC-SFT 在损失函数中显式惩罚同一窗口 N 个排列下自身分数的方差,τ-PSI 从 0.209 降至 0.083,保留集重叠升至 0.835,单次前向即超过十排列集成的 BSC,且 nDCG@10 不降反微升。

August 31, 2026 · 3 min

EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses 精读

精读独立研究者团队的 EvoUndo。论文直面 LLM Agent 自进化的安全盲区:能提升能力的变异未必能被安全撤销,正确恢复往往依赖变异前状态。EvoUndo 把自变异表示为四元组(前向变异+见证捕获+恢复程序+效果契约),在反事实状态上做往返验证。600 个任务中 197 个能力正向但恢复失败的变异构成失败库:原始语言下常规修复 0/197;oracle 审计分解出双瓶颈——S0 层是 grounding 瓶颈(精确地址后 0/48→38/48),S1 层是表达力瓶颈(扩展语言后 142/143),组合修复 180/197。另发现丰富语言加精确诊断反而降效。把能改与改回去拆开的开创工作。

August 31, 2026 · 5 min

Fairness Invariants 精读:用循环不变式思想定位并修复算法公平性缺陷

招聘、贷款、量刑等高风险自动决策系统里藏着一种隐蔽缺陷:两个只差一个受保护属性(种族、性别、年龄)的相似个体,却得到不同决策。这篇被 ISSTA 2026 录用的论文借鉴程序设计语言中的循环不变式合成思想,提出 Remi 框架:把反事实配对转化为关系数据集,用决策树学出可读的公平不变式规则,再把规则当作运行时护栏,在不重训模型的前提下定位真值歧视根因超过 83% 的案例,并把黑盒神经网络的歧视决策削减 42% 至 94%,显著优于重训练类缓解基线。

August 31, 2026 · 3 min

Fast Weight Attention for Continual Learning 精读

深度精读 ByteDance Seed、Princeton、清华、UCLA 与 Hyperbolic Labs 合作的 Falcon 论文:把线性注意力与状态空间模型的状态转移显式化为在线学习规则,发现读后写语义下快记忆的正确训练对应是前缀配对 φ(k(t-1))→v(t) 而非常见的同对配对,并从平方误差回归与内积两个局部目标统一推导出 NLMS 归一化的六个变体族(Falcon-1/2/3 与 Falcon-1A/2A/3A),全部兼容 SSD 式 chunk 并行训练。语言建模上与最强递归基线互有胜负,变长加法外推上 Falcon-3A.3 以 87.2 平均精度大幅领先 Transformer 的 65.8。

August 31, 2026 · 6 min

GameWAM: A World Action Model for Video Games 精读

复旦、腾讯光子与清华深圳研究生院团队提出 GameWAM,首个面向电子游戏原生键鼠闭环控制(游戏玩法+GUI)的世界-动作模型。它用并行 Video-DiT 与 Action-DiT 做块因果联合流匹配,同时生成未来视觉观测与可执行动作;用每步动作路由器区分 gameplay/GUI 两种控制分布,用预测长执行短的块周期控制解耦规划与承诺,用分层历史压缩维持长时程记忆。在 Minecraft MCU 上平均成功率 50.7(次优 36.8)且执行步数全面最少,零样本迁移 VoxeLibre 达 59.2%。论文还发现并命名了 LASI 失效模式:采样动作源的低频分量会系统性牵引生成相机运动,复用可致原地旋转。整篇论文训练仅 2.79B token,是 Game-TARS 配方的 1/200。

August 31, 2026 · 3 min