Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 精读

崇实大学提出 Skill Following(SF)评测框架:现有’检索 vs 不检索任务的聚合分差’衡量技能库价值存在严重选择偏差。论文形式化 RAE(Retrieval-Invoked Actual-Use Effect)指标——仅在 agent 主动发生检索的任务上,比较同一任务开/关技能的配对执行差。17 个 LLM × 编码(MBPP+)/数学(Math500)的实测揭示’评测悖论’:多个模型聚合检索提升为正、RAE 却为负——系统层面看似受益,恰恰在真正调用了技能的任务上反而有害。诊断分析证明’上下文出现技能内容’远不等于’模型遵循技能’,当前工具使用能力被系统性高估。

September 3, 2026 · 2 min

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases 精读

深度精读 Epiq AI Labs 与康奈尔大学联合发布的企业级问答基准 CorporateBench。论文用程序化生成的时序知识库(KB)构建四家虚拟公司(12 到 10210 名员工、共 26.3 万封邮件),并从 KB 用人工验证的 SPARQL 查询确定性导出标准答案,保证任意规模下的跨文档逻辑一致性。五个前沿模型测试显示:实体抽取基本不随规模衰减,但关系抽取与时序关系严重崩坏;KB 直连(SQL 工具)显著优于 RAG,且两者差距随规模从 0.24 扩大到 0.37,揭示大规模企业通信网络仍是当前 LLM 的重大短板。

August 31, 2026 · 3 min

Lost in Compression 精读:抽取式提示压缩器的跨语言审计

提示压缩号称能砍掉 LLM 推理成本,但主流学习型压缩器几乎全部用英语训练和评估。这篇来自 Hostinger 与考纳斯理工大学的论文做了一次严格的受控跨语言审计:在十种语言、五种文字系统的完全平行数据上,用目标模型分词器做预算匹配对照,超过 25.8 万次评估调用后发现迁移差距真实存在且随压缩强度急剧放大——保持率 0.33 时英语保留 57 至 62 个百分点的上下文价值,中文几乎归零。差距由监督语言而非模型架构驱动:三种英语训练的压缩器全部复现差距,多语训练的 XProvence v1 完全没有差距,确定性基线也无差距。非英语的安全压缩预算只有英语的一半左右。

August 31, 2026 · 3 min

MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation 精读

对话式 LLM 的记忆系统一直用“直接问答“评测:问模型能否回忆先前对话里的事实 X。京都大学团队做了 4 个月真实部署(40 用户、1872 会话、7 种记忆条件)检验这个假设——Direct QA 准确率随容量从 19.7% 涨到 70.1%,用户满意度却纹丝不动。他们从中检出 72 个用户主动引用记忆的真实时刻,构建 MEMUSE 基准,用“自然整合“(回复是否真正织入被引用的记忆)替代召回评测:同一模型同一上下文,Direct QA 78.8% vs 自然整合仅 7.9%,71 分鸿沟;且只有自然整合与满意度相关(ρ=+0.29),Direct QA 完全不相关。Two-step 消融把瓶颈定位于对话生成层而非检索层——即使提取步骤已给出正确细节,生成仍有 77% 不使用。

August 27, 2026 · 3 min

Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context 精读

深度精读 UC San Diego 的 SCALE-QA 与 TSIM 论文——针对真实助手使用形态「单线程多主题混杂的长对话」定义并测量 episode integrity failure:决定性证据明明在对话里,系统却检索到貌似合理的碎片而非让局部约束生效的完整 episode。SCALE-QA 用 3000 题反事实基准(防预训练泄漏)+ 确定性运行时打包(16k-1M);TSIM 以语义漂移在线分段 + 三视图 episode 索引,在三个后端全部第一(比最强基线高 5.6-17.6 点),1M 诊断中用约 1.3k token 达 96.5% 而 Full Context 用 1.05M token 只有 87.2%。本文拆解「找回 episode 而非答对问题」才是瓶颈的完整证据链。

August 27, 2026 · 5 min

Recuris: Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses 精读

Recuris(NUS × Stanford × Oxford × Princeton)把递归自我改进从『改模型/改智能体』收缩到『只演化外置记忆控制层』:工作记忆维护经检查器验证的任务状态并按需调用技能,跨任务的固定 Meta-Agent 读结构化轨迹、把失败归因到 E/W/ρ/C 四组件之一并只修补被归因组件,经修复源任务且不回退开发集的验证门才准入。在 4 个长程基准 × 10 个模型上 35/37 完成的模型-基准对成功率提升,GPT-5.6 Sol +17.8、Claude Opus 5 +15.6、最长任务 +32.2 分,六类长程失败模式下降 20–86%;机制上证明长程失败是执行问题而非检索问题,技能价值是『调用条件性』的,结构化轨迹使故障定位从 13.0% 提升到 64.8%。

August 27, 2026 · 3 min

Active Inference as Context Acquisition for AI Agents 精读

深度精读 arXiv 2608.19202——把 Agent 的上下文获取(澄清提问、检索、工具调用、提示试验)形式化为主动推理:内层更新对潜在任务状态的信念,外层在上下文动作、任务动作与停止动作之间做选择,最小化包含风险、认知价值与成本的期望自由能。论文推出 OQA 基准,把提问变成属性表上的二十问游戏,用动态规划给出最优 oracle;七个前沿模型全部落后于 oracle。在提示补全实验中,定向澄清把验证器合规率从 0.0417 提升到 0.375,最佳设定 ε*=0.01、K*max=2。核心主张:主动推理是模型无关的上下文获取层设计原则。

August 25, 2026 · 4 min

The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search (Ascp) 精读

Ascp(北京大学 × 腾讯)为生成式搜索建立了’上下文分配定律’:同预算下窄窗多轮(k=2 检索×T=12 轮生成)比宽窗单轮(k=24×T=1)的 portfolio recall 高 0.144,T:1→12 带来 16.8-20.5pp 提升,且验证到 32B 规模。其测量工具是因果留一(LOO)探针——teacher-forced 反事实消融直接测量每篇文档对生成文本的因果利用率,在 same-query 硬负例下 AUC 0.876,而 embedding 相似度坍缩到 0.484(随机水平)。相关性代理测的是’话题相关’,不是’真被用了’。

August 25, 2026 · 2 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

浙江大学联合新加坡国立大学、东北大学、Heriot-Watt 大学与腾讯提出 MemTrapBench,首次系统评测记忆诱发的认知陷阱:忠实记录且语义相关的记忆,仍可能扭曲大模型的推理与信念,使表现跌破无记忆水平。基准按植入陷阱、噪声掩埋、触发陷阱三阶段生成 1050 个多轮对话实例,覆盖认知偏差、任务边界、创伤、安全四类场景;五个主流记忆框架在 Gemini 与 Qwen 上全部落后无记忆基线逾 10 个百分点,创伤场景去陷阱对照的正确性从 66.40% 回升至 91.07%,证明退化源于陷阱语义而非上下文长度。论文进一步提出推理时提示技能 AdaptiveMem,把是否该用记忆显式化为决策前的静默校验,最高提升 14.9 个百分点且不损害常规记忆基准表现。

August 24, 2026 · 4 min

Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories 精读

深度精读 arxiv:2608.12847——西安交大团队提出 QCR(Query-Conditioned Reuse),指出轨迹记忆的真正瓶颈不在检索而在检索之后的“复用”环节:历史轨迹里的用户名、路径、日期等绑定值会随时间过期,直接注入会诱导模型照抄旧值。QCR 在检索与执行之间插入一步改写,把选中轨迹转化为“工作流不变量/需重取绑定/适用条件/验证护栏”四字段笔记。在 WebArena/WorkArena/AppWorld 共 2391 个目标上,平均 Success 62.3%(比注入完整轨迹高 10.7 点),在线 token 省 48.9%;大绑定偏移下过期绑定错误率从 46.9% 降至 10.9%。

August 17, 2026 · 4 min