Narcissus: Program Synthesis Using Context-Aware LLM Approximations 精读

代尔夫特理工大学团队提出 Narcissus:当任务固定目标语言(CFG 定义的 DSL)时,LLM 提案通常违反语法或不满足规格——与其反复重提示,不如把提案一次性编译成「上下文感知」的搜索启发式。它将提案解析修复为语法树,用前缀对齐(相同上下文的提案是否用了同一规则)、子程序复用(提案反复出现的片段)与正则化(提案指示的程序规模+保底项)三个信号给每次扩展打分,搜索期间零 LLM 调用。在五个域、两种搜索后端上,Narcissus 在每个预算下击败静态先验:SLIA-70 上 51.4 对 32.2,ARC-100 上解决 40% 而原始提案仅 13%,到达提案区域快约 12 倍;DeepSeek 弱提案加搜索甚至超过 GPT-4o 直接采样。正则化保底项保证任何规则不被剪枝——错误提案只会延迟解、不会藏死解。

August 27, 2026 · 4 min

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure 精读

深度精读 PST 2026 的 ToolMinimize 论文——Case Western Reserve 大学提出的 LLM Agent 工具调用隐私最小化中间件。动机研究显示三个生产 LLM 默认 prompt 下 81-88% 的工具调用包含不必要的隐私敏感数据,显式隐私指令后仍剩 36-76%(Llama 几乎无效)。现有防御全是 allow/block 门控或 token 级 PII 检测,无法改写参数值。TOOLMINIMIZE 在参数构造与工具执行之间拦截调用,用「模式+实体+语义」三段分类器识别 PSD(含隐式隐私如医院名隐含诊断)、按 JSON Schema 做必要性分析、执行删除/泛化/替代/截断四种改写。307 次真实调用验证:隐私成本降 81.2-92.0% 且 100% 任务有效(TOST 等价 p<0.001),中位延迟仅 1.77ms。

August 27, 2026 · 5 min

Tunable Tool-Call Rates in LLM Agents via Representation Steering 精读

深度精读 UC Santa Cruz + UC Berkeley 论文:LLM agent「是否调用工具」这个离散决策,可以被残差流中的单一线性方向连续调节——无需训练、无需改提示,一个旋钮把调用率从近 0% 单调推到 90%+,且新增调用精准落在模型答不出的低流行度问题上,PopQA 准确率 0.29→0.56,方向还能零样本迁移到 6 个未见工具。

August 27, 2026 · 2 min

ReCache: 工具增强Agent的组合不变KV缓存复用 精读

工具增强Agent每个请求都要重新编码一遍以不同组合、不同顺序出现的工具与技能schema,标准前缀缓存对此无能为力。ReCache提出resource-wise attention,切断资源间注意力并重置资源内位置索引,使每个资源的KV块具有组合不变性、可独立缓存复用;再叠加贡献选择的层-KV头组路由与字段感知的语义剪枝,把KV张量内存降低92.43%、注意力加速1.423倍,同时Inv-F1基本不降。本精读覆盖其动机、机制、七数据集基准与效果根源分析。

August 23, 2026 · 3 min

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读

蚂蚁集团与上海交通大学联合提出 EnvACE,让一个策略同时扮演「行动者」和「环境」两个角色:Acting 角色生成工具调用,Rehearsal 角色生成对应的环境响应,两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互,却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline,综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是,模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling,在提交执行前先在内部排练验证,把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」,并提炼出三条可迁移到其他领域的通用灵感。

August 8, 2026 · 6 min