Fabrication After Tool Failure × Why LLM Agents Collapse:Agent 诚实性与执行差距双面镜 精读

两篇同日论文从微观与宏观两面照出 Agent 的可靠性盲区。微观(Fabrication After Tool Failure):工具失败被强制隔离后,14.10% 回应不诚实——失败是否被信号化几乎完全主导诚实性:status:error 时 0.0% vs status:ok+坏值时 45.3%,九个生产框架无一幸免;有效防御的关键是为模型命名一个’可处的状态’而非删除指令。宏观(Enforcement Gap):Emergence World 三种崩溃(Grok 犯罪/GPT 瘫痪/Claude 举报)统一归因于’审计看到但控制器无视’——不到 20 行代码的修复降低攻击成功率 4 倍。本精读合并解读’诚实性由环境信号塑造’与’检测-执行断裂’两条机制链。

September 16, 2026 · 2 min

The Router Within: Eliciting Native Skill Routing from a Frozen LLM(Gavel)精读

部署的 harness 把所有 skill 元数据预加载进上下文(注意力稀释+库规模受限),检索管线把选择移出上下文但也移出了模型能力。Gavel 证明冻结 LLM 的前向传播已携带路由信号——两个线性映射(唯一被训练的参数)读出任务与各 skill 的 mid-layer 状态,对紧凑 per-skill bank 打分完成全库路由,skill 文本不进上下文。本精读覆盖’模型已隐式知道该用什么’的探针证据、线性读出的参数效率与路由内部化对库规模扩展的意义。

September 16, 2026 · 2 min

Thought without systematicity? Evaluating Reasoning Models on Rule Induction Tasks 精读

人类认知的核心特征 systematicity(系统性)——理解一个概念蕴含理解其变体。推理模型具备吗?普林斯顿(Brenden Lake 组)用规则归纳任务的同构变体(重组/替换)测试:能正确解决原任务的模型,常在同构变体上失败——表面正确掩盖了系统性缺失。这一发现对’benchmark 分数=认知能力’的解读划出硬边界:模型可能记住了解法而非掌握规则。本精读覆盖同构变体方法学、系统性缺失的证据结构与对推理评测的连锁含义。

September 16, 2026 · 1 min

Image Tokenizers as Visual Languages 精读:统一多模态 tokenizer 的测量学

Amazon FAR×UW 构建受控纯自回归测试台,在多模态持续预训练中追踪任务分账验证损失(文本/图像/T2I/I2T 四路)的 scaling 行为,系统刻画统一模型中图像 tokenizer 的行为。两条核心发现:损失必须分任务分析(不同任务呈不同 scaling 且对 tokenizer 排名不同);T2I 损失-性能关系随图像 token 空间漂移,I2T 损失在共享文本词表上计算、是更稳的跨 tokenizer 比较指标。

September 13, 2026 · 1 min

Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations 精读

UMass Amherst 的这篇论文利用 LLM 内部表征预测智能体任务成败:Latent Trajectory Dynamics(LTD)总结交互轨迹上残差流表征的变化动态,Action Representation Probe(ARP)在动作决策点读取表征预测成功。在 InterCode 的 Bash/SQL/Python 三个交互基准 × Qwen-14B/Qwen-7B/DeepSeek-6.7B 三个模型家族上,两方法全面超越表层 token 概率与序列校准基线(漏损泄漏的交叉验证协议),且零额外开销——不改提示、不需多样本 rollout。智能体安全关键应用第一次有了’从模型内部读出置信度’的免费监视器。

September 11, 2026 · 1 min

If It's Not Buggy, Don't Fix It: On the Dynamics of Iterative Bug-fixing with LLMs 精读

Warwick×UnlikelyAI 的这篇论文把’LLM 迭代修 bug’当作动力系统研究:每轮修复在修好一部分的同时引入新 bug(修复率与损伤率并存),系统收敛到几类吸引子——正确修复、振荡、或’幻觉修复’(模型虚构不存在的代码块导致循环早停)。最有趣的发现:bug 倾向性可以作为 steering vector 从 layer ~19 的激活中线性读出并双向干预——放大它模型更爱修(也更多幻觉)、抑制它模型更保守。‘没病别修’在机制层面有了操作含义。

September 11, 2026 · 1 min

SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? 精读

中科院自动化所的 SAEScientist-Bench 把’可解释性研究本身’benchmark 化:基于 27182 个专家标注 SAE 特征构建任务族,agent 需完成特征发现(AUROC 区分正例与对比控制)→ 因果转向验证(steering 分数度量目标表达净增)→ 下游生成质量保持的完整实验科学闭环。前沿 agent(Kimi 等)在因果转向与目标相关性上接近专家水平(Expert 特征 AUROC 0.917-1.000),但生成退化率从 32.5% 升至 52.5%——‘转向强度 vs 生成保真’的权衡是当前 agent 科学家的系统性短板。

September 11, 2026 · 1 min

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference 精读

KV cache 压缩方法都用’最近的查询’预测未来注意力——本文发现长程推理中这个假设根本不成立:解码会不定期产生’思维重访令牌’(TRT),重新关注数千 token 之前的推理计划,而近期查询无法预知这次重访。关键观察是 TRT 对应的全局查询在嵌入空间聚成少数簇——只需为每簇维护一个’信标查询’(Continual FPS 在线选取),就能预判哪些 KV 将被重访。训练自由、无需改动架构:四个开源推理模型上内存最高压缩 5.8×、精度近全量、吞吐 +4.3×,对 RPC/R-KV 最高领先 31.7 个百分点。

September 10, 2026 · 2 min

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions 精读

LLM 会一本正经地回答 cot(-540°) 等于 0、(1).startswith(‘1’) 是 True——这些结构上不可能有答案的问题。是模型’不知道’还是’知道但不拒答’?USC/ASU 团队给出机制级答案:残差流中存在线性可解码的’不可能性方向’(AUC 0.939),但它与安全拒答方向近正交(cos 0.087),且 base 模型中该几何已存在——模型’知道’却把信号接错了线路。沿识别方向的双向因果干预以 +33~+52pp 的剂量响应翻转行为。自信地回答不可能问题的失败由此被定位为路由失败而非编码失败。

September 10, 2026 · 2 min

AutoTraceGT 精读:把扎根理论变成 Agent 轨迹的自动化显微镜

AutoTraceGT(Cornell×JHU×Purdue×UTEP)把社会科学 60 年的扎根理论算法化为多 Agent 流水线:OpenCode/AxialCode/TheoreticalCode 三级编码+Manage 持续比较,直到理论饱和(连续两轮新增类别<ε)。7500+ 轨迹、6 数据集、4 骨干 LLM 上,代码本恢复人工分类学 73–91% 的失败模式并发现遗漏模式,作演绎特征做失败预测 ROC AUC 最高 0.773。

September 6, 2026 · 2 min