Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail 精读

帕绍大学单作者研究,用一台CPU笔记本完成了一项改写agent工程常识的测量:把失败调用和报错追加进transcript这个从ReAct沿用至今的标准做法,会让小模型更倾向于重复刚刚失败的动作。定义corrective gain指标后,6个模型(135M-1.7B)在两个环境的G全部为负(约-1.03 nats/token,每token odds×2.8)。反事实分解揭示根因:83%的损害来自失败调用的表面形式触发了复制机制,而非模型读不懂报错。由此预测并验证:描述化改写与decoder级ban有效,‘别重复’指令无效,而’清空上下文重试’这一先前推荐方案恰恰最糟——它精确恢复了产生失败的上下文。

August 27, 2026 · 2 min

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis 精读

微服务故障根因分析(RCA)自动化该往哪个方向使劲?这篇香港中文大学与字节跳动的论文先用 24 个受控实验给出反直觉结论:裸的通用编码 Agent(Codex/Claude Code)已经全面超过从零构建的专用 RCA Agent——但离生产可用还很远,缺的不是推理能力而是系统特定经验。答案不是重造 Agent,而是造一个能自我进化的外部 harness:OpsHarness 用四层知识与 idea-card 工具库做数据平面,用「挖掘-验证」双门进化循环做控制平面,Top-1 准确率 59.0%(较裸 Agent 相对提升 63.4%,是专用 Agent 的 4.02 倍),并在真实生产环境拿到约 3 倍提升、同一故障复发时从 Top-3 之外跃升 Top-1 且 2 分钟内定位。

August 27, 2026 · 4 min

From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use 精读

OODA-Tool(AACV 2026)诊断出多轮工具使用的核心失败模式为「状态-动作竞争」:直接函数调用与 ReAct 策略在同一条自回归轨迹里同时学状态跟踪和动作生成,产出下一个调用的压力会覆盖早期积累的信息。借鉴博伊德的 OODA 循环,它把决策拆为 Observe(重建任务状态)→ Orient(判断执行就绪)→ Decide(形成动作结构)→ Act(落地实现)四个类型化阶段,由中央控制器逐级校验交接。在 ToolDial 上用 Qwen3 从 0.6B 到 14B 全规模评测,Specialized OODA 相比 Direct-LoRA 提升 4.48-6.99 个百分点,小模型与状态密集型任务增益最大;状态-动作矛盾率从无分割的 10.7% 降至 3.9%,代价是 2.36 倍延迟。本精读拆解其类型化接口、消融证据与并行调用边界。

August 27, 2026 · 3 min

FrontierChallenge: Evaluating Scientific Workflow Completion 精读

深度精读 Apodex 团队的科学工作流基准论文——300 个端到端科学工作流(本文发布 97 个、203 个内部留出),覆盖量子化学/分子动力学/材料表征/分析化学/生命科学/电化学环境六域 21 个工作流族,评测单位是完整交付的工件 bundle 而非单一答案。12 个前沿模型 × 3 种 scaffold 的结果揭示核心裂口:最高平均分 87.9 但最高 Pass Rate 仅 20.6%,分析化学 87.6 分对应 4% 完成率、电化学 94.9 分对应 0%;非通过 Claude Code 轨迹中 75.5% 结尾仍声称「已完成」——高分与自信声明都不是交付成功的可靠信号。

August 27, 2026 · 4 min

FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs 精读

Texas A&M 与诺维萨德大学团队提出 FuzzingBrain-Bench:第四代 LLM 漏洞发现评测范式——不再要求模型复现预定义目标漏洞,而是在自包含 Docker 沙箱中经 fuzzing harness 触发尽可能多的不同 crash,按「去重后的不同 crash 签名数 × 难度系数」计分。基准含 77 道挑战(43 个开源项目,36 C/32 C++/9 Java),覆盖内存安全与 DoS 等 14 类缺陷;三跑复现门控防 flaky 虚增、每挑战 3 签名封顶防单一多产缺陷主导、答案剥离+无网络+oracle 不可达防作弊。三个 Claude 模型实测:Opus 4.8 以 196/579(34%)居首,触发 60/77 挑战的 crash;13 道 D5 挑战无一模型攻破。实验还证明模型常发现计划外缺陷——这正是放弃「目标复现式」评分的直接证据。附带成本/token/轮次的行为分析揭示输入 token 是输出的 84–188 倍。

August 27, 2026 · 4 min

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in MoE LLMs 精读

MoE(混合专家)架构靠稀疏激活省钱省算力,但 Louisiana State、UCLA 等五校联合团队发现:终止 token(EOS/EOT)的生成权竟集中在极少数「终止相关专家」手里,路由层因此成了一个局部化的攻击面。Groundhog Bit-Flip Attack(GBFA)——首个针对 MoE LLM 的 bit-flip 型 Denial-of-Wallet 可用性攻击——只需翻转路由器权重中平均不到 4 个专家对应的少量 bit,就让平均输出膨胀 5912%(最严重 87 倍)、多数样本顶满 token 上限,而模型语义基本无损、PPL 几乎不变。攻击波及对话、推理(思考永不停)、Agent 规划(10 个沙盒全部顶满步数)三种模式。本精读拆解「专家-终止 token 特化」的发现、免推理的脆弱 bit 搜索,以及为什么防御如此棘手。

August 27, 2026 · 4 min

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents 精读

深度精读腾讯微信团队(26 Aug 2026)论文 IAPO:多轮服务 Agent 训练中,最终奖励无法指出哪些中间动作真正立功。IAPO 把每条已完成轨迹表示为带符号的影响依赖图(支持使用边/失败使用边),用「信息被下游实际消费」「错误可观测传播」两路证据重新路由轨迹级优势,不改奖励、采样与损失实现,在 τ²-Bench 上把 Qwen3-8B 从 29.61% 提到 42.18%(+12.57pp),电信域增益最大达 +18.19pp,且不伤函数调用能力。本文解析其「写即所用」的证据三条件、符号条件路由机制与三条数学保证。

August 27, 2026 · 5 min

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution 精读

Agent 的能力从来不只取决于模型权重,还取决于包裹模型的执行脚手架(harness)。LV-NUS Lab 提出 JIT-Agent,训练一个 27B 的「harness 智能模型」,在推理时为任意现成 agentic LLM 即时合成任务自适应的 harness,并能修复与在线演化。DeepSeek-V4-Flash 配上它即可在 DeepSearchQA 反超 GPT-5.6 达 9.1 分,同时成本比所有固定 harness 平均低 36%。本精读拆解其四模块 harness 协议、三阶段训练流水线与 Evo-GDPO 目标,并解释「按任务实例即时生成脚手架」为什么在机制上必然优于单一固定脚手架。

August 27, 2026 · 4 min

Joint Optimization of Tool Creation and Use for Large Language Model Agents(SMITH)精读

深度精读 Appier AI Research + 台湾大学(25 Aug 2026)论文 SMITH:现有工具创建系统让强模型写工具、弱模型用工具,写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用:use 任务只给 JSON schema,接口写得烂必然调用失败,形成「写即所用」闭环;三条独立奖励轴分离 schema/代码/结果失败;easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架,平均输出仅 100 token(比 CoT 少 32 倍),其工具还能让 350M 小模型追平 30B 写的工具。

August 27, 2026 · 6 min

Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory 精读

深度精读中国科大 HiPS 论文:把记忆增强 agent 的记忆管理策略分解为「全局共享层 + 用户专属增量层」,用分歧门控决定谁需要个性化、跨层规则流动动态校准边界、反循环奖励分离阻断自我验证——12 个评测设置全部 SOTA,并发现域内靠通用规则、域外靠个性化机制的「组件重要性翻转」现象。

August 27, 2026 · 3 min