Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail 精读

帕绍大学单作者研究,用一台CPU笔记本完成了一项改写agent工程常识的测量:把失败调用和报错追加进transcript这个从ReAct沿用至今的标准做法,会让小模型更倾向于重复刚刚失败的动作。定义corrective gain指标后,6个模型(135M-1.7B)在两个环境的G全部为负(约-1.03 nats/token,每token odds×2.8)。反事实分解揭示根因:83%的损害来自失败调用的表面形式触发了复制机制,而非模型读不懂报错。由此预测并验证:描述化改写与decoder级ban有效,‘别重复’指令无效,而’清空上下文重试’这一先前推荐方案恰恰最糟——它精确恢复了产生失败的上下文。

August 27, 2026 · 2 min

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis 精读

微服务故障根因分析(RCA)自动化该往哪个方向使劲?这篇香港中文大学与字节跳动的论文先用 24 个受控实验给出反直觉结论:裸的通用编码 Agent(Codex/Claude Code)已经全面超过从零构建的专用 RCA Agent——但离生产可用还很远,缺的不是推理能力而是系统特定经验。答案不是重造 Agent,而是造一个能自我进化的外部 harness:OpsHarness 用四层知识与 idea-card 工具库做数据平面,用「挖掘-验证」双门进化循环做控制平面,Top-1 准确率 59.0%(较裸 Agent 相对提升 63.4%,是专用 Agent 的 4.02 倍),并在真实生产环境拿到约 3 倍提升、同一故障复发时从 Top-3 之外跃升 Top-1 且 2 分钟内定位。

August 27, 2026 · 4 min

From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use 精读

OODA-Tool(AACV 2026)诊断出多轮工具使用的核心失败模式为「状态-动作竞争」:直接函数调用与 ReAct 策略在同一条自回归轨迹里同时学状态跟踪和动作生成,产出下一个调用的压力会覆盖早期积累的信息。借鉴博伊德的 OODA 循环,它把决策拆为 Observe(重建任务状态)→ Orient(判断执行就绪)→ Decide(形成动作结构)→ Act(落地实现)四个类型化阶段,由中央控制器逐级校验交接。在 ToolDial 上用 Qwen3 从 0.6B 到 14B 全规模评测,Specialized OODA 相比 Direct-LoRA 提升 4.48-6.99 个百分点,小模型与状态密集型任务增益最大;状态-动作矛盾率从无分割的 10.7% 降至 3.9%,代价是 2.36 倍延迟。本精读拆解其类型化接口、消融证据与并行调用边界。

August 27, 2026 · 3 min

FrontierChallenge: Evaluating Scientific Workflow Completion 精读

深度精读 Apodex 团队的科学工作流基准论文——300 个端到端科学工作流(本文发布 97 个、203 个内部留出),覆盖量子化学/分子动力学/材料表征/分析化学/生命科学/电化学环境六域 21 个工作流族,评测单位是完整交付的工件 bundle 而非单一答案。12 个前沿模型 × 3 种 scaffold 的结果揭示核心裂口:最高平均分 87.9 但最高 Pass Rate 仅 20.6%,分析化学 87.6 分对应 4% 完成率、电化学 94.9 分对应 0%;非通过 Claude Code 轨迹中 75.5% 结尾仍声称「已完成」——高分与自信声明都不是交付成功的可靠信号。

August 27, 2026 · 4 min

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents 精读

深度精读腾讯微信团队(26 Aug 2026)论文 IAPO:多轮服务 Agent 训练中,最终奖励无法指出哪些中间动作真正立功。IAPO 把每条已完成轨迹表示为带符号的影响依赖图(支持使用边/失败使用边),用「信息被下游实际消费」「错误可观测传播」两路证据重新路由轨迹级优势,不改奖励、采样与损失实现,在 τ²-Bench 上把 Qwen3-8B 从 29.61% 提到 42.18%(+12.57pp),电信域增益最大达 +18.19pp,且不伤函数调用能力。本文解析其「写即所用」的证据三条件、符号条件路由机制与三条数学保证。

August 27, 2026 · 5 min

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution 精读

Agent 的能力从来不只取决于模型权重,还取决于包裹模型的执行脚手架(harness)。LV-NUS Lab 提出 JIT-Agent,训练一个 27B 的「harness 智能模型」,在推理时为任意现成 agentic LLM 即时合成任务自适应的 harness,并能修复与在线演化。DeepSeek-V4-Flash 配上它即可在 DeepSearchQA 反超 GPT-5.6 达 9.1 分,同时成本比所有固定 harness 平均低 36%。本精读拆解其四模块 harness 协议、三阶段训练流水线与 Evo-GDPO 目标,并解释「按任务实例即时生成脚手架」为什么在机制上必然优于单一固定脚手架。

August 27, 2026 · 4 min

Joint Optimization of Tool Creation and Use for Large Language Model Agents(SMITH)精读

深度精读 Appier AI Research + 台湾大学(25 Aug 2026)论文 SMITH:现有工具创建系统让强模型写工具、弱模型用工具,写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用:use 任务只给 JSON schema,接口写得烂必然调用失败,形成「写即所用」闭环;三条独立奖励轴分离 schema/代码/结果失败;easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架,平均输出仅 100 token(比 CoT 少 32 倍),其工具还能让 350M 小模型追平 30B 写的工具。

August 27, 2026 · 6 min

Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory 精读

深度精读中国科大 HiPS 论文:把记忆增强 agent 的记忆管理策略分解为「全局共享层 + 用户专属增量层」,用分歧门控决定谁需要个性化、跨层规则流动动态校准边界、反循环奖励分离阻断自我验证——12 个评测设置全部 SOTA,并发现域内靠通用规则、域外靠个性化机制的「组件重要性翻转」现象。

August 27, 2026 · 3 min

Meta^n: Recursive Self-Improvement through Emergent Depth 精读

Meta^n(明尼苏达大学 × 首尔国立大学)针对自我改进系统『实现元深度只有约 2』的天花板,提出固定元操作 Ω 对自身输入递归:Ω 读下层栈的全任务执行轨迹+产生它们的代码栈,写出下一层(策略性预处理器+可调用辅助函数库),深度由收敛决定而非预先设定,进化档案在层链空间搜索。8 个基准族 × 2 骨干上至少一个估计器全面领先先前自改进 agent,ARC-AGI-2 held-out 上唯一非零(0.331 vs OpenEvolve 0.003);消融显示递归本身贡献 +0.131,其中层间条件化占约 72%;深度角色自发涌现——回滚角色在深度 2 恰为零、深度 3 出现 55%。

August 27, 2026 · 3 min

Narcissus: Program Synthesis Using Context-Aware LLM Approximations 精读

代尔夫特理工大学团队提出 Narcissus:当任务固定目标语言(CFG 定义的 DSL)时,LLM 提案通常违反语法或不满足规格——与其反复重提示,不如把提案一次性编译成「上下文感知」的搜索启发式。它将提案解析修复为语法树,用前缀对齐(相同上下文的提案是否用了同一规则)、子程序复用(提案反复出现的片段)与正则化(提案指示的程序规模+保底项)三个信号给每次扩展打分,搜索期间零 LLM 调用。在五个域、两种搜索后端上,Narcissus 在每个预算下击败静态先验:SLIA-70 上 51.4 对 32.2,ARC-100 上解决 40% 而原始提案仅 13%,到达提案区域快约 12 倍;DeepSeek 弱提案加搜索甚至超过 GPT-4o 直接采样。正则化保底项保证任何规则不被剪枝——错误提案只会延迟解、不会藏死解。

August 27, 2026 · 4 min