JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution 精读

Agent 的能力从来不只取决于模型权重,还取决于包裹模型的执行脚手架(harness)。LV-NUS Lab 提出 JIT-Agent,训练一个 27B 的「harness 智能模型」,在推理时为任意现成 agentic LLM 即时合成任务自适应的 harness,并能修复与在线演化。DeepSeek-V4-Flash 配上它即可在 DeepSearchQA 反超 GPT-5.6 达 9.1 分,同时成本比所有固定 harness 平均低 36%。本精读拆解其四模块 harness 协议、三阶段训练流水线与 Evo-GDPO 目标,并解释「按任务实例即时生成脚手架」为什么在机制上必然优于单一固定脚手架。

August 27, 2026 · 4 min

Joint Optimization of Tool Creation and Use for Large Language Model Agents(SMITH)精读

深度精读 Appier AI Research + 台湾大学(25 Aug 2026)论文 SMITH:现有工具创建系统让强模型写工具、弱模型用工具,写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用:use 任务只给 JSON schema,接口写得烂必然调用失败,形成「写即所用」闭环;三条独立奖励轴分离 schema/代码/结果失败;easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架,平均输出仅 100 token(比 CoT 少 32 倍),其工具还能让 350M 小模型追平 30B 写的工具。

August 27, 2026 · 6 min

Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory 精读

深度精读中国科大 HiPS 论文:把记忆增强 agent 的记忆管理策略分解为「全局共享层 + 用户专属增量层」,用分歧门控决定谁需要个性化、跨层规则流动动态校准边界、反循环奖励分离阻断自我验证——12 个评测设置全部 SOTA,并发现域内靠通用规则、域外靠个性化机制的「组件重要性翻转」现象。

August 27, 2026 · 3 min

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization 精读

大连理工牵头、联合牛津等七校提出 MA-VLA:面向多机械臂协作的组合泛化——测试时协作模式(角色/顺序/交互结构)训练中未见过,但原子动作全在分布内。方法三件套:VLM Planner 把高层指令分解为按时序的原子 prompt 分配到各臂、Pi0 执行器统一推断全臂动作、训练期 Arm Shuffle 置换各臂四元组打破身份绑定。OOD 协作中 Pi0/DP 基线全部归零,MA-VLA 达 13.0%;真机 SO101 上从全 0 到 10/20。「原子动作+角色洗牌」让语言成为主动协调通道。

August 27, 2026 · 3 min

MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation 精读

对话式 LLM 的记忆系统一直用“直接问答“评测:问模型能否回忆先前对话里的事实 X。京都大学团队做了 4 个月真实部署(40 用户、1872 会话、7 种记忆条件)检验这个假设——Direct QA 准确率随容量从 19.7% 涨到 70.1%,用户满意度却纹丝不动。他们从中检出 72 个用户主动引用记忆的真实时刻,构建 MEMUSE 基准,用“自然整合“(回复是否真正织入被引用的记忆)替代召回评测:同一模型同一上下文,Direct QA 78.8% vs 自然整合仅 7.9%,71 分鸿沟;且只有自然整合与满意度相关(ρ=+0.29),Direct QA 完全不相关。Two-step 消融把瓶颈定位于对话生成层而非检索层——即使提取步骤已给出正确细节,生成仍有 77% 不使用。

August 27, 2026 · 3 min

Meta^n: Recursive Self-Improvement through Emergent Depth 精读

Meta^n(明尼苏达大学 × 首尔国立大学)针对自我改进系统『实现元深度只有约 2』的天花板,提出固定元操作 Ω 对自身输入递归:Ω 读下层栈的全任务执行轨迹+产生它们的代码栈,写出下一层(策略性预处理器+可调用辅助函数库),深度由收敛决定而非预先设定,进化档案在层链空间搜索。8 个基准族 × 2 骨干上至少一个估计器全面领先先前自改进 agent,ARC-AGI-2 held-out 上唯一非零(0.331 vs OpenEvolve 0.003);消融显示递归本身贡献 +0.131,其中层间条件化占约 72%;深度角色自发涌现——回滚角色在深度 2 恰为零、深度 3 出现 55%。

August 27, 2026 · 3 min

Narcissus: Program Synthesis Using Context-Aware LLM Approximations 精读

代尔夫特理工大学团队提出 Narcissus:当任务固定目标语言(CFG 定义的 DSL)时,LLM 提案通常违反语法或不满足规格——与其反复重提示,不如把提案一次性编译成「上下文感知」的搜索启发式。它将提案解析修复为语法树,用前缀对齐(相同上下文的提案是否用了同一规则)、子程序复用(提案反复出现的片段)与正则化(提案指示的程序规模+保底项)三个信号给每次扩展打分,搜索期间零 LLM 调用。在五个域、两种搜索后端上,Narcissus 在每个预算下击败静态先验:SLIA-70 上 51.4 对 32.2,ARC-100 上解决 40% 而原始提案仅 13%,到达提案区域快约 12 倍;DeepSeek 弱提案加搜索甚至超过 GPT-4o 直接采样。正则化保底项保证任何规则不被剪枝——错误提案只会延迟解、不会藏死解。

August 27, 2026 · 4 min

Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读

深度精读 NUS+UCL+KCL+港科大广州(25 Aug 2026)论文 Ockhamareto:用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」,单次生成 2.60 个测试拿下 49.9% 突变分数,比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试,4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。

August 27, 2026 · 6 min

On-policy Distillation with Verifiable Reward 精读

清华LeapLab提出的OPDVR用一道极简的ReLU门,把On-policy蒸馏的隐式奖励按轨迹正确性重新定号,使蒸馏信号永远不与验证器方向打架。理论上证明OPDVR恰好等于OPD去掉与验证器冲突的梯度分量,实验上同架构蒸馏6个数学基准平均49.1超过OPD的47.8,甚至反超教师;GRPD变体在AIME25上比GRPO高出10.9分。本文从RLVR与OPD互补困境讲起,逐层拆解门控机制的数学构造、约半数token被门控的动态证据与逆向门控消融的因果链。

August 27, 2026 · 2 min

Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读

清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈:自回归解码把整条推理链串行执行,难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行(AND分支,分而治之)与Trial并行(OR分支,多路试探),并测量发现Trial并行占了可并行推理计算的多数(DeepSeek-V4在HLE上65.5%),而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构,配合PA-GRPO多目标奖励(正确性+关键路径延迟+两类并行比例)训练,经SGLang真实执行。AIME24/25等基准上平均加速约1.7×,8k token延迟预算下用25%预算匹配全额性能。

August 27, 2026 · 2 min