Inducing Task Models from Computer-Use Traces 精读

本文精读斯坦福与CMU合作的论文《Inducing Task Models from Computer-Use Traces》(arXiv 2608.20319)。日常电脑录屏与鼠标键盘事件流中沉淀着大量从未文档化的工作知识,论文提出TMI方法:先把低层事件接地为语义活动,再把多线程交织的活动流拆解为潜在任务,最后为每个任务调和生成配对目标层次与控制流的符号化任务模型。在真实人类工作会话上,TMI以0.974的ARI还原交织任务,步骤描述准确率74.9%远超最强基线30.3%;用任务模型生成Agent技能可使held-out准确率相对提升30%。

August 24, 2026 · 3 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

浙江大学联合新加坡国立大学、东北大学、Heriot-Watt 大学与腾讯提出 MemTrapBench,首次系统评测记忆诱发的认知陷阱:忠实记录且语义相关的记忆,仍可能扭曲大模型的推理与信念,使表现跌破无记忆水平。基准按植入陷阱、噪声掩埋、触发陷阱三阶段生成 1050 个多轮对话实例,覆盖认知偏差、任务边界、创伤、安全四类场景;五个主流记忆框架在 Gemini 与 Qwen 上全部落后无记忆基线逾 10 个百分点,创伤场景去陷阱对照的正确性从 66.40% 回升至 91.07%,证明退化源于陷阱语义而非上下文长度。论文进一步提出推理时提示技能 AdaptiveMem,把是否该用记忆显式化为决策前的静默校验,最高提升 14.9 个百分点且不损害常规记忆基准表现。

August 24, 2026 · 4 min

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation 精读

为什么最强的编码 Agent 一进专业仓库就失灵?北京大学团队把根因锁定在「隐性知识」——那些只存在于开发者脑中、从不写进文档的业务规则、接口契约与操作约定。它们潜伏在开发实践之下、沿代码依赖图分散传播、且 Agent 根本不知道自己缺什么,三重性质让一切检索式方案天然失效。PRAXIS 给出四阶段闭环:让 Agent 在目标仓库里真实写代码暴露行为差异、蒸馏为带触发条件的结构化四元组、锚定到依赖图上双向传播与去重仲裁、并在任务初始化与工具交互时主动注入,支持在线演化。KoCo-Bench 四域平均 Pass@1 达 32.06%,较次优基线相对提升 16.7%,且随实践积累持续上涨。

August 24, 2026 · 5 min

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance 精读

深度精读 HKUST、HKBU 与 NTU 合作的 arXiv 2026 论文 ReguSim。论文构建可执行金融合规交易环境与 ReguBench 监控基准,将陈述推理、尝试动作、执行强制与监控证据四类工件分离审计,发现规则全文可见时 DeepSeek V4 Pro 仍有 24.2% 订单被拒,简单结构化基线反超最强 LLM 监控器,交易者自辩还会把独立监控者的误接受率从 25.0% 推高到 46.9%。

August 24, 2026 · 5 min

Repo0: Design-Driven Zero-to-All Code Generation 精读

上海交通大学(7 人主导)联合重庆大学的论文 Repo0 聚焦『从零到整仓』代码生成:仅凭自然语言需求从零构建整个软件仓库,必须同时推断功能与架构。核心创新是把一次性静态图规划改造成连续结构演化——维护『需求级 DAG+组件级 DAG+多对多对齐』的 Dual-DAG 架构状态,用内聚度低于 2/3 触发拆分、耦合度(Jaccard)高于 0.7 触发合并、图割提供拆分证据,迭代至结构收敛后再进入 TDD 代码生成。在 RepoCraft 六仓库、GPT-5 mini 与 DeepSeek V3.2 双骨干的全部设置下均取得最高功能覆盖率与通过率,requests 覆盖率达 100%,较最强基线 RPG 覆盖率最高提升 20.08 个百分点、通过率最高提升 29.74 个百分点;消融证明结构演化、双图分离与依赖序生成缺一不可。

August 24, 2026 · 4 min

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning 精读

深度精读厦门大学与南洋理工大学 2026 年 8 月论文 SAPO:面向多轮 Agent 的强化学习后训练,让策略、状态价值与动作价值共享同一个自回归主干,在动作前后的两个因果边界分别读出 V 与 Q,以两个保留词元的 logit 差经裁剪映射为有界标量并从动作分布中剔除;配合单次 rollout 的轨迹级 GAE 与批归一化轮级优势,一次反向传播统一更新。在 ALFWorld 与 WebShop 上以 Qwen2.5-1.5B/7B 训练,平均超越 PPO 与 GRPO 15.1 与 12.1 个百分点,单轮迭代运行时缩短 33.2%,并彻底消除独立 critic 的显存开销。

August 24, 2026 · 5 min

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC、KUKA、上海交大与浙大合作的SemaPLC提出验证门控的agent harness:生成逻辑必须嵌入既有工业PLC项目、通过编译,并在真实运行时与金轨迹比对正确才算完成。凭借仅日志确认的检查可判定完成、编辑使旧判定失效、每检查限两次重试三条完成纪律,它在117任务功能轨上七模型全部夺魁(均值72.6%),在65任务项目轨上动态行为分达52.2,远超基线的22.4~31.4。层消融揭示:静态分相近的方法在运行时剧烈分层——执行才是检验控制逻辑的忠实标尺。

August 24, 2026 · 3 min

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学联合小红书提出 SkillGate,解决长程 Agent 在 episode 中途该读哪个技能文件的训练难题。论文先诊断出 outcome-only RL 失效的结构性根源——selector credit starvation:技能命名 token 仅占轨迹损失的中位 0.14%,随轨迹变长稀释约 7 倍,且近五分之二的正确选择因后续执行失败收到错误负号的信用,而该决策本身价值 +11.2 个百分点。SkillGate 将同一 GRPO 更新的 token 支持划分为构造上不相交的双 credit 通道:任务通道只把组归一结果优势广播到执行 token,整段 read call 从损失掩码删除;选择通道把单次读取且为 oracle 才计 1 的 action-local 效用做组中心化后仅落在身份 token,等权归一使选择权重与轨迹长度无关。5 个基准 385-trial 协议下,9B 模型从 SFT 的 40.8% 升至 53.2%,超同预算 outcome-only RL 6.2 个百分点,oracle 读取率 54.3% 升至 83.9%,误导暴露降约三分之二且读得更少。

August 24, 2026 · 5 min

SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

SPADE 由九所高校联合提出,让单一 LLM 在自我对弈中同时扮演 Environment Designer 与 Reasoning Agent 两个角色:前者以 Python 代码生成带 reset/step 接口的完整可执行 MDP 训练环境与特权提示,后者解题学习。Designer 的奖励是提示前后的回报差(hint-based regret),能持续瞄准学习前沿,配合预训练语料接地与环境记忆防止坍缩。30B 模型在 8 个 held-out 基准平均 58.3(较 base +8.1),工具使用基准 ACEBench-Agent +13.9,验证了环境设计本身可学习这一迈向开放式自提升的关键一步。

August 24, 2026 · 5 min

两天十万Star:DeepSeek Harness 的开放逻辑,与它想要驯服的模型-脚手架-算力飞轮

围绕 DeepSeek Harness 发布后两天破十万 Star 的现象,三位从业者从「一切皆插件」的架构设计、模型与 Harness 的深度协同、极简模式与缓存命中率的技术原理,聊到程序员岗位转型、开源生态与国产算力差距。核心判断:Harness 是 AI 时代的脚手架,插件化+开源让社区共建成本降到极低,模型与脚手架会互相塑造,而程序员的护城河正从写代码转向定义需求与验收结果。

August 24, 2026 · 2 min