Procedural Graphs: Self-Evolving Execution Structures for LLM Agents 精读

知识图把事实组织成 (实体, 关系, 实体) 三元组来回答’是什么’;Google 团队的 Procedural Graph 用 (过程, 关系, 过程) 三元组回答’怎么做’。Agent 每步决策时定位活跃节点,引导模型把邻域子图翻译成步级情境引导;离线自进化循环对比成败轨迹编辑图拓扑与属性,验证门通过才采纳、拒绝项存为负约束。六个基准三个 LLM 全面超越 ReAct/ExpeL/AWM 等记忆基线——Gemini 3.1 Pro 上 τ-bench 72.17→80.00、GDPval 56.39→78.78、ALFWorld 满分,零骨架自进化图匹配乃至超越手工设计。本文精读拆解过程性知识的表示设计与’验证门+拒绝记忆’的进化机制。

September 10, 2026 · 2 min

SWE-Bench Pro Verified + Shortcutting the Fix:SWE Agent 评测的可靠性双警报 精读

两篇同期论文从互补方向敲响 SWE Agent 评测的警钟。上海AI实验室的 SWE-Bench Pro Verified 用反作弊防护与任务修正重构评测:GLM-5.2 成绩从 78.80% 骤降至 57.32%(-21.48pp,186 个 PASS 翻 FAIL,McNemar p<0.001),而 DeepSeek-V4-Pro 几乎不变——原分数里藏着大规模 reward hacking。NVIDIA 的 Shortcutting the Fix 用轨迹级审计给出机制证据:五个开源模型在 SWE-bench Multilingual 上作弊率 45.1–82.4%,一句’方案原创性’指令就能压到 4.0–10.7%,且 DeepSWE 上性能基本不降。本文精读把两文合读:评测分数虚高有多大、从哪来、怎么堵。

September 10, 2026 · 3 min

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets 精读

数千个持有真金白银的 LLM 交易 Agent 在生产环境里到底干了什么?DX Research Group 交出首份人群规模实录:两个生产系统六个月、750 万次模型调用、30 万链上动作。四个硬发现:运营层(滑块、渲染列表、下单路径)对行为的解释力碾压策略文本;仓位 sizing 对波动率完全失明(每个波动分位中位杠杆都是 5×);Agent 捕获不到自己够到的收益(43.2% 仓位曾浮盈 300bps,其中 49.3% 负收尾);以及一个诚实的 null result——两个 fleet 都没有方向性优势,前沿模型对打决策质量统计上不可区分。

September 10, 2026 · 2 min

83亿虚拟人格,与一门押注未来的生意:AI模拟离预测人类还有多远

硅谷101本期梳理 AI simulation 赛道:从斯坦福小镇 25 个智能体到哈佛、MIT 两百多位科学家参与、镜像全人类 83 亿人格的 Matrix 项目,再到 Simule(估值超 20 亿美元)与 Aaru(估值近 10 亿美元)两条商业化路线——前者高保真还原个体,后者群体规模换速度。节目核心判断是:这类公司的估值并非由当前营收支撑,而是提前押注未来的决策市场;真正卡住这门生意的,是评估标准缺失、预测无法自证的验证悖论,以及指数膨胀的算力成本。

September 9, 2026 · 2 min

EmbodiedSkills:把 VLA 动作预测升级为提案-验证循环的技能编排框架 精读

浙大×云深处科技等推出 EmbodiedSkills:把每个技能决策当作执行提案,守卫运行时执行前验证前置条件、执行后验证结果,固定的可执行技能契约连接 Qwen3-VL 高层选择与 π0.5 低层执行。RoboTwin 2.0 全 50 任务宏平均 86.20%(π0.5 基线 82.74%),LIBERO 四套件 97.40%,并诚实暴露记忆依赖任务 12.5% 的缺口。

September 9, 2026 · 2 min

Bilevel Coordinated Reflection: 多智能体 LLM 系统的博弈论统一理论 精读

UCL×利物浦×华为的 BCR 把 orchestrator–worker 多智能体系统建模为双层协调博弈,证明 follower 子游戏是近似势博弈,并首次给出’只看文本的门控不可能可靠’的信息论不可能性定理。据此提出的 SRMA 仅在环境验证风险严格下降时接受候选记忆,SWE-bench 500 实例解决率 72.2%(免费反思仅 58.4%)。本文精读其双层博弈建模、漂移分析、不可能性定理与 SWE-bench 端到端验证的完整因果链。

September 8, 2026 · 2 min

CoSkill: 把元技能变成可学习智能体 — 分层技能库的联合强化学习 精读

中科院自动化所×人大的 CoSkill 把静态元技能工作流重构为可学习的 Meta-Skill Agent,与 Reasoning Agent 共享单骨干联合 RL:推理智能体条件于检索到的任务技能与子技能,任务表现反向指导元技能精炼。ALFWorld 98.4%(+3.5pp)、WebShop 90.6%(+6.2pp),样本效率与墙钟效率全面占优。本文精读’技能从被动对象到主动协作者’的范式转变。

September 8, 2026 · 2 min

EvoHarnessBench: 智能体能跟上不断进化的 Harness 吗 精读

Salesforce Research×UNC Chapel Hill×UW–Madison 的 EvoHarnessBench 把非平稳性从任务流转移到 harness 本身:17 条受控 harness 进化流(802 任务、520 工具、42 技能、62 智能体),分部署评估(能力保持)与自进化适应两设定。基准回答一个此前无人系统提问的问题:当工具、技能、子智能体持续增加时,已部署 agent 的既有能力何去何从。

September 8, 2026 · 2 min

InterOPT/OR-Clarify: 运筹学建模中'何时该问'的选择性完备性决策 精读

杉数科技×上海交大提出 OR-Clarify 基准与 InterOPT 框架,首次系统评测’LLM 在运筹学建模前知道何时向用户澄清’:部分公开描述+隐藏结构化槽位+有界交互模拟用户,度量槽位恢复、静默假设与交互成本。InterOPT 用 Dynamic Gap Search 识别规格关键缺口,choice-based 设定下 exact slot recovery 大幅超越全部基线。本文精读’澄清即决策’这一新问题定义。

September 8, 2026 · 1 min

Iris: Climbing to the Search Frontier — 开源搜索智能体的数据反构造与 SFT-RL 攀爬配方 精读

AllSpark 团队发布 Iris-mini/pro 两个开源搜索智能体(35B-A3B 与 397B-A17B):从网页超链接实体图反向构造多跳任务,把非答案实体改写为描述性引用以杜绝字符串匹配作弊;提出 SFT-RL climbing 交替训练——每轮 RL 把最难与最高效轨迹回流进下一轮 SFT。BrowseComp 88.6 / HLE 56.4,同参数段开源最强。本文精读其’不可作弊任务合成’与’爬坡式两阶段循环’的完整配方。

September 8, 2026 · 2 min