VP-Control 精读:Agent 提交门的“证据血统比模型多样性重要 3.6 倍”
WashU+SMU 发布 VP-Control:Agentic AI 提交门的代价感知验证组合设计。2880 场景确定性基准+2×2 因子实验证明:共享证据的跨模型投票批准 62.9% 不安全提案,独立证据源仅 22.9%——源效应 40.9pp vs 模型效应 11.3pp。共模数据失效让“多模型投票”这一直觉失效,组合控制器以部署可观测元数据实现 1.9% 不安全执行。
WashU+SMU 发布 VP-Control:Agentic AI 提交门的代价感知验证组合设计。2880 场景确定性基准+2×2 因子实验证明:共享证据的跨模型投票批准 62.9% 不安全提案,独立证据源仅 22.9%——源效应 40.9pp vs 模型效应 11.3pp。共模数据失效让“多模型投票”这一直觉失效,组合控制器以部署可观测元数据实现 1.9% 不安全执行。
Manulife(加拿大金融集团)实证研究:Agent 技能检索器用合成任务微调后,最激进配置下 OOD recall 从 0.850 跌至 0.650(−20pp);合成数据使 Hit@10 持平但 Recall@10 −0.021——部分重排把额外正确技能挤出 top-10。同时证明 0.6B 紧凑检索器可追平更大混合系统:监督质量>模型规模。skill 数据飞轮假设的第一份系统性反例。
数据日 2026-09-11 两篇流程自动化论文合读:Meta 的 Auto-RecSys 把自主研究 Agent 部署到工业级推荐系统(分布式异步执行+集中记忆+认知-程序分离三大 harness 设计);Yale×芝大×腾讯的 ActReview 用 rebuttal 对齐数据+rubric 奖励训练同行评审生成模型(ActReview-40K 训练集+1,000 例人策基准)。
AgentGrad 对多智能体系统提示优化做出两个机制修正:梯度提取阶段用序贯干预(每次只改一个 agent 的行为)因果定位’改谁才能解决失败’,并把修改后输出作为 agent 级监督提取细粒度梯度;聚合阶段用语义聚类把相似梯度归簇、抽象出共享纠错模式的泛化梯度。五个 MAS 基准上 GPT-5-mini 平均 +11.76 分、Qwen3-8B +9.67 分,墙钟时间较最快基线缩短 2.5×,HotpotQA 上 1000 次 rollout 达到 GEPA 6000+ 次的水平。本文精读其因果消融式归因与梯度降噪机制为何同时带来效果与效率。
Google 的这篇论文问了一个极简的问题:agent 能否通过’写优化器代码并评估’的可执行实践学会一个搜索策略,然后把这个策略蒸馏成一段文本、迁移给从未见过这段实践的其他模型?答案是肯定的——自博弈产出的 197 词文本 harness(Harness A)使 Gemini Flash 在黑盒优化上 regret 降低 48%(N=30,p<.001),同一文本让所有受测 Gemini 执行器与 Claude Sonnet 都改善(regret -43%~-49%),独立复现的 Harness B 性能同档。‘语言是部署搜索策略的便携介质’——harness 自动生成从进化搜索走向了实践蒸馏。
UMass Amherst 的这篇论文利用 LLM 内部表征预测智能体任务成败:Latent Trajectory Dynamics(LTD)总结交互轨迹上残差流表征的变化动态,Action Representation Probe(ARP)在动作决策点读取表征预测成功。在 InterCode 的 Bash/SQL/Python 三个交互基准 × Qwen-14B/Qwen-7B/DeepSeek-6.7B 三个模型家族上,两方法全面超越表层 token 概率与序列校准基线(漏损泄漏的交叉验证协议),且零额外开销——不改提示、不需多样本 rollout。智能体安全关键应用第一次有了’从模型内部读出置信度’的免费监视器。
Programmable World Model(PWM)把视频世界模型拆成两层:agent 把自然语言编译为可执行程序(实体状态+转移规则),轻量引擎执行程序维护显式持久全局状态(含屏外实体与非视觉属性);状态经增广 3D OBB 中间表示+相机轨迹确定性编译为像素对齐条件信号,驱动预训练视频模型当生成渲染器。自建 CombatStateBench 上 Count Accuracy 94%(超 LingBot-World-V2 达 53.25 分)、State Accuracy 98%(超 90 分),支持连贯长时程生成。本文精读’符号引擎管规则、生成模型管外观’的解耦架构为何系统性消灭状态漂移。
语义梯度提示优化(SGPO)让 harness 能用执行反馈自动进化,但其局部更新规则把’这轮该改哪里、怎么改’留给运气——搜索空间悬空导致补丁无效率高、进化易破坏已有能力。武大×快手的 RobustSGPO 给出三步控制:显式指定本轮编辑(choose what to change)、构造并检查补丁(construct & check)、从现任或保留快照继续(防劣化回滚),配合周期性 1→2→3 权限调度。在快手 AgentX 头脑风暴工作流上(120 任务/95 运行/7350 候选),held-out 完成率 60.0%→80.0%、测试质量 3.77→4.14,结构化搜索补丁有效率 77.8% vs 48.9%。
Show-Harness 用一组离散语义动作单元(单步方向移动+夹爪动作)作为 VLM 与任意机器人本体之间的唯一接口:VLM 在语义空间推理意图,本体专属解释器把语义动作确定性落地为局部控制,VLM 始终对细粒度物理决策负责。同一接口实现零样本解锁前沿闭源 VLM(ZS 60%→82%)与几 GPU 小时微调小模型(FT 40%→65%),GUMI GUI 接口让人类与智能体用同一套语义动作采数据。本文精读其 perceive-reason-act 插件体系、语义-物理解耦机制与为何它能在跨任务/跨本体/跨环境全面超越 VLA 与智能体基线。
Agent skill(技能包=指令+脚本+资源的多文件包)的主流执行方式是把指令载入主上下文让 agent 遵循;本文系统对照另一种方式——把技能包作为 subagent 在隔离的全新上下文窗口中调用。在 SkillsBench 长程任务上的结论:当技能包有明确输入输出契约、指令编码了履约所需过程知识时,subagent 执行稳定胜出,且随干扰技能增多退化更平缓;代价是主-sub 协调的额外 token。‘可复用知识的价值不仅取决于内容,也取决于组织与调用方式’——这是 skill 工程从’写什么’转向’怎么调’的第一份系统证据。