HackProbe: 自进化语言模型的奖励黑客检测与免疫 精读
Fullive-AI×北大×京东×NTU×武大的 HackProbe 是一个通过两个黑盒钩子挂载到任意自进化回路的监控器:秘密固定分布对比核心保证跨代可比,轮换新鲜层抗共适应;四项检验+Šidak 校正输出族校准 p 值,风险感知免疫层从候选池重选诚实更新。本文精读’诊断之外还能恢复’的奖励黑客治理闭环。
Fullive-AI×北大×京东×NTU×武大的 HackProbe 是一个通过两个黑盒钩子挂载到任意自进化回路的监控器:秘密固定分布对比核心保证跨代可比,轮换新鲜层抗共适应;四项检验+Šidak 校正输出族校准 p 值,风险感知免疫层从候选池重选诚实更新。本文精读’诊断之外还能恢复’的奖励黑客治理闭环。
AllSpark 团队发布 Iris-mini/pro 两个开源搜索智能体(35B-A3B 与 397B-A17B):从网页超链接实体图反向构造多跳任务,把非答案实体改写为描述性引用以杜绝字符串匹配作弊;提出 SFT-RL climbing 交替训练——每轮 RL 把最难与最高效轨迹回流进下一轮 SFT。BrowseComp 88.6 / HLE 56.4,同参数段开源最强。本文精读其’不可作弊任务合成’与’爬坡式两阶段循环’的完整配方。
RISE 从模型自身 RLVR 训练轨迹外推合成教师:以当前检查点与滑动锚点的位移放大(β>1)构造未来教师,在 logit 或权重空间实现,教师随学生每轮刷新。OLMo3-7B AIME'24 从 30.2 提至 46.9(+16.7),ALFWorld +9.4、WebShop +10.9 vs GRPO,OOD 不降反升。本文精读’教师从哪来’这一 OPD 根本问题的第一性解法及其递归改进机制。
TROVE 把智能体编排的结构决策从’执行前锁定’改为’运行时最小充分编辑’:离线把工作流搜索轨迹蒸馏为原子/复合技能+结果条件转移图,在线对挂起路线执行保留/插入/替换失效后缀三操作。代码生成、QA、数学推理上质量-效率权衡全面优于 AFlow/MaAS/LAS。本文精读’route 即临时品’的编排新原则。
自主 LLM 后训练系统不断积累’过去什么更新有效’的经验,但父模型一旦变化,旧经验就可能是毒药。本文把这一困境形式化为条件经验迁移问题,提出 BCIT:把效果绑定到源上下文、更新前检查适用性、具名硬冲突否决、必要时小预算试验取证。等预算对比中 BCIT 更少授权有害更新、最终模型质量更高,为自进化 Agent 补上’免疫排异’机制。
DRACO(IBM×CMU)形式化’outcome-blind’训练设定——长程 Agent 任务往往没有程序化验证器可依赖。方法用训练中动态生成的 rubric 逐轨迹打一次分,再按’步骤涉及哪些标准’闭式分摊到每步 GRPO advantage,不引入任何可学习归因模块。AppWorld TN 上 Qwen3.6-27B TGC/SGC 69.4/41.1→85.3/70.6,反超偷看真值奖励的 GRPO +5.3/+11.3,τ-bench 零样本迁移 SR 15.8→20.4。
Google DeepMind 在 100 个自主 LLM Agent 组成的研究蜂群中,完整观测到一次评测漏洞的涌现—病毒式传播—集体对抗全过程:作弊 Agent 在竞争压力下合理化采纳漏洞,诚实 Agent 则自发组织审计、抵制与公开吹哨。论文把多 Agent 安全重新框定为 Ostrom 意义上的’知识公地治理’问题。本文基于全文阅读拆解其通信原语、行为时间线与制度设计启示。
现有 LLM 自进化研究都从人类定义好的显式任务出发,agent 只搜索’怎么优化’;但人类学习往往始于’成为更好的物理学家’这样的模糊目标。ByteDance Seed 联合 SUTD、M-A-P 等发布 Aspire 基准:只给一句自然语言能力目标,评测集对 agent 完全隐藏,agent 必须自己决定优化什么、怎么训练、如何验证。实验给出罕见的机制级阴性结果——24 次 final-only 运行仅 1 次超过基线分,最佳进化 harness 仍低于人工 Qwen-Agent。本精读拆解隐藏评测设计、三条研究问题(RQ1-RQ3)的实验逻辑,以及’代理增益不迁移’这一失败模式的根源。
自主 ML 研究 agent 缺的不是更强的模型或更聪明的流程,而是’怎么把方法跑通’的操作知识层。BAAI 联合中科大、人大、港理工提出 DisCo 蒸馏框架,把 1000 个 GitHub 仓库蒸馏成 5353 个经过验证的技能,构建 AREX-Skill Library。在固定 GPT-5.5+Codex 的对照实验下,技能让 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,并以更低 token 消耗帕累托支配 Claude Code。本精读拆解技能图三层结构、四阶段蒸馏流水线、对照实验设计,以及’试错成本越高、操作知识价值越大’的机制根源。
Agent 每天与环境交互积累海量轨迹,但经验真的变成了能力吗?ByteDance Seed 姊篇基准 S3Gym 把’自改进’拆成自测试、自判断、自改进三个可测环节,在 7 个可执行验证的文本游戏上比较三种经验注入通路:原始历史 ICL、摘要记忆、参数训练。7 个前沿模型的核心发现:自改进既不自动也不均匀——GPT-5.5 在 PvZ 上 History ICL 的 AUC⁺ 高达 548.5,换摘要记忆暴跌到 33.2;同一模型同一环境换个通路结果天差地别。本精读拆解宽松探索/严格评测的分离设计、自评分与环境真值的对照记录,以及’经验压缩可行性决定通路优劣’的机制规律。