J-Zero: Unified Challenger-Solver-Judge Co-Evolution from Zero Data 精读

自进化大模型在可验证领域已有成熟方案,但在没有标准答案的开放域,学习信号只能来自打分模型,而固定的Judge只能把Solver推到自己内化偏好的上限,饱和后奖励失去区分度。J-Zero让Challenger、Solver、Judge三者零数据共同进化:出题者与解题者通过GRPO对抗博弈,Judge依靠角色不对称与子任务放大两类结构性偏好对做Bradley-Terry更新,标签由构造方式先验决定而非Judge打分,避免自我强化偏差。Qwen3-4B上可验证域提升9.47分、不可验证域提升11.23分,超越R-Zero 4.74分,并持续改进十个迭代而baseline两迭代后退化。本文按九部分结构精读其动机、机制、实验证据与可迁移灵感。

August 29, 2026 · 7 min

ProofEvolve: Neuro-Symbolic Evolution for Formal Automated Theorem Proving 精读

神经定理证明器一直有个结构性缺陷:证明经验要么锁在模型参数里、要再训练一轮才能影响后续问题,要么只在当前问题内共享,失败尝试中已验证的成果随搜索结束一起丢弃。UVA 与 Meta AI 的 ProofEvolve 把定理证明变成一场显式符号结构的进化:固定权重的 LLM 提出分解、修复、schema 重组三类变异,Lean 4 内核验证每一步转换,verified closure 把二值成败变成分级适应度,已证明的子结构提取为持久 schema 库跨问题继承。三个竞赛级基准平均解决率 57.8%,超最强基线 LEAP 7.3 个点,最依赖多引理组装的 IMO 级基准提升最大达 16.6 个点。本文精读其进化机制设计与效果优势的因果链条。

August 29, 2026 · 5 min

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution 精读

LLM agent 正被部署进 Claude Code、Codex 等产品级执行环境,越狱的后果从生成有害文本升级为触发破坏性工具调用与持久状态更改。现有自动红队方法要么依赖固定攻击机制,要么按语义相似度检索整段攻击轨迹,存在检索偏差、工具贡献归因不清、上下文开销大三大痛点。RedEvoAgent 将跨案例攻击经验蒸馏为一份人类可读的攻击技能文档,靠工具效力画像、决定性工具归因与验证棘轮三个机制驱动技能进化。实验显示其在 ASB 上最高达到 100% 攻击成功率,超最强单工具最高 11.7 个百分点,AgentHarm 上 74.3 分远超 RedCodeAgent 的 37.5,同时把平均工具调用从 3.0 次降到 1.8 次,且技能可跨攻击者模型与执行 harness 零样本迁移。

August 29, 2026 · 6 min

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents 精读

Agent 的自我改进大多发生在一次任务结束之后——但那时这次运行已经救不回来了。AllSpark 团队的 PILOT 把自改进做成 live 的:监督者通过双向活通道在工作者执行中途重定向或中止(live steering),同时从活轨迹蒸馏可复用技能进持久 harness(live self-evolution),模型参数全程冻结。在 Terminal-Bench 2.0 上 PILOT 以 71.6 均分领先最强单 Agent 基线 5.3 个点;20 轮自改进迭代后 GLM-5.1 从 66.3 升至 80.9(+14.6pp),每任务输出 token 反降 42.9%。评测协议设计严谨:运行中零基准反馈,验证器只决定哪些更新进入下一轮。本文精读其监督者-工作者架构与两个中途纠偏案例。

August 28, 2026 · 4 min

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution 精读

Agent 从经验里学到的教训,往往散落在一次次的优化历史里,下次想用时已经找不到了。Google Research 与弗吉尼亚理工的 WikiSkill 在经验与技能之间加了一个持久知识层:不可变的原始轨迹层、持续复利的 wiki 知识层、可回滚的技能层,四组件循环让经验先编译成知识、知识再孕育技能。五个基准、五个模型上,WikiSkill 平均提升 12.3 到 23.9 个点,Qwen-3.5-9B 加技能后反超 27B 无技能模型。消融显示 wiki 层贡献 15 个点,而跨模型迁移实验揭示了技能发现与技能执行是两种可解耦的能力。本文精读其三层架构设计与知识编译机制。

August 28, 2026 · 3 min

Agentic Autoresearch for Cell-Edge Power Control 精读

深度精读 Ericsson + 多伦多大学论文:把学习型无线资源管理算法的全部五层设计权(架构/输入表示/输出参数化/损失函数/任务采样)交给自主 agent,在强 NP-hard 的多小区 SLqP 功率控制上,81 个无人值守实验、26 小时内达到最强已知基准的 99.5%、推理成本约 600 倍 lower,并精确恢复了经典 max-min 结构。

August 27, 2026 · 3 min

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment(Station v2)精读

Station v2(DualverseAI × 剑桥 × 港大 × UCSD)把 AI 数学发现从『固定管线里的工具』搬进开放世界多智能体环境:6 个跨模型家族的 agent 在无中央协调器的房间制生态里自选方向、跑实验、发论文积累共享文献。在 AlphaEvolve 目录 12 个构造类问题上 5 题产出相对既有文献新颖的结果——kissing 数 d=11 三个精确 604 点构型(两个为新等距类)、Erdős 最小重叠下界 0.37912→0.380552(闭合已发表区间约 82%)、有限域 Kakeya 新无穷族、离散 Kakeya 针 CT(128)≤0.107067、符号不确定性 0.3089;还独立重构 Jacobian 猜想反例。机制归因:高度自主使 agent 能直接追求不可打分的广义数学目标,评估耗时上限倒逼理论引导构造,46.4% 的亮点结果来自跨模型家族协作。

August 27, 2026 · 3 min

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization 精读

深度精读 KOPE 论文——香港城市大学与华为联合提出的硬件内核优化自进化 Agent 框架。在公共语料极度稀缺的昇腾 NPU 场景下,KOPE 用经验图记忆保留「决策-结果」证据链,配合预算化三层上下文注入,使模型参数完全冻结的前提下通过率达 84.6%(最强基线 57.8%),token 消耗反而下降 93%。本文从内核优化领域背景、经验记忆机制、主动上下文管理、双消融实验到 RISC-V 跨硬件迁移,完整拆解「经验复用为何在语料稀缺场景碾压模型能力」的因果链。

August 27, 2026 · 5 min

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 精读

开源模型能否拥有专业级网络安全能力?北航联合 ELLIS、IQuest Research 与新加坡管理大学发布 CyberFactory——一个把野外真实 CVE 工件转化为可执行、可验证训练监督的统一开源框架,覆盖 PoC 生成、漏洞修补、安全问答三任务。其核心是一条’可验证差分 oracle → 技能引导轨迹合成 → SFT 内化’的流水线:差分判定器(补丁前崩溃、补丁后不崩溃)使 agent 能无人监督地 propose-verify-refine;可复用’漏洞分析技能’改变教师模型的工作流(领域引导探索覆盖率 3.78%→99.85%);训练出的 OpenAegis(Qwen3.5-397B-A17B)在 CyberGym 上 Pass@1 达 58.1%,超基座 28.5 个百分点、超 1T 参数的 Kimi K2.7,且推理时不需要技能——工作流已被内化为模型参数。

August 27, 2026 · 4 min

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis 精读

微服务故障根因分析(RCA)自动化该往哪个方向使劲?这篇香港中文大学与字节跳动的论文先用 24 个受控实验给出反直觉结论:裸的通用编码 Agent(Codex/Claude Code)已经全面超过从零构建的专用 RCA Agent——但离生产可用还很远,缺的不是推理能力而是系统特定经验。答案不是重造 Agent,而是造一个能自我进化的外部 harness:OpsHarness 用四层知识与 idea-card 工具库做数据平面,用「挖掘-验证」双门进化循环做控制平面,Top-1 准确率 59.0%(较裸 Agent 相对提升 63.4%,是专用 Agent 的 4.02 倍),并在真实生产环境拿到约 3 倍提升、同一故障复发时从 Top-3 之外跃升 Top-1 且 2 分钟内定位。

August 27, 2026 · 4 min