EvoX Genesis:用持久递归世界让软件自主演化
深度精读 EvoX Genesis(arXiv 2608.10450):它把’持久化’从 agent 转移到项目,用持久递归世界在 120 小时、44 美元内从空仓库长出 25 万行 Rust C 编译器,跨模型替换保持测试全通过,并把 10 万行 Fortran MESA 重写为 9 万行 Rust 获得 1.55–6.87× 加速。
深度精读 EvoX Genesis(arXiv 2608.10450):它把’持久化’从 agent 转移到项目,用持久递归世界在 120 小时、44 美元内从空仓库长出 25 万行 Rust C 编译器,跨模型替换保持测试全通过,并把 10 万行 Fortran MESA 重写为 9 万行 Rust 获得 1.55–6.87× 加速。
深度精读 Spark-to-Paper(arXiv:2608.11924)——一个把研究论文生成做成 13 个可组合技能、预注册式实验规划、Self-Refutation Loop、6 个确定性门控、双路径可编辑图表的端到端系统。引用有效率 99.5%、图表可编辑性 96.4%、伪造检测 14%→92%、每篇 $8.1 / 3.2h / 11.9M token。
Agent安全从训练时对齐走向运行时合约范式;测试时强到弱Harness迁移改写蒸馏范式;端到端论文生成验证可组合技能可行性;自主软件进化围绕持久化项目而非持久化Agent组织——四大方向共同推进Agent可靠性与自进化机制的深度融合。产业端DeepSeek Harness开源、Gemini 3.7 Flash发布、GPT-5.6 Sol Ultrafast模式同日引爆AI编程工具价格战。
深度解读 SkillZip(arXiv 2608.05604):一个执行感知的程序性抽象框架,通过节级图表示、MotifZip 契约保持压缩、PathHydrate 预算内水合和 ReZip 增量维护四大组件,在 ALFWorld 上提升 12.2 分、SkillsBench 上提升 6.2 分,同时实现 3.46× 压缩比、99.2% 依赖保持和 98.7% 验证器可达性,并在 100K 技能库上保持 248.3ms 延迟的稳定检索。
深度精读 arXiv:2608.12036——浙江大学 ZJUNLP 提出的 Mechanist 是一个用 AI 研究AI的自主智能体系统。它构建了约13000篇可解释性论文的知识图谱、整合4300万篇跨26学科论文库、沉淀32种机制分析方法,形成「假设生成→因果干预→验证循环」的闭环。在复现16篇论文的可靠性评估中,比 Claude Code 高出9-13%、比 AI Scientist 高出31-38%。更重磅的是,它自主发现了跨模态安全风险转移(不安全响应率从20.3%飙升至48.6%)、提出了完整的信念机制理论,并成功将机制洞察转化为DNA序列引导生成(α-螺旋含量从43.8%提升至56.6%)。这是一篇关于「让AI成为研究AI的科学仪器」的里程碑式工作。
OpenART 是评估 Agent 在演化环境中安全性的大规模红队测试 Arena:覆盖 10,000+ 验证场景、50 个领域、500,000+ 工具/MCP/Skills,通过 15 个真实部署的 Agent × 5 个基础模型 = 75 个配置展开评测。其参考策略 EMHA(Evolutionary Markov Hypergraph Attack)以超图遍历、授权状态转移、档案引导演化为核心,在不更新任何参数的前提下取得 85.0% 的池化 Strict ASR。本文系统拆解其问题定义、EMHA 技术细节、8 个攻击向量、消融实验与三类反复出现的漏洞模式,并提炼出对 Agent 安全研究的可迁移方法论。
Agent自进化从单轨迹走向跨谱系比较进化,测试时强到弱能力迁移改写蒸馏范式,编程Agent指令遵循与技能安全性被首次系统量化,Grok 4.6与DeepSeek V4 Pro同日逼近Fable 5,Anthropic揭示多智能体系统三大系统性失效模式。
这篇来自华为与华中科技大学的 empirical study 首次系统地把 LLM Agent 的失败归因到「被加载的 Skill」上。作者借鉴差分测试思想,构建配对执行(有 Skill vs 无 Skill / 语义匹配 Skill),在 SkillsBench 与 SWE-Skills-Bench 上确认了 307 个技能诱导失败(125 功能失败 + 182 效率回归),并开发分类法驱动的 SkillTriage 归因工具。最反直觉的发现:看似相关的 Skill 比不相关 Skill 更有害——它让 Agent 错误实现或漏掉任务必需元素;效率回归的最大来源不是提示长度,而是「过度程序」(过度验证 67 例、重实现管道 30 例)。
Salesforce AI Research 联合 Notre Dame、UIUC(Heng Ji)提出强到弱推理时脚手架(Strong-to-Weak Scaffolding):用强 builder 模型为弱 target 模型自动构建推理时 harness,无需任何参数更新即可在四个 Theory-of-Mind 基准(3900 项)上将 GPT-5.4-mini 从 0.488 提升到 0.912(+0.423)。机制分析表明增益主要来自把不稳定的自然语言推理卸载为确定性代码(r=0.72),而非更长推理链或更多采样。这是对传统训练时蒸馏的一条互补路线,也直接印证了 harness 工程作为独立工程对象的价值。
Bang Liu 团队 38 页范式论文,提出继 Digital Agents(数字状态)和 Embodied Agents(物理状态)之后的第三种 Agentic AI 行动基底——Combodied Agents(以人的演化状态为核心)。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架,并把’保留并增强人类 agency’首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。