RRSI: Regularized Recursive Self-Improvement of Agent Harnesses 精读

深度精读 Google Cloud AI Research 等提出的 RRSI——首个把机器学习正则化思想系统迁移到 Agent Harness 递归自我改进的工作。文章从 Harness 与 RSI 概念讲起,拆解过拟合问题的成因,逐一讲解提案侧 L0 式退火编辑预算、证据感知信用分配、结构化探索,与选择侧泄漏筛查、噪声调整底线、L2 式成本门槛、L1 式结构剪枝,并结合八基准三域实验与外部检索交叉验证,剖析其「为何能泛化」的根源性解释与可迁移灵感。

September 23, 2026 · 5 min

VibeMemBench:在真实仓库任务上用可执行测试受控评测 Coding Agent 记忆系统

VibeMemBench 是首个把「真实仓库编程任务 + 可执行测试」与「持久记忆系统」接起来的受控评测基准:它不考记忆系统能否答对回忆题,而考注入的历史经验能否真正提升可执行的仓库修复结果。论文用 SIEVE 四阶段流水线(来源校验、补丁模式筛选、历史执行与经验蒸馏、验证 uplift 并冻结)从 90 个仓库筛出 111 个目标与 3634 条历史轨迹,并提出「只改记忆开关」的匹配干预协议。核心结论有反差感:冻结的、已被执行验证过有用的经验,迁移到 5 个预留 solver 时让 4 个的解决率提升 1.1~4.5 个百分点、且步数全面下降;但当 Mem0 / SimpleMem / MemoryOS / A-MEM 这四个现有记忆系统必须从同一段历史里自己写、自己检索经验时,12 组 solver×系统配对中有 11 组没能超过「不开记忆」的配对基线。失败归因显示主因不是「没检索到」(ranking miss 仅 1.3%),而是「记录形态崩坏」(form degradation 占 69.3%)——strip 消融进一步证明危害来自原始 transcript 的体积而非指令语义。本文按九部分结构拆解其背景、定位、问题定义、构建方法、评估协议、外部交叉验证、核心结果、根因分析与启示。

September 23, 2026 · 4 min

从卖 Token 到交付结果:云栖 MaaS & Agent 主论坛,阿里把'智能的价值密度'摆上台面

2026 云栖技术主论坛 MaaS & Agent 场(14009 秒官方回放完整转写):文征以’智能价值密度’回应 token 通缩论,千问 AI 平台扩展为模型服务+Agent 服务+行业方案三层,发布 Agent Studio、Token Plan 订阅、Qoder 全新升级、千问办公企业上下文、QwenNote A2、Qwen Intelligence 手机方案,云市场升级为 AI 应用市场。圆桌上贝壳、安克、西门子、基元律动、元戎给出落地路径与真实分歧,关键数字经外部多源核验,自报口径已标注。

September 23, 2026 · 5 min

把思考变成电:2026 云栖开幕式主论坛的路线图与缺口

2026 云栖大会开幕式主论坛(9314 秒官方回放完整转写)上,吴泳铭给出两个判断:机器思考总量将达人类千倍以上、机器智能时代的代表性产品还没出现,阿里据此押注模型、芯片、AI 云三大基建,目标 2032 年数据中心超 20GW。平头哥发布真武 V900,千问披露 RSI 自我进化与 5–10T 参数规划,荣耀与平安分别给出终端、金融两个落地样本。本文按时间轴完整复盘,关键数字经外部多源核验,厂商自报数据与待核验口径均已标注。

September 23, 2026 · 3 min

攻防进入机器速度之后,防御也只能交给 Agent:云栖2026『模型时代』安全论坛全景复盘

2026 云栖「模型时代:AI 驱动的安全进化」论坛复盘:AI 挖洞让 CVE 冲向历年峰值、有效攻击占比质变,人工防御追不上机器速度。阿里云的答案是全线 Agent 化——代码安全、BAS/ASM、WAAP、SOC、安全运维五条产品线改造,古茗提供实战注脚。CVE 数据、Hugging Face 沙箱逃逸等关键主张已对上公开来源,自报数字分层标注。

September 23, 2026 · 4 min

财务AI跑通月结与付款之后,卡住企业的不再是模型:云栖2026『专业决策,智能执行』财务分论坛全景复盘

2026 云栖财务分论坛复盘:阿里 CFO 徐宏以『有必要做/可以做/值得做』三问给出苹果树框架与提效提质创质三层次;曹勇讲数据、skill、知识三块基建;冯云乐的数字员工跑通采购付款与月结闭环;司为重构经营分析;圆桌辩论紧迫性与 token 账本;程理给出五种方案与四道安全关。核心判断:模型已不是瓶颈,信任基建、人机边界与账本才是。

September 23, 2026 · 4 min

Agent 技能自进化二重奏:EVOLVE 与 GraphSkillEvo 精读

2026年9月同主题连发的两篇论文不约而同地把「Agent 技能库」当作可进化的资产:Adobe+Brown 的 EVOLVE 让冻结模型在真实用户流量中演化 SKILL.md 技能库(Widening/Deepening 两轴 + Matched Replay Gate 保守准入);港城大+NUS+南科大的 GraphSkillEvo 则把技能表示为「全局指导+有向图」,用种群进化(4算子变异/交叉)优化。本文合并精读二者,共用背景与灵感节,逐篇拆解问题定义、解法与评估,并用因果链解释优势根源(保守准入防评分漂移、图结构压缩搜索空间),交叉对照 Reflexion/ExpeL/Voyager/Safe-Policy-Improvement/GEPA 谱系。两文共同指向一条结论:把「改模型权重」换成「改模型身边的自然语言资产」,是一条更稳、更安全、可迁移的持续适应路线。

September 22, 2026 · 5 min

Agent 评测方法学三重奏:Next-Turn 指标为何失灵 精读

本文合并精读三篇同主题论文,剖析「next-turn(单轮/下一步)指标」为何无法可靠预测 Agent 的真实工作能力。A(Dialpad)用五级评测协议链证明:SFT 在金历史评测下让文本轮大幅提升,但闭环工作流成功率最高仅 10.4%、整体裁判 0/77,根源是金历史恢复了正确状态、测的是「响应预测」而非「状态构建」。B(LibreDB)用 8,199 次生产级真机运行与四类失败 taxonomy 证明:75.7% 的损失来自真正调用过工具的 run,而 5 项服务器侧(非模型侧)修复让 6/6 模型同时提升。产业基准 τ²-bench 提供「必须真实」的旁证:最强编码智能体仅过 23.9%。三篇合流结论:Agent 评测必须闭环、必须真实、必须归因到接口层。

September 22, 2026 · 6 min

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读

CodeMidas(小米 LLM Core 联合北大、港大、人大)提出用源代码作为唯一输入,把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习(RL)环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线,CodeMidas 首次做到五项开发记录全免,覆盖 3,185 个代码库、23 种语言、15 个领域,经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5,在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升(DeepSWE +11.7pp、ProgramBench +17pp)。消融证明「质量>数量」:清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。

September 22, 2026 · 6 min

EvoOntology: A Self-Evolving Ontology Layer for Data Agents 精读

EvoOntology(中国人民大学 ruc-datalab)提出一个面向数据智能体的「自进化本体层」:把数据库的领域概念、字段映射与约束封装成可被 agent 在运行时按需查询的 MCP 服务,并用 builder agent 自动构建初版本体、用「诊断—归因—修补—门控」四步环从失败轨迹中持续进化。本文按九部分结构精读,重点拆解三层架构、四步进化环,以及为何「静态语义层全量注入反而掉分」是全篇最有证明力的实验设计,并从因果链上解释其优势根源。

September 22, 2026 · 5 min