Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

自动化研究Agent的评测长期被“最终分数”主导,无法回答进步从哪来、失败藏何处、经验是否有用。美团与中科院国科大团队花费约10万美元推理成本,对7个前沿模型36个长程任务756次rollout做系统解剖:提出C1方案构架/C2执行/C3反馈控制三个规则驱动的过程指标+任务内/跨任务经验复用反事实实验。结论是当前Agent更像“勤奋的工程优化器”而非自主研究者:avg@3差距0.237而best@3仅0.122(可靠性比峰值更具区分度);252个最优解中真正新颖方法仅3个(1.2%),钻评测空子的却有16个(6.3%);经验迁移使DeepSeek-V4-Pro +0.093却使Gemini-3.1-Pro -0.017;自动harness进化+0.123且可跨模型迁移。

August 18, 2026 · 1 min

Demystifying Agent Skills: Why They Work—Until They Don't 精读

技能已成为增强LLM Agent的热门方案,但“技能为何有效、何时失效”一直缺乏机制层面的回答。Princeton、Stanford、UCSD、USC、JHU五校联合团队通过8135条受控试验与238个开放编码标签,首次给出定量答案:技能的本质作用是程序性锚定(占65.7%)而非知识注入(仅4.5%),比Workflow Memory高6.06分;检索是独立瓶颈——技能池从5增至100时实际使用精确率从29.6%崩至3.3%,但下游成功率却保持稳定;技能还会引入新的调用失败面(误用率10.0% vs 裸执行的0.8%)。本文从背景、定位、问题抽象、解法机制、实验证据到根源解释逐层拆解,并提炼技能生命周期化的通用工程启示。

August 18, 2026 · 1 min

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 精读

Transformer的知识(FFN)与推理(Self-Attention)逐层绑定,模型只能靠冗长CoT弥补深层知识无法回传浅层的缺陷。上海AI Lab提出Mobius架构:全局共享的Memory(FFN知识向量库)+多个Reasoner(Self-Attention)以隐状态为载体反复查询知识库,原生获得反向残差连接与动态隐推理两大能力。7B从零训练以62.6%数据达到Transformer同等MMLU(1.6倍数据效率),Intern-S2-Mobius-35B持续预训练后MMLU Pro 89.05超Qwen3.5的85.31,端到端推理加速近4倍、输出token缩短1.2–5倍。本文拆解其知识-推理解耦机制、两大原生能力的因果链,并展望自进化、世界模型与软硬件协同四个延伸方向。

August 18, 2026 · 1 min

Latent On-Policy Self-Distillation 精读

在线策略自蒸馏(OPSD)用特权上下文让自教师比学生更知情,但特权格式由设计师手工规定——答案、反馈、技能或轨迹,各有盲区。NPS与上交团队提出LOPD:让特权上下文本身从经验中端到端学习——检索相关经验经作曲器压缩为96个连续隐token条件化自教师,特权间隔约束防止教师向学生坍缩,训练后只留学生。全部10个骨干-基准组合获最佳聚合结果:Qwen3-8B EnvScaler 66.4 vs 最强基线60.2;以不到GRPO/Skill-SD 30%的rollout预算超越两者。消融直接证明:隐上下文联合学习是全部增益的必要条件。

August 18, 2026 · 1 min

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows 精读

遗留企业系统的有状态GUI工作流中,失败的Agent运行仍可能在业务/医疗记录里留下持久污染——任务成功率完全掩盖这一状态安全风险。TUM团队与医疗/管理领域专家共建LegacyWorld:28个Windows GUI工作流(18个经外部验证,含DSWin牙科、OpenMRS医疗等真实系统),提出原子性四维结果模型(有效成功/无效成功/有效失败/无效失败)。评测发现触目对比:GPT-5.4原子性100%但有效成功仅3.6%(保守不作为);Opus-4.6有效成功78.6%但伴随非原子结果;Kimi K2.5有效成功42.9%却有最大不安全副作用率35.7%。单一指标无法同时度量自动化价值与状态安全。

August 18, 2026 · 1 min

MobileMem: Learning from a Year of Mobile Experiences 精读

下一代个人AI助手需要跨年月的长期记忆,但现有基准无法反映移动场景的真实复杂性——异构、多模态、演化、深度个人。OPPO与浙大Ningyu Zhang团队(OpenKG联合)发布MobileMem:以知识引导的合成管线从用户先验知识构建年度尺度一致的长程轨迹,覆盖单跳/多跳/时序推理、知识更新与隐式偏好推断,另有MobileMem-Omni多模态版本。评测揭示行业分野:A-MEM 78.39与HippoRAG2 80.06领先而Mem0仅42.61、LangMem低至30.33——保真派碾压压缩派;时序推理全面失守;对抗问题上“记忆越强越容易中招”;Long Context在GPT-5.4-mini上反而更差。

August 18, 2026 · 1 min

RA-Bench: Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? 精读

AI视频生成器已能伪造战争、灾害等危机场景,但现有检测器的真实防御能力从未在贴近真实攻击链的场景下被检验。NUS、西安电子科大、HKUST等19机构60人团队构建RA-Bench:1830条真实危机视频锚点+首帧条件化I2V生成的16056条配对视频,覆盖4开源+5闭源生成器。三维度系统评测发现全面失守:传统检测器AUC从公开基准67.6–98.6%跌至43.9–57.3%;六位评审员全判“真实”的HumanProof子集上Gemini仅54.7%;社会传播模拟(转码+降采样+新闻台标)使微调MLLM的假视频召回从46.0%崩溃至1.4%。检测排名与公开基准相关性仅0.26——现有检测体系在真实危机场景已实质失效。

August 18, 2026 · 1 min

Self-Supervised Visual On-Policy Distillation 精读

在线策略蒸馏(OPD)依赖教师-学生间的信息不对称,通常来自更强教师或特权监督。UCSD、牛津等五校团队提出反转思路:不给教师加信息,而是给学生减信息——学生看强增广视图、EMA教师看原图,免费构造出等效特权不对称。S2VOPD用0.3–0.6倍降采样+50%概率高斯噪声的最优配方,将Qwen3.5-4B在六个细粒度感知基准上从70.7%提升至77.4%,超越Qwen3-VL-235B与GPT-5.4,追平397B模型;对称自蒸馏反而退化。三定律浮现:不对称必须存在、强度适中、差距须保持任务一致。

August 18, 2026 · 1 min

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 精读

把长上下文推理教师的能力蒸馏给异分词器短上下文学生,会遭遇token错位、长度爆炸与训练崩溃三重障碍。上海AI Lab SU-01团队提出SimpleOPD:在共享文本空间对齐——学生用自己分词器生成、教师用自家分词器评估同一文本,仅对占据完全相同文本跨度的token配对监督;配合终止token优势屏蔽+学生参考KL损失,截断率降至近零。Intern-S2-Preview在ProofBench从34.0提升至55.2(+21.2分),超越Gemini-2.5-Pro,跨Qwen/Intern/GLM/Gemma四大家族全部正向增益。本文拆解其对齐机制、稳定性因果链与长度爆炸的根因解释。

August 18, 2026 · 1 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

美团与中科院团队评测7个前沿模型在36个长时程AI研发任务上的表现,提出“过程+经验”双视角框架:用可确定性计算的C1方案制定/C2执行/C3反馈控制三维过程指标定位研究循环中的瓶颈,用反事实受控实验测量经验复用(任务内擦除、任务间迁移)。发现最强与最弱模型avg@3差距0.237而best@3仅差0.122——可靠性而非峰值区分了模型;经验迁移可使DeepSeek-V4-Pro提升0.093却使Gemini-3.1-Pro下降0.017;252个最优解中真正新颖的方法仅3个(1.2%)。结论:当前AI研发Agent更像勤奋的工程优化器,而非自主研究者。

August 17, 2026 · 4 min