RA-Bench: Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? 精读

AI视频生成器已能伪造战争、灾害等危机场景,但现有检测器的真实防御能力从未在贴近真实攻击链的场景下被检验。NUS、西安电子科大、HKUST等19机构60人团队构建RA-Bench:1830条真实危机视频锚点+首帧条件化I2V生成的16056条配对视频,覆盖4开源+5闭源生成器。三维度系统评测发现全面失守:传统检测器AUC从公开基准67.6–98.6%跌至43.9–57.3%;六位评审员全判“真实”的HumanProof子集上Gemini仅54.7%;社会传播模拟(转码+降采样+新闻台标)使微调MLLM的假视频召回从46.0%崩溃至1.4%。检测排名与公开基准相关性仅0.26——现有检测体系在真实危机场景已实质失效。

August 18, 2026 · 1 min

Self-Supervised Visual On-Policy Distillation 精读

在线策略蒸馏(OPD)依赖教师-学生间的信息不对称,通常来自更强教师或特权监督。UCSD、牛津等五校团队提出反转思路:不给教师加信息,而是给学生减信息——学生看强增广视图、EMA教师看原图,免费构造出等效特权不对称。S2VOPD用0.3–0.6倍降采样+50%概率高斯噪声的最优配方,将Qwen3.5-4B在六个细粒度感知基准上从70.7%提升至77.4%,超越Qwen3-VL-235B与GPT-5.4,追平397B模型;对称自蒸馏反而退化。三定律浮现:不对称必须存在、强度适中、差距须保持任务一致。

August 18, 2026 · 1 min

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence 精读

多智能体系统的可靠性论证普遍依赖“组件可靠度相乘”,而这一步的前提是各组件失败相互独立。本文用18000次预注册确认性任务实测发现:同一模型的两份拷贝在90%的失败任务上共同失败(log OR=6.66,ϕ=0.916),独立性假设被数据彻底推翻;而拟合依赖模型的替代方案会随数据增多而覆盖率崩塌。作者给出矩集线性规划证书:对任何依赖结构免假设且尖锐,矩族从10个增至14个就把认证下界从0.2455抬升到0.4116,并配套任意停止有效的e-process序贯证书(type-I误差≤0.0471)。换模型显著降低相关性、换厂商无效——冗余设计的多样性应选在模型轴上。

August 17, 2026 · 5 min

AQuA: Recursively Self-Improving Quantitative Trading Research Agents 精读

深度精读普林斯顿、蚂蚁集团与斯坦福联合论文 AQuA:用两个互不共享记忆的语言模型研究系统分别做因子发现与模型开发,靠“密封沙盒+非对称自由”把防泄漏做成构造性质——agent 只能写受限 DSL、搜索只看验证集分数、测试窗口冻结后只评一次。加密货币 5 分钟数据组合信号 IC 约 0.190,美股 30 分钟 held-out 每股 IC +0.0843、Sharpe@2bp 最高 +2.50,2021–2025 逐年为正。

August 17, 2026 · 5 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

美团与中科院团队评测7个前沿模型在36个长时程AI研发任务上的表现,提出“过程+经验”双视角框架:用可确定性计算的C1方案制定/C2执行/C3反馈控制三维过程指标定位研究循环中的瓶颈,用反事实受控实验测量经验复用(任务内擦除、任务间迁移)。发现最强与最弱模型avg@3差距0.237而best@3仅差0.122——可靠性而非峰值区分了模型;经验迁移可使DeepSeek-V4-Pro提升0.093却使Gemini-3.1-Pro下降0.017;252个最优解中真正新颖的方法仅3个(1.2%)。结论:当前AI研发Agent更像勤奋的工程优化器,而非自主研究者。

August 17, 2026 · 4 min

Beyond Retrieval: Query-Conditioned Reuse of Long-Horizon Agent Trajectories 精读

深度精读 arxiv:2608.12847——西安交大团队提出 QCR(Query-Conditioned Reuse),指出轨迹记忆的真正瓶颈不在检索而在检索之后的“复用”环节:历史轨迹里的用户名、路径、日期等绑定值会随时间过期,直接注入会诱导模型照抄旧值。QCR 在检索与执行之间插入一步改写,把选中轨迹转化为“工作流不变量/需重取绑定/适用条件/验证护栏”四字段笔记。在 WebArena/WorkArena/AppWorld 共 2391 个目标上,平均 Success 62.3%(比注入完整轨迹高 10.7 点),在线 token 省 48.9%;大绑定偏移下过期绑定错误率从 46.9% 降至 10.9%。

August 17, 2026 · 4 min

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test 精读

独立研究者 Saveliy Batruin 单人完成的论文,把“智能体组件各自正常、合起来却对不上”的 harness 故障形式化为层论粘合问题:5 个需求作顶点、行为签名作茎、限制映射为字面字段投影,用精确 CSP 判定可粘合性、用相对上同调类作诊断特征,并对隐藏中介状态取商以获得不变性。受控实验中 20 个任务簇全部获益(到首次成功的候选评估数 1.000 vs 2.000,token 降约 71%);但在真实 PatchFuseBench 上候选级商选择器 118/160 仅比匹配对照 116/160 高 2 题(p=0.75 不显著),未过预注册开发门,确认集保持封存。受控环境成立、真实优势尚未证明——论文以罕见的诚实划出了方法的边界。

August 17, 2026 · 4 min

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution 精读

深度精读佐治亚理工与 Cisco Research 合作的 DIVE 论文——让冻结大模型通过多样性驱动的技能进化实现自我改进。文章从冻结模型为何记不住经验讲起,拆解其核心设计:K=10 个独立技能种群、四种异构进化算子加 UCB 预算分配、联合选择至多 M=10 个互补技能、推理时候选排序。在六个数学与逻辑推理基准上,GPT-5-nano 借助 DIVE 从 52.3 跃升至 81.5,反超 GPT-5 few-shot,推理成本还降低 42.5%。本文逐节还原问题形式化、机制细节、完整实验数据与效果根源解释,并给出可迁移的方法论灵感。

August 17, 2026 · 5 min

GitSkills: A Dataset of Agent Skills on GitHub 精读

深度精读 UCL、霍恩海姆大学与卡利亚里大学合作的 GitSkills——首个对 GitHub 上 Agent Skill 生态做系统性快照的规模数据集。2025年10月 Anthropic 开源 SKILL.md 格式,仅九个月后 GitHub 公开仓库中已沉淀 3,797,117 个 SKILL.md 文件、282,200 个仓库、195,841 个账号。论文的三阶段管线绕过代码搜索 API 每查询 1000 条上限与不可靠的总数估计(报 34.9 万 vs 实际 380 万+),按文件大小递归分区搜索空间完成完整采集;内容哈希去重得 1,877,981 个不同内容,50.5% 的文件是逐字副本——这个无包管理器、靠复制传播的生态,把软件供应链安全命题原样搬进了自然语言工件世界。数据封装为单个自包含 SQLite 文件,采集与解释分离设计让社区可以自定义纳入标准。

August 17, 2026 · 3 min

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents 精读

自改进 LLM Agent 会把成功经验沉淀为可复用技能,但如果某次“成功”本身是不安全的,会怎样?本文精读港城大与阿德莱德大学的论文 Practice Makes Unsafe:作者提出技能劣化(skill misevolution)概念——不安全捷径随有用流程一起被写入技能库,攻击输入消失后危害仍持续。论文给出 SKILLMISEVO-GYM 生命周期测试框架、SKILLMISEVO-BENCH 冻结基准与 SAFEEVOLVE 治理包装器,实验发现 21 个进化配置全部产出不安全技能、3 个恶意任务即可使新会话攻击成功率从 16.0% 升至 35.3%,而 SAFEEVOLVE 能将不安全检索率降低 26.7 个百分点、良性效用仅损失 0.4 分。

August 17, 2026 · 4 min