MobileMem: Learning from a Year of Mobile Experiences 精读

下一代个人AI助手需要跨年月的长期记忆,但现有基准无法反映移动场景的真实复杂性——异构、多模态、演化、深度个人。OPPO与浙大Ningyu Zhang团队(OpenKG联合)发布MobileMem:以知识引导的合成管线从用户先验知识构建年度尺度一致的长程轨迹,覆盖单跳/多跳/时序推理、知识更新与隐式偏好推断,另有MobileMem-Omni多模态版本。评测揭示行业分野:A-MEM 78.39与HippoRAG2 80.06领先而Mem0仅42.61、LangMem低至30.33——保真派碾压压缩派;时序推理全面失守;对抗问题上“记忆越强越容易中招”;Long Context在GPT-5.4-mini上反而更差。

August 18, 2026 · 1 min

RA-Bench: Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? 精读

AI视频生成器已能伪造战争、灾害等危机场景,但现有检测器的真实防御能力从未在贴近真实攻击链的场景下被检验。NUS、西安电子科大、HKUST等19机构60人团队构建RA-Bench:1830条真实危机视频锚点+首帧条件化I2V生成的16056条配对视频,覆盖4开源+5闭源生成器。三维度系统评测发现全面失守:传统检测器AUC从公开基准67.6–98.6%跌至43.9–57.3%;六位评审员全判“真实”的HumanProof子集上Gemini仅54.7%;社会传播模拟(转码+降采样+新闻台标)使微调MLLM的假视频召回从46.0%崩溃至1.4%。检测排名与公开基准相关性仅0.26——现有检测体系在真实危机场景已实质失效。

August 18, 2026 · 1 min

Self-Supervised Visual On-Policy Distillation 精读

在线策略蒸馏(OPD)依赖教师-学生间的信息不对称,通常来自更强教师或特权监督。UCSD、牛津等五校团队提出反转思路:不给教师加信息,而是给学生减信息——学生看强增广视图、EMA教师看原图,免费构造出等效特权不对称。S2VOPD用0.3–0.6倍降采样+50%概率高斯噪声的最优配方,将Qwen3.5-4B在六个细粒度感知基准上从70.7%提升至77.4%,超越Qwen3-VL-235B与GPT-5.4,追平397B模型;对称自蒸馏反而退化。三定律浮现:不对称必须存在、强度适中、差距须保持任务一致。

August 18, 2026 · 1 min

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 精读

把长上下文推理教师的能力蒸馏给异分词器短上下文学生,会遭遇token错位、长度爆炸与训练崩溃三重障碍。上海AI Lab SU-01团队提出SimpleOPD:在共享文本空间对齐——学生用自己分词器生成、教师用自家分词器评估同一文本,仅对占据完全相同文本跨度的token配对监督;配合终止token优势屏蔽+学生参考KL损失,截断率降至近零。Intern-S2-Preview在ProofBench从34.0提升至55.2(+21.2分),超越Gemini-2.5-Pro,跨Qwen/Intern/GLM/Gemma四大家族全部正向增益。本文拆解其对齐机制、稳定性因果链与长度爆炸的根因解释。

August 18, 2026 · 1 min

泡沫是2029年,不是2027:王煜全的荷塘、中间物种与击穿围墙的Agent

海银资本创始人王煜全做客《AI相对论》,给出与蒋涛"2027年爆破"不同的判断:泡沫在2029年,且是"大而快的危机"——半年内恢复、见底时遍地黄金。他的分析框架是"荷塘理论"(胜负已分,只是收入利润滞后五六年才显现)与佩蕾丝技术革命周期(导入期狂热—泡沫破裂—展开期高速增长)。据此推演:特斯拉Waymo地盘战已定调、FSD规模数据优势无人能敌;中国车企不做数据联盟将成为"中间物种";人形机器人是"训练腿的是大泡沫、训练手的是小泡沫";低空经济不可能规模化。七巨头中英伟达未来五年安全、谷歌十年内广告模式失效、苹果失去战略眼光、微软无自研大模型有风险。中国机会在智能服务出海与"农村包围城市"式的全球算力基建。

August 18, 2026 · 2 min

蒸馏风暴:门槛、灰色地带与一份没人愿意签字的竞赛规则

《晚点聊》编辑部红浩与曼奇复盘"蒸馏"这一没人愿意公开谈论的技术竞赛:典型蒸馏是有门槛的"抄答案",含账号运营、数据管线、防中转站反被坑等系统工程;张一鸣为何禁止字节蒸馏——“只能逼近不能超越"加上组织激励代价;Anthropic如何用行为指纹识别2880万次"史上最大规模蒸馏攻击”;学生能否超越教师仍是开放问题;以及比蒸馏更大的问题——智能供需错配下"够用了"的模型正在改写定价逻辑。

August 18, 2026 · 2 min

【每日AI前沿追踪】2026年08月17日 核心技术与产业动态速递

8月17日核心动态:Stripe超70亿美元收购OpenRouter重塑AI路由层格局;OpenAI在IPO前悄然解散Preparedness灾难性风险团队引安全担忧;Codex为GPT-5.6 Sol开放100万token上下文;DeepSeek API峰谷定价生效高峰翻倍。学术方面:上海AI Lab提出Mobius知识-推理解耦架构实现近4倍推理加速;RA-Bench揭示AI生成危机视频检测全面失守(检测器AUC从公开基准98.6%跌至44%);Beyond Final Scores十万美元评测证明前沿模型是工程优化器而非自主研究者;SimpleOPD跨分词器蒸馏将ProofBench提升21.2分;LOPD可学习隐上下文自蒸馏全面超越手工特权上下文方法。

August 17, 2026 · 3 min

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence 精读

多智能体系统的可靠性论证普遍依赖“组件可靠度相乘”,而这一步的前提是各组件失败相互独立。本文用18000次预注册确认性任务实测发现:同一模型的两份拷贝在90%的失败任务上共同失败(log OR=6.66,ϕ=0.916),独立性假设被数据彻底推翻;而拟合依赖模型的替代方案会随数据增多而覆盖率崩塌。作者给出矩集线性规划证书:对任何依赖结构免假设且尖锐,矩族从10个增至14个就把认证下界从0.2455抬升到0.4116,并配套任意停止有效的e-process序贯证书(type-I误差≤0.0471)。换模型显著降低相关性、换厂商无效——冗余设计的多样性应选在模型轴上。

August 17, 2026 · 5 min

AQuA: Recursively Self-Improving Quantitative Trading Research Agents 精读

深度精读普林斯顿、蚂蚁集团与斯坦福联合论文 AQuA:用两个互不共享记忆的语言模型研究系统分别做因子发现与模型开发,靠“密封沙盒+非对称自由”把防泄漏做成构造性质——agent 只能写受限 DSL、搜索只看验证集分数、测试窗口冻结后只评一次。加密货币 5 分钟数据组合信号 IC 约 0.190,美股 30 分钟 held-out 每股 IC +0.0843、Sharpe@2bp 最高 +2.50,2021–2025 逐年为正。

August 17, 2026 · 5 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

美团与中科院团队评测7个前沿模型在36个长时程AI研发任务上的表现,提出“过程+经验”双视角框架:用可确定性计算的C1方案制定/C2执行/C3反馈控制三维过程指标定位研究循环中的瓶颈,用反事实受控实验测量经验复用(任务内擦除、任务间迁移)。发现最强与最弱模型avg@3差距0.237而best@3仅差0.122——可靠性而非峰值区分了模型;经验迁移可使DeepSeek-V4-Pro提升0.093却使Gemini-3.1-Pro下降0.017;252个最优解中真正新颖的方法仅3个(1.2%)。结论:当前AI研发Agent更像勤奋的工程优化器,而非自主研究者。

August 17, 2026 · 4 min