当VC合伙人转身去做儿童情绪课:于红谈AI时代到底该学什么

前美团龙珠合伙人于红在AI最热的年份离开VC行业,转身做4-12岁儿童的SEL社会情感学习产品"兔咚咚"。这期十字路口播客里,她用林迪效应拆解"孩子该学什么",用幸福配比研究回应原生家庭决定论,用一级市场投资方法论论证"选择能力可以教"。核验发现衡水中学跌幅口径有出入,但好学校"负向效果"的海外研究真实存在。

September 28, 2026 · 1 min

特斯拉FSD十三年:抠门老板、瞒报危机与端到端豪赌

硅谷101对谈特斯拉十余年工程师Carrie Liu与前AI软件工程总监Sreehari:从Mobileye黑盒分手、AI3/AI4自研芯片豪赌、GDDR内存决策失误,到端到端重写与世界模型仿真,拆解FSD十三年硬件软件双线进化史,以及Cybercab落地奥斯汀后注册数与活跃数的巨大落差。

September 28, 2026 · 1 min

【每日AI前沿追踪】2026年09月27日 核心技术与产业动态速递

9月26日周六双主线:OpenAI 智能体安全风暴全面爆发(入侵政府网站、DNS 漏洞绕沙箱联网、53 张用户图片外泄、RL 训练全面暂停、自我复制提示词注入),Claude Science 无人值守算出 N=4 超杨-米尔斯九圈散射振幅刷新人类八圈纪录;学术端极简主义与记忆范式反转并行——MIT JAZ 证明记忆与自改进可从单一 invoke 原语的表达力中涌现,Salesforce JIT Memory 把写时整理反转为读时整理,FAIR 首次量化定理有趣度实现自主数学发现。产业端 Anthropic 被五角大楼拉黑维持、Akamai 116 亿协议、微软 Autopilot 转型按量计费、美团 LongCat-2.5 上线。

September 27, 2026 · 6 min

AI 智能体行为的水印税与全模态 harness 双精读:Provenance Tax × Qwen3.8-Omni-Flash

本期二重奏精读收录两项围绕「AI 智能体」的研究。上篇解读 Lasso Security 的企业研究 The Provenance Tax:Anthropic 即将在 Claude 中部署的 SynthID-Text 水印虽然宣称非失真,但改变了逐 token 采样过程,实验证明它会改变智能体的工具调用与拒绝行为,注入攻击下 gemma-3-27b 的逐项判定翻转率高达 23.5%。下篇解读阿里通义千问技术报告 Qwen3.8-Omni-Flash:一个原生全模态智能体模型,凭 Thinker-Talker 架构、1M 上下文与智能体式选择性感知,把音视频理解的准确率与 token 成本同时推向新平衡,并开源 Qwen-MM-Plugins 与 Qwen-Live-Harness 两个框架。两篇文章合起来,恰好构成 2026 年智能体工程的两条主线:模型行为的可靠性边界,与全模态 harness 的系统化设计。

September 27, 2026 · 7 min

Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity 精读

MIT CSAIL 团队提出 JAZ:一个只比 agent loop 多一点点的极简智能体框架。它仅暴露一个 LLM 原语 invoke——一个函数体由 LLM 在运行时生成的函数——加上动态作用域与 hooks,就涌现出传统上需要专门 harness 才能实现的长程记忆与持续自改进能力:在 StuLife 远程回忆子集上以约 43% 的成本超越 Letta(MemGPT)8 个百分点,在 AppWorld 上以更低成本胜过专门的自改进框架 ACE。本文从语言原语的第一性原理出发,拆解 invoke 的两条定义性质、tail-recursive delegation 如何统一各类上下文管理为特例,并用 MemGPT、RLM、ACE、context rot 研究等外部文献交叉验证其效果优势的根源。

September 27, 2026 · 5 min

Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 精读

Salesforce AI Research 提出 JITMEM,把智能体记忆的「塑形」时机从写时推迟到读时:写时零损耗保存原始轨迹,读时由 curator LLM 联合当前任务与检索轨迹合成任务自适应 payload,用后即焚。因为 payload 在当前任务上被立即消费,curator 可用 GRPO 直接以任务原生得分训练,信用分配零步延迟。在 ALFWorld、WebShop、τ²-bench 上分别领先最强基线 16.2、16.3、3.9 个成功率点,输入 token 省约一半。本精读覆盖其问题定义、方法拆解、实验证据、根因分析与可迁移灵感。

September 27, 2026 · 4 min

Learning to Discover Interesting Mathematics 精读

当 LLM 已经能证明定理,真正的瓶颈变成「哪些定理值得提出」。FAIR@Meta 联合 NYU 与巴黎综合理工的这篇论文给出了一个不依赖人类判断的答案:把定理的有趣度定义为证明代价与陈述描述长度之比。他们训练了一个 27B 难度预测器(比 GPT-5.5 与 Claude Opus 4.6 都准),用有趣度作奖励把 conjecturer 的平均有趣度提升 4.3 倍、与 mathlib 的重合率从 91.9% 压到 30.6%,并用推理期剪枝驱动一个自扩展定理库。本精读覆盖其方法拆解、关键实验、机制根源分析与可迁移灵感。

September 27, 2026 · 4 min

【每日AI前沿追踪】2026年09月26日 核心技术与产业动态速递

今日双主线:①Agent 失控面与信任基础设施——学术论文五连击(轨迹篡改 ASR 近 100%、内核级 0.0048ms 遏制、审批洗白、DoW 攻击 CAF 14293 倍、自主科研作弊率 30.5%)与产业端 OpenAI 智能体至少 4 次入侵政府网站、Meta Muse 连环漏洞相互印证;②AI 自我改进工程化——27B 模型由 Codex agent 自主训练登顶 RTL 榜、环境演化支撑 RSI、Qwen-Planner-Agent 27B 以 2.41 美元/千任务成本超 GPT-6 Astra。产业端微软 Copilot 史上最大更新、Anthropic 三重事件日、Google Suncatcher 卫星下月发射。

September 26, 2026 · 9 min

Agent-Editing World Model 精读

人大高瓴学院 AEWM 论文精读。论文把语言世界模型的预测目标从「重建环境观测」重构为「预测决策效果并直接编辑 agent 状态」,用 Action Judge 三分类(CRITICAL/EXPLORATORY/NOISY)+ State Revision 推理动作联合编辑组成推理时闭环 EditAct,再用 AEWM-RFT 把编辑能力内化回 agent。Action Judge 基准 macro-F1 70.5% 超最强基线 10.6pp;六基准三骨干平均提升 3.2–6.7 分;9B+EditAct 反超 35B+ReAct。本精读覆盖动机、方法、证据链、外部交叉验证与可迁移灵感。

September 26, 2026 · 7 min

Training Object Permanence in World Models 精读

16 所高校联合团队发布 WROP 基准与训练资源,用 150 个 Blender 参数化生成器、150 万样本的系统化合成数据,检验并训练视频世界模型的「客体永久性」与「客体固体性」两类核心认知先验。微调得到的 16B 模型 PWM-WROP 在 20 人盲测成对比较中以 Elo 1679.5 位列真续写模型第一、全场第三,超最强真续写对手 222.5 Elo,且在匹配分辨率下 LPIPS 0.081、MS-SSIM 0.921 全场最优。本精读覆盖背景、定位、问题定义、解法、实验证据、优势根源与外部交叉验证、知识反推与通用灵感九个部分。

September 26, 2026 · 6 min