AI娱乐的版本答案还没出现:从猫箱到动念引线,梁琛奇推演“烧token的新平台”

晚点聊对话96年生的前猫箱负责人梁琛奇。他在字节七年做过抖音朋友页、从零立过实时社交产品,2023年在Flow做出猫箱,2025年创立动念引线(Dayfold),先后做出AI漫画社区"松果时刻"等产品。他的核心推演:能诞生新平台的娱乐体验必须在"消费时"烧token而非只在创作时;文字ROI已在2025年打正,图片会沿"漫画先行"路径成熟;新体验的雏形将在一到两年内出现。本文拆解其推理链条、组织方法与行业分歧——泛创作普及,还是大部分人闲暇只会被动杀时间。

September 30, 2026 · 1 min

FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders 精读

本文精读 arXiv 2609.31620《FuseReg》。表示自编码器(RAE)用冻结视觉编码器的特征做扩散模型的 latent,但「融合哪些层」一直是个手工选择的固定配置:浅层利于重建、深层利于生成,一个固定融合把两个偏好不同的阶段绑死在一起。FuseReg 把层融合从「待选择的配置」重构为「训练分布」:训练时对编码器层做归一化随机子集采样,理论上证明该操作保持全层均值不变、恰好沿层间分歧方向注入方差,且二阶矩与任何确定性融合不可等价。仅换一个 FuseReg decoder 就把 ImageNet-256 无引导 gFID 从 3.01 降到 2.21(-27%),k=7 迁移场景从 27.73 降到 1.92,联合正则在 DiT-Base 上从 13.96 降到 9.93(-29%)。本精读覆盖背景、关联谱系、问题抽象、方法机制、实验证据链、外部交叉验证与可推广灵感。

September 29, 2026 · 7 min

Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems 精读

本文精读港中深、Buffalo 与 Oxford 合作的论文 arXiv 2609.30383。论文首次形式化「技能级联攻击」:把一个恶意目标拆分进多个技能,每处修改单独看都无害且能通过扫描,组合执行才产生危害。作者构建五智能体红队框架 SKILLCASCADE,在 ClawHub 真实技能上产出 213 个验证用例的基准;在 3 套 agent 系统与 8 个骨干共 24 个配置上,级联攻击平均成功率高达 89.4%,静态联合扫描器完全致盲(Delta=0),运行时防御规避率 88.5%。本精读覆盖问题形式化、攻击框架、实验证据、根源机制与外部交叉验证,并结合当日 NVIDIA Open Agent Safety Platform 的产业动态讨论平台级防御与组合攻击盲区的关系。

September 29, 2026 · 5 min

PrimeScientist:让自主研究智能体学会战略性分配研究努力 精读

UC San Diego 与 Johns Hopkins 团队提出 PrimeScientist:把「研究努力的战略分配」首次形式化为共享推理预算下的序贯决策问题——可执行计划树保留竞争方案,自适应 MCTS 用剩余预算比调节探索-开采平衡。在 FIRE-Bench 上平均奖励比 AutoResearch 高 10.3%,尝试次数少 50.6%(24 任务中 23 次更少),消融证明预算自适应策略优于 UCT、Greedy 与固定指数。这为算力爆炸时代的自主科学研究确立了「省着花」这一被忽视的元能力。

September 28, 2026 · 4 min

出题、卖题、判卷:AI数据行业的权力、红线与瓶颈

硅谷101对话Scale AI何允中与伯克利博士后孙一铀,拆解AI数据生意:估值半年涨十倍的AfterQuery、百亿美元级的Mercor与Scale背后,交付物已从人工标注进化为专家评分标准(rubric)与强化学习环境;评测的权威性天然通向卖数据生意,但卖评测数据是不可碰的红线;行业真正的瓶颈正从标注产能转向垂直领域的采购与版权;而激励设计决定了数据质量的上限。

September 28, 2026 · 2 min

当VC合伙人转身去做儿童情绪课:于红谈AI时代到底该学什么

前美团龙珠合伙人于红在AI最热的年份离开VC行业,转身做4-12岁儿童的SEL社会情感学习产品"兔咚咚"。这期十字路口播客里,她用林迪效应拆解"孩子该学什么",用幸福配比研究回应原生家庭决定论,用一级市场投资方法论论证"选择能力可以教"。核验发现衡水中学跌幅口径有出入,但好学校"负向效果"的海外研究真实存在。

September 28, 2026 · 1 min

Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity 精读

MIT CSAIL 团队提出 JAZ:一个只比 agent loop 多一点点的极简智能体框架。它仅暴露一个 LLM 原语 invoke——一个函数体由 LLM 在运行时生成的函数——加上动态作用域与 hooks,就涌现出传统上需要专门 harness 才能实现的长程记忆与持续自改进能力:在 StuLife 远程回忆子集上以约 43% 的成本超越 Letta(MemGPT)8 个百分点,在 AppWorld 上以更低成本胜过专门的自改进框架 ACE。本文从语言原语的第一性原理出发,拆解 invoke 的两条定义性质、tail-recursive delegation 如何统一各类上下文管理为特例,并用 MemGPT、RLM、ACE、context rot 研究等外部文献交叉验证其效果优势的根源。

September 27, 2026 · 5 min

Learning to Discover Interesting Mathematics 精读

当 LLM 已经能证明定理,真正的瓶颈变成「哪些定理值得提出」。FAIR@Meta 联合 NYU 与巴黎综合理工的这篇论文给出了一个不依赖人类判断的答案:把定理的有趣度定义为证明代价与陈述描述长度之比。他们训练了一个 27B 难度预测器(比 GPT-5.5 与 Claude Opus 4.6 都准),用有趣度作奖励把 conjecturer 的平均有趣度提升 4.3 倍、与 mathlib 的重合率从 91.9% 压到 30.6%,并用推理期剪枝驱动一个自扩展定理库。本精读覆盖其方法拆解、关键实验、机制根源分析与可迁移灵感。

September 27, 2026 · 4 min

Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It? 精读

SWE-bench 上的高分到底是真实的仓库级推理能力,还是对训练语料的死记硬背?上海交通大学等机构提出 SchrodingerRepo 评测框架,把测试仓库从一份静态代码变成评估期才『定型』的潜变量:agent 进入环境前,仓库处于语义等价但表面形态不定的叠加态;进入环境后才按随机种子实例化为重命名、重排、重写过的陌生仓库。实验显示,所有受测 LLM 在 SWE-bench Verified 上解决率下降 6.0–14.4 个百分点(p<0.05),且超过八成的额外交互开销花在仓库探索上;而在时间上隔离污染的 SWE-rebench 实例上解决率不变、只有成本上升——说明退化确实来自对熟悉仓库线索的记忆依赖,而非任务变难。本精读覆盖其四级变换方法、四组实验证据、外部交叉验证与可推广启发。

September 25, 2026 · 5 min

「会说」到「会做」,隔着一天三百万的纠错账:云栖2026高德技术峰会复盘

云栖2026高德技术峰会上,高德把「空间智能」从口号推进到产品:全空间无人体系七城启动,ABot全栈具身体系公开技术底牌。但圆桌算出的账更冷峻:顺丰0.1个百分点的准确率差对应每天三百万损失,无人配送要过20%降本门槛,B端车辆利用率仅30%。智能的稀缺性正从模型能力转向物理世界的系统可靠性——这是判断物理AI何时规模化的三把尺。

September 24, 2026 · 1 min