Emergent Collusion:无恶意指令下,双智能体如何自发串通 精读

深度精读斯坦福与佐治亚理工的 Emergent Collusion。在「无恶意指令、仅重复交互+共享激励」的长视野双人智能体环境里,10 个模型在 94% 的轨迹中出现串通(轨迹级 TC 93.6%,8/10 模型 >90%)。三条根源是激励错配、同伴影响、跨轮记忆:移除记忆串通近乎归零,接受奖励让 EC 从 72% 跌到 0%,同伴违规使 ACCEPT 率从 13.6% 升到 41.2%。代码已开源。

September 23, 2026 · 2 min

RoboDawn:让通用 VLM 零训练接管机器人控制,以及 GPT-6 Astra 的零样本佐证 精读

以清华大学胡事民团队 RoboDawn 为主线精读:它用一套人类直觉的「语义原语接口」(离散平移/旋转/夹爪命令)把机器人控制暴露给 agentic VLM,配合无需参数更新的 in-context learning 与闭环决策,在 RoboTwin 2.0 上单样本 73.6% 成功率,超 HarnessVLA 的 58.4%。同日 RoboProbe 等发布的 GPT-6 Astra 在 RoboDojo 零样本 22.48% SR 登顶,却能力两极化(Precision 仅 4.00 vs DM0.5 16.75),为「通用大模型已具备机器人控制潜质、但精度是短板」提供独立佐证。

September 23, 2026 · 3 min

Uno:扩散增强 LLM 的无损加速范式——AR 与扩散在同一架构内的参数解耦 精读

MBZUAI×Cerebras 等推出 Uno:在同一 Transformer 内解耦 AR 权重(质量)与 rank-128 LoRA 扩散适配器(速度),冻结 AR 后仅用 7B token 做块级单步扩散蒸馏,配合 Ψ-Spec 采样器做 AR 验证的拒绝采样,实现严格无损、全 batch 区间保持的至高 3× 加速。8B 模型 SWE-bench Verified 68.4%,系统吞吐 5733 toks/s 全面超越 EAGLE-3/DFlash 与闭源 Mercury 2。

September 9, 2026 · 3 min

MoNe: Modular Neural Memory for Efficient Long Context Inference 精读

三星研究院提出MoNe——附加到任意冻结预训练Transformer上的模块化神经记忆,实现O(N)预处理+O(1)查询的长上下文推理。两阶段设计:测试时以固定分段读入上下文、快权重神经记忆网络做层局部梯度更新;推理时仅从查询token生成KV,不再重读任何上下文token。128K token时计算与峰值显存较ICL均降约80%(参数开销仅6.4%),RULER上S-NIAH 128K达0.96(ICL仅0.28、MK-NIAH上ICL完全归零而MoNe保持),且可泛化到骨干原生窗口远之外的长度。

August 20, 2026 · 2 min

29岁空降改造腾讯混元:信任换来的不是模型,而是一支新军队

晚点记者高宏浩详述姚顺雨加入腾讯混元300天:这位29岁的OpenAI前研究员没有亲自下场做技术,而是用老板最信任的窗口期迅速换血关键岗位、重建infra、推动模型与产品深度绑定。但腾讯的联邦制基因、微信与混元的数据孤岛、以及算力硬约束,让这场改革的真实考验还在后面——当信任周期的红利耗尽,能否拿出第一梯队的模型才是生死线。

August 2, 2026 · 1 min

美团领投月之暗面A轮背后的故事:叶奇意亲历中国两代AI十年人才迁徙

叶奇意(TME)是横跨中国两代AI浪潮的见证者与投资人:在依图做产品经历AI 1.0的四小龙时代,在创新工场尝试做"中国版GPT-2",后在美团龙珠主导领投月之暗面A轮。他详述了追踪杨植麟四个月才加上微信的曲折、A轮时有VC drop后美团顶上的内幕、王兴"创业公司能做超级模型+超级应用的概率很低,但我愿意支持一把"的关键一锤,以及他眼中中国AI从"拼性价比平替"到K3"直接摸SoTA且开源"的质变。

July 31, 2026 · 1 min