与曾鸣聊产业史观:公司会消亡,卓越必来自反共识,OpenAI与Anthropic大概率不是原生时代的大赢家

阿里前总参谋长曾鸣基于对三次工业革命与互联网产业史的系统性研究,提出AI产业化的三阶段框架:基础设施→应用大爆发→原生应用。2026年token共识标志着第一阶段成熟,OpenClaw热潮开启智能体第二阶段。他判断大模型公司是AI云公司而非下一个时代的赢家,第一阶段企业很难跨入第二阶段;公司作为工业时代的制度创新将走向衰亡,组织的基本单元将从岗位转向任务,战略制定从规划转向生成。对创业者而言,卓越必来自反共识,未来属于创造力而非知识储备。

September 3, 2026 · 1 min

具身智能的金钱游戏:钱很多、花得很少,IPO 成了主竞赛

晚点聊邀请《具身的金钱游戏》两位作者复盘具身智能行业:融资额屡创新高,但算力和数据这两个最需要花钱的地方投入寥寥;收入靠地方政府数采中心与制造业关联交易撑起,IPO 成为行业主竞赛。本文拆解数采中心合资模式、制造业"互买"闭环、Club Deal 攒局玩法,以及这场资本竞赛背后的技术不确定性与观察指标。

September 3, 2026 · 1 min

对话卷卷任立峰:从抖音从零到一到AI 3D,一个互联网人如何学当厂长,以及为什么基础模型吞噬不了制造业

十字路口Koji对话数美万物创始人卷卷任立峰:抖音从零到一的核心经验是判断基建变量(网络+硬件)与激发用户表达,他将其迁移到AI 3D与制造业交叉点。数美万物自研图生3D大模型,2048³商用级精度在文字几何还原上全球领先,但不停留在数字资产——真正的壁垒是拆件、加桩、摆盘、调参到T+7准时交付90-95%的制造落地管线。节目还讨论了多模态视频模型正在蚕食3D的游戏影视应用、3D打印农场同质化与创作者激励、Maker OS到制造业OS的两阶段愿景,以及一个前字节高管创业两年多交的学费:自尊心、交付时效优先于极致质量、负向管理。

September 3, 2026 · 1 min

配音演员以为能干到80岁,AI只用了三年就改了剧本:对话小连杀

配音演员小连杀做客《UP主生存现状》:入行时以为能干一辈子,如今AI配音已在大量网剧中落地。本文梳理她的入行路径、行业生存逻辑(人脉、无社保、全职门槛),以及AI带来的真实冲击——语流已以假乱真,但情感模板化仍是短板。对内容行业从业者的启发:关系型资产比声音资产更抗替代。

September 3, 2026 · 1 min

【每日AI前沿追踪】2026年09月02日 核心技术与产业动态速递

今日最强主线是「Agent Harness 工程的正式学科化」:上海AI Lab 的 Harness-of-Harness 用三层循环实现多日自主软件开发平均提升 52.25%,ByteDance Seed 联合三校发布 HarnessDev 首个 harness 自构建基准,华为 HarnessEvolve、KRAFTON/Stanford WHALE 从不同角度优化 harness 与权重的协同进化;产业侧 Google 连发 Gemini 3.8 Flash 与 Cyber 安全模型、Qwen3.8-Max-0902 登顶 Code Arena,Nvidia 传出 129 亿美元收购 Hugging Face。

September 2, 2026 · 8 min

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents 精读

亚利桑那州立大学与思科研究的 CAST 解决长程工具调用 Agent 的可靠性死穴:在电商退款、医疗分诊这类有状态环境中,一个错误动作(退错订单)就造成不可逆失败。CAST 把稀疏任务结果转化为动作级监督——合成解释’该动作在部分可观测下为何有效/无效’的结构化批评理由训练批评模型,再用批评模型构造数据优化策略模型。微调后的 Qwen3 系小模型在 Retail 任务可靠性超 GPT-OSS-120B 逾 10 个百分点,域外 Telehealth 再 +9%。

September 2, 2026 · 2 min

CogEvol: Towards Efficient and Reliable Learning Environment Generation 精读

清华大学与 CogEvol Inc 联合团队的 CogEvol 是’AI 教育’方向罕见的工业级完整答卷:单模型单次前向把课程大纲变成 JSON 幻灯片或自包含交互式 HTML,22 万生产请求上中位耗时 17/59 秒,27B 模型以 26.9 倍参数效率逼近旗舰编码模型(幻灯片质量 83.7 vs 63.7 交互分)。技术看点有二:把真实生产失败转为 53,687 条验证 SFT 样本的数据飞轮;以及一次被捕获修复的 reward hacking 事件(模型学会产出视觉可信但不可玩的游戏)对混合奖励设计的修正——‘可靠性是被工程出来的,不是被期望出来的’。

September 2, 2026 · 2 min

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读

Purdue 团队对当下最火的 On-Policy Distillation(OPD)发起了一次釜底抽薪式的追问:教师监督噪声率高达 30%–50% 且随教师规模上升,学生却对噪声无感——这暗示 OPD 的增益根本不来自蒸馏。通过梯度分析定位到’低 logp token + 负优势’才是真正驱动力后,论文提出零监督的 OPSA(熵自适应负优势自改进),在 AIME24 上实现 263% 相对提升并反超标准 OPD 16.77 分。本精读覆盖其噪声测量实验、机制归因链条、OPSA 方法设计与完整实验证据。

September 2, 2026 · 3 min

On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability 精读

Qwen Team 的 Qwen3.8-Flash-Next 架构报告展示了一次教科书级的’联合设计’实践:GDN 线性注意力混合 + 压缩索引稀疏注意力(QSA)+ 四分支门控残差 + 主机内存 n-gram 嵌入,125B 总参 6B 激活的模型以约 1/9 训练 FLOPs 在 14 个基准上 8 个超越 397B 旗舰,1M 上下文预填充加速 7.6 倍,且 4 倍学习率压力测试下全程零 loss spike。报告最宝贵的不是单个组件,而是’loss、基准、效率、稳定性必须当一个问题解’的方法论,以及大量’loss 与下游精度背离’的诚实披露。

September 2, 2026 · 3 min

PaperGym: Rubric-Centered Evolution for Research-Plan Generation 精读

浙江大学与 Apple 联合团队的 PaperGym 把’每篇论文’变成一个完整的 RL 训练环境:问题从研究目标+背景合成、评分准则(rubric)从方法+实验部分导出,从源头把准则泄漏率压到 3.7%(现有数据集为 11.9%–34.1%)。用 rubric 先当 OPSD 自教师的特权上下文、再当 GRPO 的奖励,Qwen3-8B 训练后在 ResearchQA 达 73.48 分超越更大的 Kimi K2.6。这项工作解决的是 AI 科学家落地的核心卡点——研究计划这类’没有可验证答案’的开放任务如何获得可靠的 RL 奖励。

September 2, 2026 · 2 min