从繁星到灯塔:当数据耗尽成为时间表,AI 竞争换到了哪条赛道

云栖2026「从繁星到灯塔」数据与评测分论坛全程复盘:七场分享拼出一条主线——人类数据将在2026-2032年间触及上限,合成数据有塌缩与奖励欺骗两大天然短板,模型竞争从拼参数量转向数据资产厚度、闭环转速与评测可信度。文中整理数据飞轮七节点框架、基准设计的科学与艺术、科学/具身两条垂类数据基建,以及"人类数据是RSI锚点"的判断,并给出五条可观察的行业机制链。

September 24, 2026 · 2 min

当AI能跑完整个科研:云栖2026教育科研论坛的跃迁证据与三道裂缝

云栖2026「AI+教育科研」论坛集中给出了AI从辅助工具变成研究执行者的证据:浙大求是引擎在BabyLM挑战赛上与人类团队同榜竞争并登顶,港科大两个博士生用智能体集群24天跑通NPU设计。但同一批讲者也交代了边界——长周期任务成功率仅约三成、物理世界步履维艰、几毛钱的AI作业正在倒逼评价体系改革。本文按论坛实录整理五条主线:自主科研的两条路线、千步推理的评测之困、工程智能的四把尺子、高校的token经济学,以及教育必须先改评价再发工具的反身性焦虑。

September 24, 2026 · 1 min

ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments 精读

AItonomy 基金会联合 Oxford、Berkeley、Stanford 等 25 家机构发布 ScienceIDE:把全球科学代码库(PLUTO、Athena++、MITgcm 等天体物理/等离子体/海洋模拟器)改造成 64 个可执行环境、2,812 个经验证任务、1,076 项数值检查的 Agent 训练基础设施。ScienceIDE-Hard 上 15 个前沿模型横评显示 Claude Fable 5.1 仅 67.1%——科学代码仍是 Agent 洼地;而用验证轨迹 SFT 小模型,修复奖励最多 +33 分且正向迁移到 HumanEvalFix/BBH 等通用基准。本精读拆解『环境即基础设施』的设计哲学与『科学经验 bottleneck』的解法。

September 18, 2026 · 3 min

Never Stop Learning: Continual Learning 与 Self-Iteration 综述精读

深度精读 DeepSeek 研究员陈德里(Deli Chen)的持续学习与自我迭代综述——首个统一 LLM 持续学习与自我改进两大研究方向的全景式综述。从三轴分类法、五大方法族、收敛性定理、多模型实验验证到六大开放挑战,全面拆解这篇47页、151篇参考文献、由 Deli AutoResearch 框架协作完成的重量级研究。

May 31, 2026 · 3 min