当AI能跑完整个科研:云栖2026教育科研论坛的跃迁证据与三道裂缝
云栖2026「AI+教育科研」论坛集中给出了AI从辅助工具变成研究执行者的证据:浙大求是引擎在BabyLM挑战赛上与人类团队同榜竞争并登顶,港科大两个博士生用智能体集群24天跑通NPU设计。但同一批讲者也交代了边界——长周期任务成功率仅约三成、物理世界步履维艰、几毛钱的AI作业正在倒逼评价体系改革。本文按论坛实录整理五条主线:自主科研的两条路线、千步推理的评测之困、工程智能的四把尺子、高校的token经济学,以及教育必须先改评价再发工具的反身性焦虑。