先说结论

2026年9月22日下午,云栖大会「AI+教育科研:智能体时代的创新跃迁」论坛(国博二期609,主持孙梦)把两件事同时摆上了台面。一件事是能力:浙江大学杨怡豪团队发布的「求是引擎」,在国际BabyLM挑战赛的Strict-Small赛道上与人类研究团队同榜竞争,节目称其总分从4.26自主迭代到42.25、位列榜首;香港科技大学谢源实验室用两名博士生加智能体集群,24天跑通了一颗NPU的端到端设计(仿真级)。另一件事是边界:谢源同时给出了基模的三道硬伤——长文档下规则使用严重退化、复杂约束大量违反、长周期工具链任务成功率大约只有30%。能力在跃迁,裂缝也在变大,而教育科研恰好是这两者对冲最激烈的地方:token价格两年降九成八(节目称),学生用几毛钱就能生成一份「还不错的作业」。这场论坛真正的议题不是「AI能做什么」,而是当执行变得便宜、稀缺资源从执行转向提问与验证时,高校的教学、科研和采购制度要怎么跟着改。

一、两条路线:全自动科学家与人机协同的Co-Scientist

谢源(香港科技大学方氏工程学教授,曾任阿里巴巴达摩院杰出工程师,转写口误已按议程校正)用2024年的两座诺贝尔奖开场:物理奖颁给了神经网络奠基者、化学奖颁给了AlphaFold团队——在他看来,这标志着AI不再只是工具,而是「登上了科学的最高殿堂」。他把AI辅助科研分成两条路线。

全自动路线是一个端到端闭环:从提出想法到发表论文全程AI自主。谢源引用谷歌今年上半年发布的ERA系统(节目称)作为代表——它把科研探索建模成树搜索,大模型调用代码沙盒,在语义层理解代码、按论文思路重写算法,七天二十四小时把手动试错变成自动全局搜索。它的优势是规模和速度,前提是任务必须有明确的质量分数可以自动打分;它做不了从零开始的因果机制推导,湿实验室(wet lab)操作更是无从谈起。

人机协同路线(Co-Scientist)则是结构化的多智能体方法论:一组智能体生成研究想法,一组扮演同行评议的「反思者」批判正确性与新颖性,一组用国际象棋式的Elo竞赛机制做质量排序——谢源称算力越强,Elo排序性能近线性增长。谷歌用Gemini当合作者的实验、西湖大学的Deep Scientist工作(均为节目引用)被视作这条路线成立的证据。两条路线不对立:借用自动驾驶的类比,2020到2022年的AI是L1/L2级的搜索引擎和代码补全,2023年至今是「研究助手」,当前正处在「协作科学家」的L4阶段,而端到端的「全自动AI科学家」属于L5,只要任务可打分,已经能做得非常好。

落到工程上,谢源的判断是:自动科研的最小闭环需要三个条件——问题可操作、反馈可执行、结论有证据(保留基线、失败案例和独立评价集);人负责研究方向、约束定义、异常判断和最终接受。他的实验室部署了64块H20 GPU支撑这套闭环。两个案例给出了量级感:其一,「悟空」NPU设计中架构顶层(低精度算力配比、高低精度分离式架构)仍由人类架构师决定,「垒砖糊水泥」的实现与验证交给智能体,两名博士生花24天、7.4 billion token、生成17万行代码跑通端到端流程,芯片面积优化到未优化前的三分之一——谢源用作对比的是,他本人在平头哥经历过的第一颗AI芯片约百人一年、真武810约三百人两年。其二是CPU prefetch:用离线智能体分析代码模式、指导在线硬件,以极小开销实现10%到20%的性能提升,并通过智能体的设计空间探索把性能推到约61%(节目称,仿真验证阶段)。

但谢源没有回避反面:三道硬伤决定了当前用AI做科研的上限。对教育,他的结论是训练方式必须重写——不再教学生单独读论文写代码,而是围绕科研闭环训练:学会提出可验证的问题(「提出问题比解决问题可能更重要」)、明确假设/基线/指标/资源预算/失效判据、组织智能体完成一轮轮实验,最后靠实验复现、消融分析和口头答辩确认学生真的理解结果。「你不能让AI帮你产生了一篇论文,学生自己并不知道发生了什么——这不是科研训练。」

二、求是引擎:千步推理赢了什么,评测还差什么

浙江大学杨怡豪(信电学院百人计划研究员)的开场区分很关键:科学研究任务与大多数AI agent任务不同——没有标准答案,也没有预设路线,研究者要在未知空间里不断提出假设、获取证据、修正方向。据此他列出能做科研的AI系统的五个要素:千步级长程能力(人类科研动辄数月数年、上万步推理)、动态探索(发现不对要能回退改道)、持续记忆(研究几小时后不能忘记验证过什么)、回归证据(经得起理论/计算/实验检验)、全程可追溯。

求是引擎的五个设计对应这五要素:多模型协同以降低单一模型的同质性偏差;多组智能体分工(分析/规划/执行/评价),因为上百步之后单组智能体会「信息饱和」;全局记忆记住全部研究历史;支撑长程任务的runtime(状态持久化、任务调度、故障恢复);证据和工具持续进入研究循环。阿里云提供了技术支持。

两个案例给出实证。其一是真实光学平台:只给研究目标、相关文献和平台信息,不给路线,系统自主完成文献检索、想法提出、理论、仿真、实验,在四个发散方向中主动收敛到一个,自主发现并实验验证了一种全新的光计算机制——通过相干光的散射过程计算Transformer attention中的重要算子双线性交互(转写原文为「相关光双双线性交互机制」,疑有识别误差),为高速低能耗光计算提供新路径;全程约八成token花在研究本身,只有一到两成用于写论文报告。其二是BabyLM挑战赛(转写误作「VBM挑战赛」,已校正)的Strict-Small赛道——这项由MIT、ETH等国际高校组织的比赛(已外部核实其存在与赛道设置)把训练数据严格限制在一千万token,研究如何在极小数据约束下提升模型能力。求是引擎在同一规则下与人类AI研究团队竞争:120小时、消耗26亿token、一万多次模型调用、一万多次工具调用、完成九项公开评测,总分从4.26提升到42.25,杨怡豪称其位列总榜第一,「与该领域最顶尖的人类专家去竞争,从某种意义来讲已属于超级人工智能的范畴」。论坛当天上午九点起,团队还直播求是引擎求解「吻接数」(一个球周围能相切多少个球,牛顿研究过、多数维度未解决的三百多年老问题,转写误作「稳接数」)问题,到下午已找到五项全新世界纪录(节目称)。

在Allen Institute for AI的AstaBench评测(已外部核实,含端到端科研的E2E-Bench子项)上,求是引擎采用国产基模DeepSeek,总分81.59位列第一(节目称),把从头到尾做通任务的比例从此前的约3%提升到约10%。但杨怡豪随即自我设限:这类基准离「能测量真正解决重要科学问题的能力」还很远。他主张的评测至少要覆盖三层——长程研究能力(能否研究上百步上千步、失败能否回退、能否区分真实推进与无效探索)、研究过程质量(决策是否被新证据驱动、轨迹可否追溯复现)、研究结果评价(最难,因为科学问题没有现成验证器,验证方法本身需要重新设计,须靠理论、计算、实验和专家审核形成多层验证链)。

更长远的影响在问题空间本身:AI天生掌握跨领域知识、可不知疲倦地大规模并行探索,过去因知识跨度大、周期长而难以研究的问题变得可行——跨尺度问题(微观牛顿力学到宏观流体方程的严格连接,杨怡豪提到菲尔兹奖得主邓煜的贡献,但一般情形仍未解决)、跨领域问题(「大模型物理学」「大模型认知科学」,研究next token prediction为何涌现推理与科研能力),以及既跨尺度又跨领域的「最具想象力的空间」。科研分工因此重写:人类科学家定义问题、判断价值、划定边界,AI执行研究过程,人类做独立验证——「未来科研中真正稀缺的资源,可能不再是研究执行,而是提出好问题和做可靠验证。」论坛同期,浙大联合阿里云启动了国内首个以AI自主科研为核心的「Agentic Science开放合作计划」(转写误作AIGC,已校正),面向高校与科研机构征集高价值、高开放度、可检验的科学问题。

三、物理世界的深水区:工程智能用四把尺子量范式变革

同济大学工程智能研究院执行院长华先胜(转写误作「华新胜」,已按议程校正)的切入点是数字世界与物理世界的不对称:AI在数字世界强大到让数学家紧张——他提到四十二位菲尔兹奖得主联名要求规范AI在数学领域的应用(节目称)——但让机器人去没去过的店里买杯咖啡,十岁小孩轻松完成的事它基本无能为力。从通用人工智能、科学智能到真正作用于建造、制造、交通、能源的物理工程,中间缺的一环,他称之为工程智能(AI for Engineering):不仅用数据,还要融合物理世界规律;不仅覆盖边角场景,还要进入工程全生命周期的核心;不仅AI专家能用,还要以平台化、系统化的方式让每个工程领域的人都能用——「就像今天每个领域的人都能自己写PPT」。

他给这个领域划了三个递进层次:工程+智能(用现成AI解决单点问题)→工程智能(为解工程难题研发新理论新方法,成为一个学科)→工程智能系统(批量化解决,人人可用)。难以进入核心的两大坑,被他半开玩笑地戳破:小模型时代的问题是「做产业的人不懂AI,做AI的人不懂产业」,大模型时代新增了更严重的问题——「做AI的人觉得自己懂了产业,做产业的人觉得自己懂了AI」;隔行如隔山,没有五到十年功底很难说懂一个领域。与AI for Science的本质区别在于容错:科学实验成功一次即可,工程必须万无一失。因此他的方案是工程世界模型(全域多模态、真实时空参与计算、物理规律与工程和经济约束、模型对自身边界的自我觉知)加上共生共创的智能体系统(跨越虚实、人在回路、多智能体协同),再加上人机互信机制——把「信任」变成可度量的量,定义信任损失函数并纳入多目标优化;他甚至预言AI智能体要像工程师一样「考级」认证。研究院已产出AI4E Arimas全栈工程中枢、号称首个工程大模型评测基准的AI4E Arena、把数小时仿真分析压缩到分钟级的NewMac等成果(节目称),同济也成立了世界上第一个工程智能研究院(已外部核实)。华先胜给「范式变革」定了四把尺子:领域AI技术研究的规模化、学科自身创新的规模化、复合人才培养的规模化、产业落地的规模化——最后一把是「照妖镜」,「不是做个标杆、样板、PR,而是让AI从先进技术变成新质生产力」。论坛现场,同济工程智能研究院与阿里云完成合作签约。

四、token经济学:高校从买设备转向买词元

阿里云架构师曲振斌与北京大学计算中心樊春、东南大学胡轶宁的两场分享,拼出了高校侧的真实账本。

曲振斌先讲趋势:过去一年基模从「摸高」转向实用,围绕自主进化、持久记忆、自主拆解演进(他点名千问3.8、Claude 4.6、Gemini 5.1,节目称);他展示的例子里,一个基模在无人干预下自主开发应用、自行注册GitHub发布、根据用户评论迭代,跑了近十六天完成151项闭环任务(节目称)。工程范式是叠加而非替换:RAG仍统治政策法规场景,流程编排智能体统治企业流程,自进化agent统治日常办公。模型同时变得更大(节目称DeepSeek V4为1.6T参数、千问3.8为2.4T、GPT6约10T;10T模型光装进机器就要九到十台、约三千万成本)和更小(蒸馏后的27B在部分任务如图生代码可对抗2.8T的模型,节目称)——「江山代有模型出,各领风骚数十天」。这直接推导出token/MaaS经济的必然性:自建算力、数据、算法的项目,「立项完就已经过时了」。

樊春的账本更直白。他引用的统计称中国日均token调用量三月约一百四十万亿、六月约五百万亿(节目引),同款模型两年降价约98%、大约每天降1%——「学校自己部署的模型,不可能做到每天降价百分之一」。北大的实践:三十多人的团队日均词元调用约一百五十亿次(人均约五亿),接入四十五个模型、哪家性价比高用哪家,新模型次日上线;一百六十多套业务系统用AI辅助重构,典型如校园卡系统新代码量只有原来的三分之一;安全攻防团队重点时期人均一天消耗约四十亿token(均为节目称)。采购逻辑随之改变:从买设备到买资源,尽可能用云端而不是自己生产算力。但敏感数据是例外——樊春点名Anthropic披露客户使用记录的事件「丧失了道德底线」,并称国内厂商的官方调用也存在向第三方算力中转的现实,因此北大保留约15%的本地词元服务。他给同行的建议是一个框架:建一本账(校级统一接入、按量结算)、分级部署(可出域的向市场多供应商采购,不可出域的本地生成全流程留痕)、开放合作(北大与阿里云已有Coder Credit合作并计划扩展)、参与计量接口与安全标准制定——「标准是定价权的前置条件」。

东南大学胡轶宁补上落地视角。他判断2026下半年到2027年的主题是应用真正进入生产生活,而落地要先过五问:数据接进来了吗、AI完成任务所需的材料给全了吗(不给它就可能编)、它理解业务流程吗、每句话有依据吗、用户反馈能改进系统吗。学科大模型的老路——微调14B/30B/72B,到235B/397B「调不动了」就挂RAG——在他看来正是问数类应用效果差的根源:「27B在很多场景下能力其实是够的,问题是没深入适配场景。」他把数据拆成实时业务数据和知识(固化的准则标准+藏有专家经验的案例),并强调算力、算法、数据三者必须解耦,否则「上线即落后」。东南的ICU大模型智能体经历了从「没什么人用」到「限制大家使用」的转变——医生要的是报告精简、别开思考模式(太慢)、按轻重缓急重排条目;学校则用英伟达、华为、阿里PPU(810)构成异构算力,以千问系列为垂直模型基座,十五五信息化规划的表述只有一句话:把所有业务系统全部AI化。值得一提的还有他观察到的组织事实:东南不少AI应用是学生在参与甚至主导开发,学校的角色是「提供弹药」——算力、token和指导。

五、评价体系要先于工具:教育的反身性焦虑

论坛最清醒的一段来自曲振斌的主动「泼冷水」。他请听众想象:一个科研作业,学生花八小时认真完成可能拿不到高分,交给AI只花几毛钱、十几分钟就生成「还不错的作业」——学生会选哪条路?如果所有任务都这样执行,独立判断和逻辑分析能力会退化,「真知灼见来自于试错」的通道被关闭,长期将出现认知思维退化、创造能力空心化和新的学术诚信问题。他的对策分两层:短期明确「哪些事情该给AI、哪些压根不应该给」;长期则要改教学目标——从知识传递转向思维培养和人机协作体系培养,并用过程性评价、口头答辩确保学生「向内而求」。这与谢源的口头答辩主张、杨怡豪「人类负责定义问题和验证」的分工判断,构成了三位讲者不约而同的结论:工具普及时,评价体系必须先行改革。

发布环节因此有了清晰的逻辑。千问办公推出面向高校和中小学的「AI灯塔校计划」(对外报道称「AI教育灯塔计划」),向合作学校捐赠算力积分,上线两周已有一百多家教育单位加入(已外部核实);首批六所高校(北大、复旦、浙大、同济、东南、南开)和六个区域教育局代表上台启动。华中师范大学、中南民族大学与阿里云签署全面合作协议;千问办公与超星数字图书馆发布生态合作——用主持人的话说,图书馆这个「大学知识基础设施」里的馆藏资源与智能体能力连接后,知识不再只是被保存和检索,而能主动参与学习、研究和协作。再往前追溯,阿里云的「云工开物」计划四年走进三千多所学校、给一百四十多万学生带去免费算力(节目称)——普惠算力进校园的管道已经铺好,这反而让评价改革更加紧迫。

结语:三个值得盯住的观察指标

把这场论坛压缩成机制链,大致是三条。第一,基模可用性跃迁叠加token价格崩塌,推动高校从CapEx(买设备建机房)转向OpEx(买词元立账本),二阶影响是信息化部门职能迁移(从保运行到育生态)、采购财务制度滞后和敏感数据本地化的刚性需求——观察指标是教育行业token计量、结算与安全标准的制定权归属。第二,Agentic长程化让「一人指挥上百智能体」成为可能,科研人力结构向定义问题、写约束、审结论倾斜——观察指标是长周期任务成功率(谢源称约30%)能否爬升、千步级评测基准与Agentic Science计划征集到的问题质量。第三,数字世界与物理世界的能力不对称催生工程智能补位,受益方是获得自助工具的领域专家,受压方是只会单点微调加挂RAG的团队——观察指标是华先胜的四把尺子,尤其是产业落地这面「照妖镜」。

对读者而言,可迁移的判断也许是这三条:其一,凡是「问题可打分、反馈可执行、结论有证据」的研究任务,现在就应该认真实验智能体集群,因为成本曲线已经越过临界点;其二,凡是涉及物理世界、不可试错的场景,先问「进没进入核心流程、能不能平台化规模化」,再决定投入;其三,教育管理者的当务之急不是采购更多工具,而是把「哪些任务禁止交给AI」写成清单,并把口头答辩和过程性评价制度化——否则普惠算力铺得越快,认知外包就越深。论坛结尾主持人的话是得体的收束:技术无论如何更迭,最终都要回到教育与科研的原点——尊重人的好奇,拓展人的能力,支持人的成长。


信源与体例说明:本文依据云栖大会2026「AI+教育科研:智能体时代的创新跃迁」论坛现场转写整理(转写全文10159秒已完整核读),讲者身份按官方议程校正,共修正ASR识别错误16处(人名如刘湘雯、谢源、华先胜、杨怡豪、胡轶宁、邓煜,术语如BabyLM Challenge、AstaBench、吻接数、Agentic Science、千问办公、词元等)。文中外部可查事实(谢源/华先胜/杨怡豪任职、同济工程智能研究院、求是引擎发布、AstaBench、真武系列芯片、达摩院146病征医疗影像模型、AI教育灯塔计划、邓煜菲尔兹奖工作、BabyLM赛道设置)已用公开来源交叉核验共9项;其余数字与案例均为现场陈述,以「节目称/嘉宾认为」标注归属,未作独立背书。