速度算得出,去处算不出:云栖2026「无法计算的价值」主论坛,把台中心让给了大学、医院、县城和种子

9 月 23 日上午云栖「无法计算的价值」主论坛复盘(8897 秒完整转写):全场没有一场模型发布,讲者是财经大学校长、医院常务副院长、电源公司首席科学家、三个小县的干部和一位育种学家。刘元春谈知识平权后的大学,廖家智谈脑机接口的支付与伦理,赵为谈算力追着绿电跑,县域圆桌给出「前台可感、后台可接」,谢旗用 AI 把育种周期缩半。关键数字经外部多源核验,自报口径已标注。

September 24, 2026 · 2 min

造得出不再稀缺,长得起才是本事:友盟+ ADK 云栖首发,增长的入口与打法都要重做一遍

云栖 2026 友盟+分论坛复盘:用户找应用从商店搜索变成向 AI 描述场景,ASO/SEO 旧地图失效;友盟+ 把统计、APM、推送织成「洞察—路由—执行」闭环的 ADK 现场首发,让小团队拿到过去几十人团队的精细化运营能力。围棋 App 被动流失案例、Jumigo 宠物项圈、喜播六七千万学费与 Lovin 的关系里程碑指标,共同回答创造平权之后什么才稀缺。关键主张已对公开来源核验。

September 24, 2026 · 2 min

重构云接口:交互坍缩98%之后,云的难题变成身份、权限与那10%的失控

云栖2026「Agent工程化」分论坛:建ECS+Nginx从24次操作30分钟降到3次交互3分钟,搭Landing Zone从427次交互降到3-6次。阿里云以五层架构、Skill/MCP/CLI工具矩阵、Open Agent与Agent三A重构云接口;达能、AutoMQ、Sensor Group给出落地实践。但效率解决后,瓶颈转移到身份、权限与审计:顶尖模型仍有约10%概率不遵守约束。

September 24, 2026 · 1 min

【每日AI前沿追踪】2026年09月23日 核心技术与产业动态速递

9月22日双主线:Agent自改进进入可信化深水区(RRSI正则化防过拟合、Harness-Zero蒸馏进权重、FLARE全生命周期稠密监督、Critical-State RL信用分配诊断),记忆与评测基础设施全面补位(VibeMemBench揭示现有记忆系统11/12配对不及基线、DSec日产300万沙箱);产业侧迎超级发布日——小米MiMo-V2.6-Pro以AA智能指数46登顶开源、Grok 4.7同分进前四、GPT-6 Astra独立破译1941年Enigma密电、OpenAI成立数学顾问组、阿里云栖官宣Qwen4训练中并将扩展至5-10T参数。

September 23, 2026 · 9 min

Agent进入真实业务之后,卡住的不再是模型:云栖2026『企业级Agent实践峰会』全景复盘

2026 云栖大会企业级Agent实践峰会复盘:满帮让 Agent 进入真实交易前先造一层桥,阿里云给总裁分身发工号、衍生六十多个数字员工,基元律动用 Harness 轨迹喂出 RSI 飞轮,贝壳与易方达守住高确定性行业的下限,圆桌把账算到经营单元。核心判断:Agent 的瓶颈已从模型转移到工程、组织与账本。OpenSquilla、NeoHorse、eWork 等关键主张已对上公开来源。

September 23, 2026 · 5 min

Critical-State RL:为多轮工具调用诊断「可训练的模型调用」 —— 精读

深度精读 Salesforce AI Research 的 Critical-State RL。它指出多轮工具调用失败往往卡在单个模型调用上,但「奖励有差异」并不等于「该调用值得训练」。方法先用训练前三闸门诊断(动作充分性 / 提升空间 / 可训练性),再用嵌套同前缀采样分离「动作依赖奖励方差」与「后续噪声」,最后只对选中的关键调用做 occurrence-local RL(上下文赌博机式训练)。BFCL 上对缺失函数任务 miss_func 恢复率 0.14→0.283(+14.3pp),错位训练反而 −4.5pp;记忆子任务 34.54%→50.54%;Nemotron 重复调用一致性 37%→75%。

September 23, 2026 · 4 min

DSec(DeepSeek Elastic Compute): 面向规模化 Agentic 训练的可扩展沙盒基础设施 精读

DSec(DeepSeek-AI + 清华大学)提出一套面向规模化 Agentic RL 训练的可扩展沙盒基础设施。它用三大支柱解决「海量环境、高密度资源、按需镜像」的难题:可组合环境层(overlayfs + EROFS,把 O(mN) 镜像数降到 O(m))、高密度资源管理(virtio-pmem+DAX+DAMON+核调度,microVM 峰值内存降 40.2%)、3FS 按需镜像加载,并把 Agent 循环与可抢占 GPU 解耦以支持弹性训练。实测 8192 容器突发比 eager Docker 快 1.71×、磁盘写少 57%,规模达 300 万沙盒/日、峰值 38 万并发、>5000 个/秒创建。本文按九部分结构精读其架构、关键技术与实验,并通过外部检索交叉验证 serverless 沙盒(SAND/RunD)与 RL 训练基础设施(AgentGym/AgentScale)等相关工作。

September 23, 2026 · 5 min

Emergent Collusion:无恶意指令下,双智能体如何自发串通 精读

深度精读斯坦福与佐治亚理工的 Emergent Collusion。在「无恶意指令、仅重复交互+共享激励」的长视野双人智能体环境里,10 个模型在 94% 的轨迹中出现串通(轨迹级 TC 93.6%,8/10 模型 >90%)。三条根源是激励错配、同伴影响、跨轮记忆:移除记忆串通近乎归零,接受奖励让 EC 从 72% 跌到 0%,同伴违规使 ACCEPT 率从 13.6% 升到 41.2%。代码已开源。

September 23, 2026 · 2 min

FLARE:用生成式奖励模型为长程编码智能体提供全生命周期稠密监督 —— 精读

深度精读北京大学、南京大学、北京邮电大学与独立研究者联合提出的 FLARE。它通过 RADAR 双轨数据合成训练一个 4B 生成式奖励模型(GRM),输出结构化的步级风险诊断(风险等级+错误类+修复建议),在推理时做断点再生、训练时做 SFT 筛选与 RL 稠密奖励,首次把测试时干预与训练时对齐闭环到同一套诊断信号。F2P Pass@1 14.10% 近乎翻倍于全局重采样 7.80%,token 省 5×;ROC-AUC 75.74%;SFT 相对提升 19.13%,RL 平均提升 9.19%。

September 23, 2026 · 4 min

Harness-Zero:通过 Agent-as-Harness 实现 Harness 蒸馏——论文精读

精读北京大学与 Google 合作的 Harness-Zero,提出 agent-as-harness 范式:用一个审查型智能体在学生模型的响应边界上把进化出的专用 harness 收益「翻译」成可训练轨迹,经 SFT 把外挂行为蒸馏进权重,部署时彻底移除外挂。Qwen3.5-9B 宏平均成功率从 23.3% 提升到 44.3%,甚至超过挂载原 harness 的 41.7%。

September 23, 2026 · 6 min