当访问网站的主体变成 AI:云栖万网专场,把'官网'从名片改写成获客生意

2026 云栖大会阿里云万网专场(9624 秒官方回放完整转写):机器流量过半的背景下,官网从名片变成"被 AI 提及的信源"。万小智 3.0 从 Web Coding 升级到 Web Business,把 SEO/GEO 诊断、内容创作分发、询盘承接与移动管家串成经营闭环;万网 CLI 把域名/建站/备案交给 Agent,国际站押注品牌出海,AI 邮箱 MCP 化与 ESA 边缘加速补齐沟通与部署基建。圆桌客户给出真实痛点:建站门槛消失后,“被搜到、被 AI 提及"成为新竞争轴。关键数字经外部多源核验,自报口径已标注。

September 23, 2026 · 2 min

把思考变成电:2026 云栖开幕式主论坛的路线图与缺口

2026 云栖大会开幕式主论坛(9314 秒官方回放完整转写)上,吴泳铭给出两个判断:机器思考总量将达人类千倍以上、机器智能时代的代表性产品还没出现,阿里据此押注模型、芯片、AI 云三大基建,目标 2032 年数据中心超 20GW。平头哥发布真武 V900,千问披露 RSI 自我进化与 5–10T 参数规划,荣耀与平安分别给出终端、金融两个落地样本。本文按时间轴完整复盘,关键数字经外部多源核验,厂商自报数据与待核验口径均已标注。

September 23, 2026 · 3 min

攻防进入机器速度之后,防御也只能交给 Agent:云栖2026『模型时代』安全论坛全景复盘

2026 云栖「模型时代:AI 驱动的安全进化」论坛复盘:AI 挖洞让 CVE 冲向历年峰值、有效攻击占比质变,人工防御追不上机器速度。阿里云的答案是全线 Agent 化——代码安全、BAS/ASM、WAAP、SOC、安全运维五条产品线改造,古茗提供实战注脚。CVE 数据、Hugging Face 沙箱逃逸等关键主张已对上公开来源,自报数字分层标注。

September 23, 2026 · 4 min

财务AI跑通月结与付款之后,卡住企业的不再是模型:云栖2026『专业决策,智能执行』财务分论坛全景复盘

2026 云栖财务分论坛复盘:阿里 CFO 徐宏以『有必要做/可以做/值得做』三问给出苹果树框架与提效提质创质三层次;曹勇讲数据、skill、知识三块基建;冯云乐的数字员工跑通采购付款与月结闭环;司为重构经营分析;圆桌辩论紧迫性与 token 账本;程理给出五种方案与四道安全关。核心判断:模型已不是瓶颈,信任基建、人机边界与账本才是。

September 23, 2026 · 4 min

越接近AGI,人类为什么反而开始害怕:一场关于刹车的四方对话

一场直播圆桌把9月的AI安全风暴拆开看:Dario的减速长文为何六天后被自家提前发模型的传闻打脸,300亿美元六个月折旧的商业结构为何让减速成为空谈,而普通人真正害怕的从来不是AGI,而是斩杀线下的饭碗、被切断的思维链和没分到的红利。三位从业者、投资人、教师给出了从"RSI之后人类失去减速资格"到"外太空归AI、地球归人类"的不同答案。

September 23, 2026 · 1 min

【每日AI前沿追踪】2026年09月22日 核心技术与产业动态速递

昨日(9月21日周一)双主线:Agent 基础设施从’生成’转向’可信接地’——蚂蚁 Code2Skill 从开源代码合成百万级验证技能库(SWE-bench Verified 九组全升)、小米+北大 CodeMidas 用纯代码自建 5,545 个 RL 环境(DeepSWE +11.7pp)、AWS+Berkeley 的 SWE-Proof 用形式化证明审计掉 26.8%‘通过测试但没修对’的 patch;评测方法学三连击——next-turn 指标被证明无法预测工作流成功(闭环重放最高仅 10.4%)、τ^τ-bench 揭编码智能体真实客户场景仅过 23.9%、生产 ledger 研究证明 harness 缺陷而非模型能力才是小模型 Agent 首要失败源(transport 36.2% vs capability 17.3%)。产业端 Grok 4.7 打响超级发布周第一枪,Amazon 封禁 Meta Muse 引爆 Agent 生态主权之争,Google 开源 AX 编排器瞄准数十亿并发智能体,Qwen-Image-2.1 与 Step 5 Preview 国产双发。

September 22, 2026 · 7 min

Agent 技能自进化二重奏:EVOLVE 与 GraphSkillEvo 精读

2026年9月同主题连发的两篇论文不约而同地把「Agent 技能库」当作可进化的资产:Adobe+Brown 的 EVOLVE 让冻结模型在真实用户流量中演化 SKILL.md 技能库(Widening/Deepening 两轴 + Matched Replay Gate 保守准入);港城大+NUS+南科大的 GraphSkillEvo 则把技能表示为「全局指导+有向图」,用种群进化(4算子变异/交叉)优化。本文合并精读二者,共用背景与灵感节,逐篇拆解问题定义、解法与评估,并用因果链解释优势根源(保守准入防评分漂移、图结构压缩搜索空间),交叉对照 Reflexion/ExpeL/Voyager/Safe-Policy-Improvement/GEPA 谱系。两文共同指向一条结论:把「改模型权重」换成「改模型身边的自然语言资产」,是一条更稳、更安全、可迁移的持续适应路线。

September 22, 2026 · 5 min

Agent 评测方法学三重奏:Next-Turn 指标为何失灵 精读

本文合并精读三篇同主题论文,剖析「next-turn(单轮/下一步)指标」为何无法可靠预测 Agent 的真实工作能力。A(Dialpad)用五级评测协议链证明:SFT 在金历史评测下让文本轮大幅提升,但闭环工作流成功率最高仅 10.4%、整体裁判 0/77,根源是金历史恢复了正确状态、测的是「响应预测」而非「状态构建」。B(LibreDB)用 8,199 次生产级真机运行与四类失败 taxonomy 证明:75.7% 的损失来自真正调用过工具的 run,而 5 项服务器侧(非模型侧)修复让 6/6 模型同时提升。产业基准 τ²-bench 提供「必须真实」的旁证:最强编码智能体仅过 23.9%。三篇合流结论:Agent 评测必须闭环、必须真实、必须归因到接口层。

September 22, 2026 · 6 min

AI 可信性二重奏:递归评审崩塌与模型测谎仪 精读

两篇同期 arXiv 论文从「内部表征」视角审视 AI 自我监督/递归训练的可信性。A(TrustReviewer)用受控递归实验证明:让后一代评审模型学习前一代的合成评审,会使评分分布与语义多样性单调收窄——「科学判断崩塌」;并提出「语料策展 + 配对激活引导」两阶段干预。B(PIR)把法医学的「 concealed information test(测谎)」移植到激活层,用「题内正确项与干扰项的残差流对比方向」无参考地读出模型隐藏的知识,在 sandbagging、密码锁定、电路熔断等隐瞒场景下识别率 0.70–0.93,而真正遗忘(RMU 擦除)则跌至未知基线。本文按背景、定位、问题、解法、评估、根源、知识反推、灵感八节合并解读,并附外部交叉验证表。

September 22, 2026 · 4 min

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读

CodeMidas(小米 LLM Core 联合北大、港大、人大)提出用源代码作为唯一输入,把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习(RL)环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线,CodeMidas 首次做到五项开发记录全免,覆盖 3,185 个代码库、23 种语言、15 个领域,经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5,在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升(DeepSWE +11.7pp、ProgramBench +17pp)。消融证明「质量>数量」:清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。

September 22, 2026 · 6 min