财务AI跑通月结与付款之后,卡住企业的不再是模型:云栖2026『专业决策,智能执行』财务分论坛全景复盘

2026 云栖财务分论坛复盘:阿里 CFO 徐宏以『有必要做/可以做/值得做』三问给出苹果树框架与提效提质创质三层次;曹勇讲数据、skill、知识三块基建;冯云乐的数字员工跑通采购付款与月结闭环;司为重构经营分析;圆桌辩论紧迫性与 token 账本;程理给出五种方案与四道安全关。核心判断:模型已不是瓶颈,信任基建、人机边界与账本才是。

September 23, 2026 · 4 min

越接近AGI,人类为什么反而开始害怕:一场关于刹车的四方对话

一场直播圆桌把9月的AI安全风暴拆开看:Dario的减速长文为何六天后被自家提前发模型的传闻打脸,300亿美元六个月折旧的商业结构为何让减速成为空谈,而普通人真正害怕的从来不是AGI,而是斩杀线下的饭碗、被切断的思维链和没分到的红利。三位从业者、投资人、教师给出了从"RSI之后人类失去减速资格"到"外太空归AI、地球归人类"的不同答案。

September 23, 2026 · 1 min

【每日AI前沿追踪】2026年09月22日 核心技术与产业动态速递

昨日(9月21日周一)双主线:Agent 基础设施从’生成’转向’可信接地’——蚂蚁 Code2Skill 从开源代码合成百万级验证技能库(SWE-bench Verified 九组全升)、小米+北大 CodeMidas 用纯代码自建 5,545 个 RL 环境(DeepSWE +11.7pp)、AWS+Berkeley 的 SWE-Proof 用形式化证明审计掉 26.8%‘通过测试但没修对’的 patch;评测方法学三连击——next-turn 指标被证明无法预测工作流成功(闭环重放最高仅 10.4%)、τ^τ-bench 揭编码智能体真实客户场景仅过 23.9%、生产 ledger 研究证明 harness 缺陷而非模型能力才是小模型 Agent 首要失败源(transport 36.2% vs capability 17.3%)。产业端 Grok 4.7 打响超级发布周第一枪,Amazon 封禁 Meta Muse 引爆 Agent 生态主权之争,Google 开源 AX 编排器瞄准数十亿并发智能体,Qwen-Image-2.1 与 Step 5 Preview 国产双发。

September 22, 2026 · 7 min

Agent 技能自进化二重奏:EVOLVE 与 GraphSkillEvo 精读

2026年9月同主题连发的两篇论文不约而同地把「Agent 技能库」当作可进化的资产:Adobe+Brown 的 EVOLVE 让冻结模型在真实用户流量中演化 SKILL.md 技能库(Widening/Deepening 两轴 + Matched Replay Gate 保守准入);港城大+NUS+南科大的 GraphSkillEvo 则把技能表示为「全局指导+有向图」,用种群进化(4算子变异/交叉)优化。本文合并精读二者,共用背景与灵感节,逐篇拆解问题定义、解法与评估,并用因果链解释优势根源(保守准入防评分漂移、图结构压缩搜索空间),交叉对照 Reflexion/ExpeL/Voyager/Safe-Policy-Improvement/GEPA 谱系。两文共同指向一条结论:把「改模型权重」换成「改模型身边的自然语言资产」,是一条更稳、更安全、可迁移的持续适应路线。

September 22, 2026 · 5 min

Agent 评测方法学三重奏:Next-Turn 指标为何失灵 精读

本文合并精读三篇同主题论文,剖析「next-turn(单轮/下一步)指标」为何无法可靠预测 Agent 的真实工作能力。A(Dialpad)用五级评测协议链证明:SFT 在金历史评测下让文本轮大幅提升,但闭环工作流成功率最高仅 10.4%、整体裁判 0/77,根源是金历史恢复了正确状态、测的是「响应预测」而非「状态构建」。B(LibreDB)用 8,199 次生产级真机运行与四类失败 taxonomy 证明:75.7% 的损失来自真正调用过工具的 run,而 5 项服务器侧(非模型侧)修复让 6/6 模型同时提升。产业基准 τ²-bench 提供「必须真实」的旁证:最强编码智能体仅过 23.9%。三篇合流结论:Agent 评测必须闭环、必须真实、必须归因到接口层。

September 22, 2026 · 6 min

AI 可信性二重奏:递归评审崩塌与模型测谎仪 精读

两篇同期 arXiv 论文从「内部表征」视角审视 AI 自我监督/递归训练的可信性。A(TrustReviewer)用受控递归实验证明:让后一代评审模型学习前一代的合成评审,会使评分分布与语义多样性单调收窄——「科学判断崩塌」;并提出「语料策展 + 配对激活引导」两阶段干预。B(PIR)把法医学的「 concealed information test(测谎)」移植到激活层,用「题内正确项与干扰项的残差流对比方向」无参考地读出模型隐藏的知识,在 sandbagging、密码锁定、电路熔断等隐瞒场景下识别率 0.70–0.93,而真正遗忘(RMU 擦除)则跌至未知基线。本文按背景、定位、问题、解法、评估、根源、知识反推、灵感八节合并解读,并附外部交叉验证表。

September 22, 2026 · 4 min

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读

CodeMidas(小米 LLM Core 联合北大、港大、人大)提出用源代码作为唯一输入,把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习(RL)环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线,CodeMidas 首次做到五项开发记录全免,覆盖 3,185 个代码库、23 种语言、15 个领域,经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5,在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升(DeepSWE +11.7pp、ProgramBench +17pp)。消融证明「质量>数量」:清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。

September 22, 2026 · 6 min

EvoOntology: A Self-Evolving Ontology Layer for Data Agents 精读

EvoOntology(中国人民大学 ruc-datalab)提出一个面向数据智能体的「自进化本体层」:把数据库的领域概念、字段映射与约束封装成可被 agent 在运行时按需查询的 MCP 服务,并用 builder agent 自动构建初版本体、用「诊断—归因—修补—门控」四步环从失败轨迹中持续进化。本文按九部分结构精读,重点拆解三层架构、四步进化环,以及为何「静态语义层全量注入反而掉分」是全篇最有证明力的实验设计,并从因果链上解释其优势根源。

September 22, 2026 · 5 min

Grounded Skill Synthesis from Code at Scale for Agentic Intelligence 精读

本文精读蚂蚁国际的 Code2Skill:一种从开源代码库大规模合成「接地(grounded)、可验证、可迁移」技能库的全自动流水线。它把 GitHub 上经过人类调试打磨的仓库代码抽象为三粒度技能卡(原子/复合/模式),并用「源码盲重建 + 源码感知裁判 + 仲裁器」的往返验证过滤不可靠记录,最终产出含 1,006,822 条记录的 CodeSkillBank。在 72 组协议匹配评测中 57 组提升、宏平均 +11.7%,并在统一接口下全面超越轨迹派技能库。文章按九部分结构,从 Skill 概念的「岗位操作手册」类比讲起,逐层拆解其问题定义、四阶段解法、实验证据、优势根源与外部交叉验证,并提炼可推广的通用性灵感。

September 22, 2026 · 4 min

RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents 精读

RecreationWorld 由阿里巴巴 Token Hub 提出,围绕「应用复刻」构建五平台可验证环境,训练并评测能融合 GUI 探索与代码实现的混合计算机使用智能体(hybrid CUA)。本文梳理其背景、与 OSWorld/WebArena 的谱系定位、任务抽象、五平台+双通道测试生成+拒绝采样训练的解法、250 任务十模型评测与 OOD 迁移,并深究「为何满分复刻仅 2.8%」及优势根源。

September 22, 2026 · 2 min