领读Kimi K3技术报告:一个清华架构博士眼中的注意力谱系与「有效scaling」

一集面向技术读者的Kimi K3技术报告领读播客,嘉宾孙宇涛(清华计算机系博士生、上海创智学院pre-doc,研究方向LLM架构与预训练)从K3出发串联起十多篇前作,把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加,讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design,MLA+QK-norm式门控的稳定性逻辑,Latent MoE对通信开销的削减,以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推;后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论:大模型架构没有本质创新了,K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率,而把size做work才是真创新。

August 26, 2026 · 1 min

Active Inference as Context Acquisition for AI Agents 精读

深度精读 arXiv 2608.19202——把 Agent 的上下文获取(澄清提问、检索、工具调用、提示试验)形式化为主动推理:内层更新对潜在任务状态的信念,外层在上下文动作、任务动作与停止动作之间做选择,最小化包含风险、认知价值与成本的期望自由能。论文推出 OQA 基准,把提问变成属性表上的二十问游戏,用动态规划给出最优 oracle;七个前沿模型全部落后于 oracle。在提示补全实验中,定向澄清把验证器合规率从 0.0417 提升到 0.375,最佳设定 ε*=0.01、K*max=2。核心主张:主动推理是模型无关的上下文获取层设计原则。

August 25, 2026 · 4 min

AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale 精读

深度精读 Meridian Intelligence 与 UMass Amherst 合作的 AgentMercury 论文——从高层业务场景合成 4,783 个可执行业务环境的框架。文章拆解其世界与任务分离设计、PLANET 构造流程与确定性 SQL 验证机制,解读 Qwen3.5-4B 在 EnterpriseOps-Gym 提升 27.6%、AIME26 提升 10.1 分的域外迁移证据,以及构造轨迹微调让环境作者成功率从 3.3% 跃升至 83.3% 的闭环实验,回答一个核心问题:出题人本身能否被训练出题。

August 25, 2026 · 4 min

Apodex 1.1 姊妹篇补遗:本日精读系列导览与 2026-08-25 学术全景

本文为 2026-08-25 精读系列的导览:16 篇触发顶会标准精读的论文横跨 Agent 评测反作弊、Harness 可学习化、经验资产化、因果测量方法学四大主题。本文给出全部精读的索引、跨论文趋势综合(verifier-grounded 成为共同底座、评测从’分数多高’转向’分数测的是什么’、产学研从联合发文转向资产+方法学互换),以及按读者角色(研究者/工程师/管理者)的阅读路线图。

August 25, 2026 · 1 min

Apodex 1.1: Scaling Agentic Intelligence for Complex Work 精读

Apodex 1.1(Apodex Team)提出’双扩展面’范式:把任务环境构建(Environment Scaling)与多智能体协调(Agentic Coordination Scaling)确立为与模型规模并列的两个扩展维度。Agent Team 架构把任务分解、异步委派、非对称验证、重规划训练进模型策略,在 GDPVal 拿到 78.8 win rate、IMO-2026 数学超金牌线、SWE-bench Verified 77.7%,且全部开源(含 35B mini 版权重)。本精读重点拆解其’正向便宜、逆向昂贵’的验证器设计与 Agent Team 协调增益的机制来源。

August 25, 2026 · 2 min

AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification 精读

深度精读 AMD 与南方科技大学合作的 arXiv 2026 论文 AsmEvo:当 GPU 内核源码不可得、部署二进制是唯一行为基准时,用智能体直接在汇编级优化已编译的 AMDGPU code object。恢复可重汇编表示、profiling 定位热窗编辑、ABI 保持重建、差分验证门控接受,在 MI308X 上让 30 个 KernelBench 内核中的 29 个提速,几何均值 1.35 倍、最大 3.88 倍;MI300X 生产负载(AITer、vLLM、SGLang)全部提升且全程保持功能等价。

August 25, 2026 · 4 min

AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization 精读

深度精读 AUSO 论文——中科大 × UNSW × 国科大 × 西交利物浦跨国合作提出的动作级统一技能优化框架。从技能角色随策略演化而变化的洞察出发,拆解任务级路由的噪声困境与轨迹内技能效应异质性问题,详解三阶段渐进优化(师从内化 → 结果探索 → 双上下文动作级利用)、JSD 信息增益信号与不确定性门控的设计逻辑,结合 ALFWorld / WebShop / SearchQA 三基准与五组件消融的证据链,反推出干预粒度下沉、生命周期感知训练、双上下文自对照三条通用性灵感。

August 25, 2026 · 4 min

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces 精读

AutoSaddler(Microsoft × POSTECH × KAIST × 南方科技大学)把 Agent harness(提示词/工具/中间件)的优化形式化为离线 mini-batch 学习问题:深度诊断 Agent 读执行轨迹定位根因、生成结构化 patch(Prompt/Tool/Middleware 三类九子型)、Reflection 提炼经验存入 EvoDAG 进化图、泛化感知选择防过拟合。GAIA2 +9.0pp、SWE-Bench Pro +9.6pp、Terminal-Bench 2.0 +10.0pp 全面超越人工与自动基线,且学习轨迹只需最强基线的 1/10。

August 25, 2026 · 2 min

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis 精读

深度精读港中深与西安交大团队的微服务根因分析(RCA)轨迹级研究。指出现有评测只看“是否定位到责任服务”的终点指标,无法揭示诊断证据与故障传播路径。作者人工标注服务级故障传播路径,对齐分析3500条智能体诊断轨迹,发现答案正确性与诊断质量脱节,并将错误诊断归结为三类证据处理失败,进而设计DIAGGUARD两段防御(前置grounding+后置verification),在跨模型、跨基准、跨拓扑的独立验证集上把Acc@1从43.5%提升到52.5%。

August 25, 2026 · 3 min

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (ERPO) 精读

ERPO(阿里 AMAP × 西安交大 × 京东 × 北师大 × NUS 五机构产学研)重新定位了 LLM 强化学习训练崩溃的根源:不是策略(动作)分布漂移,而是策略诱导的查询分布漂移改变了有效训练环境。它把 KL 正则化从动作侧移到输入侧,Query-KL 的梯度严格不流经响应分布,从而在不牺牲探索的前提下根治高温解码崩溃——32B 模型在 T=1.5 下 GRPO 只剩 25.2%,ERPO 保持 80.8%。

August 25, 2026 · 2 min