Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows 精读

AI 金融分析师能从 10 万 token 的年报里逐字背出契约阈值,但这条风险披露真的影响它的投资判断吗?Boston College 与 Columbia 商学院团队用固定信息集设计发现:随着无关上下文从 2K 扩到 128K token,一条风险披露对卖出倾向的影响从 +0.032 跌入实验噪声地板,而直接检索保持 12/12 公司满分——“读到了“与“用上了“彻底分离。机制实验定位到两条传输通道:固定容量的运行摘要与注意力查找,均随长度稀释。工作流实验给出解法:extract-then-decide 把 128K 下的影响保留率从 12% 提到 67%,而通用分块摘要在所有长度(含 2K)都将影响归零。核心教训:检索式评估会认证一套“证明了读得到、实际上不用“的判断系统。

August 27, 2026 · 3 min

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents 精读

AWS Agentic AI团队用58,000次agent运行、200万次API调用、360亿token的系统实验,测量了coding agent中途切换模型的隐性代价——Handoff Tax。核心发现呈方向二重性:升级(便宜模型→贵模型)时Raw全轨迹移交只恢复不到一半质量差距且成本可达LC的4-6倍,Claude家族下甚至被’弃用重启’严格支配;降级(贵模型→便宜模型)却是甜点区,保住大部分质量同时省下大头成本。最有工程价值的是接口反转现象:升级时应丢弃前模型的轨迹只留代码改动,降级时恰恰相反。本文从实验设计讲到成本机制分解,给出模型切换策略的实操建议。

August 27, 2026 · 2 min

领读Kimi K3技术报告:一个清华架构博士眼中的注意力谱系与「有效scaling」

一集面向技术读者的Kimi K3技术报告领读播客,嘉宾孙宇涛(清华计算机系博士生、上海创智学院pre-doc,研究方向LLM架构与预训练)从K3出发串联起十多篇前作,把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加,讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design,MLA+QK-norm式门控的稳定性逻辑,Latent MoE对通信开销的削减,以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推;后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论:大模型架构没有本质创新了,K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率,而把size做work才是真创新。

August 26, 2026 · 1 min

Apodex 1.1 姊妹篇补遗:本日精读系列导览与 2026-08-25 学术全景

本文为 2026-08-25 精读系列的导览:16 篇触发顶会标准精读的论文横跨 Agent 评测反作弊、Harness 可学习化、经验资产化、因果测量方法学四大主题。本文给出全部精读的索引、跨论文趋势综合(verifier-grounded 成为共同底座、评测从’分数多高’转向’分数测的是什么’、产学研从联合发文转向资产+方法学互换),以及按读者角色(研究者/工程师/管理者)的阅读路线图。

August 25, 2026 · 1 min

Apodex 1.1: Scaling Agentic Intelligence for Complex Work 精读

Apodex 1.1(Apodex Team)提出’双扩展面’范式:把任务环境构建(Environment Scaling)与多智能体协调(Agentic Coordination Scaling)确立为与模型规模并列的两个扩展维度。Agent Team 架构把任务分解、异步委派、非对称验证、重规划训练进模型策略,在 GDPVal 拿到 78.8 win rate、IMO-2026 数学超金牌线、SWE-bench Verified 77.7%,且全部开源(含 35B mini 版权重)。本精读重点拆解其’正向便宜、逆向昂贵’的验证器设计与 Agent Team 协调增益的机制来源。

August 25, 2026 · 2 min

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks 精读

MobilePA-Bench(阿里巴巴通义 MAI Team)填补了移动端 Agent 评测的中间地带:不是像素级 GUI 操作、也不是离线函数调用,而是’有状态沙箱里的中央规划器’——212 个真实工具×13 领域的活数据库沙箱,原生注入权限阻断/缺参/实体歧义等环境摩擦,并把子 Agent 协作、个性化记忆、技能加载设为三维能力门。1705 个任务上 13 个前沿模型最高只有 75.52%(Claude-Opus-5),且各维度冠军分散在 4 个不同模型——移动端没有全能规划器,Memory 维度全员不及格(最高 64.63%)。

August 25, 2026 · 1 min

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? 精读

SWE Refactor Bench(Naver’s Lab × Einsia.AI × 清华)命名并防御了行为评测的 Blindness 盲区:迁移任务的起点测试本来就全绿,‘原样交回’的空 diff 可以骗过任何行为测试。该基准用 20 个真实开源项目(86.7 万行代码)+ 三阶段协议(迁移审计否决门 + 130,118 条固定检查 + 6 个对抗验证 Agent)证明:8 个前沿模型 520 个 run 中仅 5.4% 通过全部关卡,最强 claude-opus-5 也只拿 47/100——‘迁移完成’与’行为保持’是两种独立能力。

August 25, 2026 · 2 min

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 精读

Task-CoEvolve(东京大学)把 harness 优化中被忽视的’评估侧’变成优化变量:每次迭代在哪些验证任务上评估候选 harness?方差加权采样把预算集中到’候选结果会分歧’的判别性任务上(>70% 的任务池处于全对/全错两个极端、毫无判别力且分布随优化漂移),配 Horvitz-Thompson 式包含概率校正消除子集偏差。结果:20% 评估预算匹配全量搜索(49.3% vs 48.6%),Terminal-Bench 2.1 上 token 评估成本直降 80%,7% 预算用 1/16 样本逼近全量。

August 25, 2026 · 1 min

两天十万Star:DeepSeek Harness 的开放逻辑,与它想要驯服的模型-脚手架-算力飞轮

围绕 DeepSeek Harness 发布后两天破十万 Star 的现象,三位从业者从「一切皆插件」的架构设计、模型与 Harness 的深度协同、极简模式与缓存命中率的技术原理,聊到程序员岗位转型、开源生态与国产算力差距。核心判断:Harness 是 AI 时代的脚手架,插件化+开源让社区共建成本降到极低,模型与脚手架会互相塑造,而程序员的护城河正从写代码转向定义需求与验收结果。

August 24, 2026 · 2 min

One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读

微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准:507 个政策条件化的有状态业务工作流,覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域,用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%,pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%,暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟;79,853 次失败试验中 80.88% 干净终止且含写操作,证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。

August 23, 2026 · 7 min