A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption 精读

深度精读 Stanford + CMU + Grid Dynamics 的 ASE 2026 论文:提出 RAMP 四级仓库 AI 成熟度标度(基于团队 commit 到版本库的 AI 配置工件而非问卷),对 509 个采用 coding agent 的仓库分层再分析——agent 在各成熟度层都加速开发(+28~38% commits),但质量代价分化:无配置仓库的认知复杂度增幅约为有配置仓库的 2 倍(+53% vs +27%)。

August 27, 2026 · 3 min

A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation 精读

用 LLM 当评委(LLM-as-a-Judge)已是 AI 评估的通用做法,但一个根本问题从未被检验过:当被测内容真的变了,评委的判分会跟着变吗?华南理工与澳门大学团队借用心理测量学的’构念效度’框架,提出评委必须同时满足两条件——构念保持的编辑下判分不变(不变性 S)、最小构念改变编辑下判分必变(敏感性 R)。实测 7 个评委 × 4 个领域发现:匹配不变性 S=0.945 时敏感性仅 R=0.319,最强评委仍漏掉五分之二的构念变化;且评委对’声明的覆盖范围扩大’敏感、对’承诺强度提高’近乎失明(+0.121 差距,7/7 评委同号)。论文还证明现有评估标签集本身可被只看表面形式的预测器恢复 55%-67%——尺子先漏了。

August 27, 2026 · 4 min

Adaptive Influence Graphs for Failure Attribution in Multi-Agent Systems 精读

多智能体 LLM 系统跑失败了,到底该怪哪个 Agent、哪一步?AWS Agentic AI 与特拉维夫大学提出的自适应影响图(AIG)给出的答案是:这不是模型不够聪明的问题,而是接口设计的问题。论文把人类工程师调试系统的’可观测性’范式搬给 LLM——先用 agentic builder 把失败的原始日志构造成带继承边的影响图,再用 agentic reader 沿边回溯定位首个错误。在 Who&When 基准上,同一模型仅靠改善轨迹表示就从 46.40% 提升到 55.20% 的步骤定位准确率,刷新 SOTA。本精读将拆解其四级接口阶梯、两阶段框架与增益根源。

August 27, 2026 · 4 min

Adaptive Triggering for Bias Correction in LLM Reasoning 精读

亚利桑那州立大学团队把「推理过程中何时注入反偏见干预」形式化为在线变点检测问题:每步计算一个偏见风险信号,喂入 CUSUM 统计量,仅当累积证据越过校准阈值时才注入定向反思提示。黑盒版(LLM 裁判打分)在 gpt-4o-mini 上以 0.33 次/题的干预频率恢复了固定周期干预损失的大部分消歧准确率(90.1% vs 82.9%),独立裁判下仍成立。白盒版(next-token 概率信号)在全部六个开源模型上提升歧义项准确率、却在五个模型上损害消歧项——它无法区分「依赖刻板印象」与「恰好与刻板印象一致的正当证据」,证明再好的触发时机也救不了错位的信号。论文还修复了 BBQ 基准四处未记录的标签匹配不一致,并指出「未完成率」是被误当准确率损失的一种独立干预代价。

August 27, 2026 · 3 min

Agentic Autoresearch for Cell-Edge Power Control 精读

深度精读 Ericsson + 多伦多大学论文:把学习型无线资源管理算法的全部五层设计权(架构/输入表示/输出参数化/损失函数/任务采样)交给自主 agent,在强 NP-hard 的多小区 SLqP 功率控制上,81 个无人值守实验、26 小时内达到最强已知基准的 99.5%、推理成本约 600 倍 lower,并精确恢复了经典 max-min 结构。

August 27, 2026 · 3 min

AI在想什么:模型没说出口的推理,与可解释性唯一一次漂亮的兑现

斯坦福博士生、语言学科班出身的 Aryaman Arora 做客硅谷101视频播客谈大模型可解释性:Anthropic 的 J-space 实验证明模型内部存在从未说出口的推理概念,且可被直接编辑——内部把"蜘蛛"改成"蚂蚁",答案就从八条腿变成六条腿;思维链有用但不等于模型的真实内部过程;SAE 与因果干预两大流派各有硬限制,学术界的转向向量控制几乎全线失灵,工程实践仍回归重训;该领域至今最漂亮的兑现是归纳头的发现救活了状态空间模型谱系(H3→Mamba→DeltaNet,直至 Kimi/Qwen 的混合架构);Transluce 的用户建模显示模型面对 AI 安全研究员时会显著更谨慎;可解释性天然双刃,但嘉宾判断它离危险阈值还很远。

August 27, 2026 · 2 min

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence 精读

深度精读 ISSTA 2026 的 EAVA 论文——浙江大学与华为(加拿大)合作提出的自动化软件漏洞评估框架。针对现有方法「只给答案不给证据、无法处理截图与长代码、忽略项目上下文」三大缺陷,EAVA 用三个专用 LLM Agent 预处理富文本、用「开卷反推」构造 51,568 个推理轨迹标注(专家抽检 97.8% 合格)、SFT+GRPO 两阶段训练专用 8B 评估模型。在新收集的 6,446 份漏洞报告数据集上,平均 F1 0.874 / MCC 0.646,比最强基线 proEVA 高 5.3%/18.7%;用户研究中 96.8% 的证据被安全专家评为有用。本文拆解「开卷标注→闭卷推理」这一数据构造范式的完整机制。

August 27, 2026 · 5 min

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs 精读

Agent 流水线的推理成本随上下文累积而飙升,压缩输入省钱却伤精度,而投机解码(SD)受制于「drafter 与 verifier 必须读同一份上下文」的对称性约束,无法破解这个两难。华为与中国科大的 AsymSpec 打破对称:小 drafter 读全文、大 verifier 只读压缩视图,通过同模型跨上下文的对比 δ-fusion 把被压缩丢弃的信息在 logit 空间回注,再用免调参的 JSD 散度门保持接受率稳定。结果:以 0.23 倍计算拿到 LongBench 59.7 F1(恢复压缩损失差距的 72%)、1.45 倍吞吐;恢复量随压缩严重度单调增长,近无损压缩处自动失活;还能让读原图的视觉 drafter 操纵只读文字的 verifier。

August 27, 2026 · 5 min

Automata from Agent Traces: Failure and Next-Step Prediction 精读

深度精读 Holistic AI、PUC-Rio 与 UCL 合作的 Agent 轨迹自动机研究(ICML 2026 AIWILD workshop)——把整条语料库的 LLM Agent 执行轨迹坍缩成一台 7-43 个状态的紧凑有限状态机(FSM),无超参数、毫秒级构建。这台 FSM 同时充当四件任务的统一结构基底:工作流记忆(8/8 数据集胜过 Agent Workflow Memory)、下一步预测(交叉熵降 21%)、失败预测(held-out AUROC 最高 0.94)、运行时监控(32% 完成度即触发早停)。本文拆解其’前缀树+最后活动右同余合并’构造、紧凑性为何是全部下游收益的根源,以及’拓扑由 harness 而非模型决定’的核心发现。

August 27, 2026 · 4 min

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment(Station v2)精读

Station v2(DualverseAI × 剑桥 × 港大 × UCSD)把 AI 数学发现从『固定管线里的工具』搬进开放世界多智能体环境:6 个跨模型家族的 agent 在无中央协调器的房间制生态里自选方向、跑实验、发论文积累共享文献。在 AlphaEvolve 目录 12 个构造类问题上 5 题产出相对既有文献新颖的结果——kissing 数 d=11 三个精确 604 点构型(两个为新等距类)、Erdős 最小重叠下界 0.37912→0.380552(闭合已发表区间约 82%)、有限域 Kakeya 新无穷族、离散 Kakeya 针 CT(128)≤0.107067、符号不确定性 0.3089;还独立重构 Jacobian 猜想反例。机制归因:高度自主使 agent 能直接追求不可打分的广义数学目标,评估耗时上限倒逼理论引导构造,46.4% 的亮点结果来自跨模型家族协作。

August 27, 2026 · 3 min