What is the Difference Between Me and You? Benchmarking the Quality Gap Between Human-Written and AI-Generated Code 精读

那不勒斯费德里科二世大学的 78.7 万函数对大规模研究:3 家 AI 助手(GPT 系/DeepSeek-Coder/Qwen2.5-Coder)按人写函数的 docstring 生成配对实现,静态分析映射到 ODC 缺陷分类+CWE 漏洞分类实现三语言(Python/Java/C)同框架人机对照。核心发现:AI 代码’结构压缩+风格模板化’(体量约人写一半、风格层独立聚类);缺陷类型分化而非数量分化;C 语言上 AI 高严重性内存安全缺陷反而更少。发布 CQBench(27,346 高问题任务)——Opus 4.8 在其上仍 2/3 有缺陷、1/3 有安全发现。

September 15, 2026 · 2 min

A-JIT: Agentic Just-In-Time Software Construction 精读

Kentucky×UCL 的这篇范式论文把 JIT 编译的思想搬到软件交付层:A-JIT 应用=代码+运行时 harness+内嵌 agent 的活组装体,语言层显式标注’留待 JIT 构建的部分’(code holes),agent 持续观察系统使用与执行轨迹,像 JIT 编译器特化机器码那样按需特化软件逻辑、工作流与工具接口。传统’先构建后部署’的静态范式被’按需即时构建、持续适应’取代,软件从固定制品变成会生长的有机体。本文精读其三支柱设计(语言标注/运行时支持/实现新定义)与 Bosque 原型上的 trace 驱动人-AI 协同构建。

September 11, 2026 · 1 min

AgentGrad: Intervention-guided Prompt Optimization for Multi-Agent Systems 精读

AgentGrad 对多智能体系统提示优化做出两个机制修正:梯度提取阶段用序贯干预(每次只改一个 agent 的行为)因果定位’改谁才能解决失败’,并把修改后输出作为 agent 级监督提取细粒度梯度;聚合阶段用语义聚类把相似梯度归簇、抽象出共享纠错模式的泛化梯度。五个 MAS 基准上 GPT-5-mini 平均 +11.76 分、Qwen3-8B +9.67 分,墙钟时间较最快基线缩短 2.5×,HotpotQA 上 1000 次 rollout 达到 GEPA 6000+ 次的水平。本文精读其因果消融式归因与梯度降噪机制为何同时带来效果与效率。

September 11, 2026 · 1 min

Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization 精读

Google 的这篇论文问了一个极简的问题:agent 能否通过’写优化器代码并评估’的可执行实践学会一个搜索策略,然后把这个策略蒸馏成一段文本、迁移给从未见过这段实践的其他模型?答案是肯定的——自博弈产出的 197 词文本 harness(Harness A)使 Gemini Flash 在黑盒优化上 regret 降低 48%(N=30,p<.001),同一文本让所有受测 Gemini 执行器与 Claude Sonnet 都改善(regret -43%~-49%),独立复现的 Harness B 性能同档。‘语言是部署搜索策略的便携介质’——harness 自动生成从进化搜索走向了实践蒸馏。

September 11, 2026 · 1 min

Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations 精读

UMass Amherst 的这篇论文利用 LLM 内部表征预测智能体任务成败:Latent Trajectory Dynamics(LTD)总结交互轨迹上残差流表征的变化动态,Action Representation Probe(ARP)在动作决策点读取表征预测成功。在 InterCode 的 Bash/SQL/Python 三个交互基准 × Qwen-14B/Qwen-7B/DeepSeek-6.7B 三个模型家族上,两方法全面超越表层 token 概率与序列校准基线(漏损泄漏的交叉验证协议),且零额外开销——不改提示、不需多样本 rollout。智能体安全关键应用第一次有了’从模型内部读出置信度’的免费监视器。

September 11, 2026 · 1 min

If It's Not Buggy, Don't Fix It: On the Dynamics of Iterative Bug-fixing with LLMs 精读

Warwick×UnlikelyAI 的这篇论文把’LLM 迭代修 bug’当作动力系统研究:每轮修复在修好一部分的同时引入新 bug(修复率与损伤率并存),系统收敛到几类吸引子——正确修复、振荡、或’幻觉修复’(模型虚构不存在的代码块导致循环早停)。最有趣的发现:bug 倾向性可以作为 steering vector 从 layer ~19 的激活中线性读出并双向干预——放大它模型更爱修(也更多幻觉)、抑制它模型更保守。‘没病别修’在机制层面有了操作含义。

September 11, 2026 · 1 min

Programmable World Model 精读

Programmable World Model(PWM)把视频世界模型拆成两层:agent 把自然语言编译为可执行程序(实体状态+转移规则),轻量引擎执行程序维护显式持久全局状态(含屏外实体与非视觉属性);状态经增广 3D OBB 中间表示+相机轨迹确定性编译为像素对齐条件信号,驱动预训练视频模型当生成渲染器。自建 CombatStateBench 上 Count Accuracy 94%(超 LingBot-World-V2 达 53.25 分)、State Accuracy 98%(超 90 分),支持连贯长时程生成。本文精读’符号引擎管规则、生成模型管外观’的解耦架构为何系统性消灭状态漂移。

September 11, 2026 · 1 min

Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward 精读

这篇论文提出一个普适论题:生成能力已规模化而验证没有——验证瓶颈是 AI 能力提升的普适约束,数据、算力、对齐等其它瓶颈最终都归约为它。理论上证明 verifier correlation 是’算力-能力汇率’(ρ=0.5 的验证器只实现可靠验证器 50.2% 的增益,与命题精确吻合);实证上展示 asymmetric verification 攻击使不可靠验证器在优化压力下失效(hacking gap 0.27→~0),并提出 reality-settled reward——标签由现实执行结算而非 proxy 判分:GRPO 训练中冻结 RM 的 proxy 攀升而真实奖励崩溃 90%,RM 以 10% 结算流重训后执行奖励保持为冻结组 6×、on-policy 结算比随机标注标签效率高 10×。

September 11, 2026 · 1 min

RobustSGPO: Search-Space Control for Agent Harness Evolution 精读

语义梯度提示优化(SGPO)让 harness 能用执行反馈自动进化,但其局部更新规则把’这轮该改哪里、怎么改’留给运气——搜索空间悬空导致补丁无效率高、进化易破坏已有能力。武大×快手的 RobustSGPO 给出三步控制:显式指定本轮编辑(choose what to change)、构造并检查补丁(construct & check)、从现任或保留快照继续(防劣化回滚),配合周期性 1→2→3 权限调度。在快手 AgentX 头脑风暴工作流上(120 任务/95 运行/7350 候选),held-out 完成率 60.0%→80.0%、测试质量 3.77→4.14,结构化搜索补丁有效率 77.8% vs 48.9%。

September 11, 2026 · 1 min

SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? 精读

中科院自动化所的 SAEScientist-Bench 把’可解释性研究本身’benchmark 化:基于 27182 个专家标注 SAE 特征构建任务族,agent 需完成特征发现(AUROC 区分正例与对比控制)→ 因果转向验证(steering 分数度量目标表达净增)→ 下游生成质量保持的完整实验科学闭环。前沿 agent(Kimi 等)在因果转向与目标相关性上接近专家水平(Expert 特征 AUROC 0.917-1.000),但生成退化率从 32.5% 升至 52.5%——‘转向强度 vs 生成保真’的权衡是当前 agent 科学家的系统性短板。

September 11, 2026 · 1 min