SPECMINE: A Large-Scale Corpus of Spec-Driven Development Artifacts 精读

深度精读 CMU 数据集论文 SPECMINE(MSR 2027 Mining Challenge 数据集):对 GitHub 上 47 万个 spec 文件、7.3 万仓库的全面普查,配合 5992 个 spec 触碰 PR 与 242 万条类型化引用索引,首次让「AI 时代的软件如何被规格化」从诞生之日起可大规模研究——99.7% 的 spec 首次提交于 2025 年之后。

August 27, 2026 · 3 min

Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon 精读

剑桥大学与清华大学合作,用 out-of-sample 谱探测回答优化器领域的核心开放问题:Muon 为何快于 Adam?沿真实训练轨迹把动量缓冲做 SVD,在留出批次上估计每个奇异方向的最优步长,发现稳定且各向异性的谱剖面——单一「易变头」处于稳定性边缘(允许步长最小、恰等于 Muon 实际步长),「宽容主体」允许数倍步长。据此提出 SAMuon:头钉住、主体放大,比调优 Muon 少 13.3-24.0% token 达到同等验证损失。SGD→Adam→Muon→SAMuon 在统一谱分配视角下排成一条线。

August 27, 2026 · 3 min

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments 精读

深度精读 ServiceNow 与 Mila 的企业环境 harness 进化研究——在模型权重完全冻结的前提下,用分层搜索自动进化面向特定企业环境的 agent harness(提示词/工具接口/skills/MCP/子agent/执行循环)。通过按基线失败模式分层采样构建紧凑进化池、proposer 可见搜索集与隐藏选择集分离、test-flip 门控 + 严格爬山接受,在 ITBench SRE / EnterpriseOps-Gym ITSM / AutomationBench Finance 三个基准上较默认 harness 提升 20-35 个百分点,且冻结迁移到 Qwen/GPT 全系列模型仍有效。21 个被接受 patch 归结为三类修复:接口修复、环境约定显式化、压缩搜索的操作知识。

August 27, 2026 · 4 min

SwarmWorld: Stigmergic technological evolution in societies of language-model agents 精读

去中心化的同质 LLM Agent 群落,能在没有预设角色、配方与技术目录的条件下,仅靠共享一个可被改造的物理世界,构建出功能性的技术生态并超越同计算量的独立搜索吗?MIT 的 SwarmWorld 给出受控答案:Agent 只获局部观测并提主张,确定性模拟器独自判定后果(提议-后果分离);评估时移除全部 Agent、冻结世界克隆 8 份施加未见扰动。结果是「有界群体优势」:共享世界在组合韧性、验证发明数上几乎全面超越逐端点 best-of-N 独立包络(发明 5.75–7.00 vs 2.75),但最强单件仍属独立搜索(0.3488 vs 0.2380);约 95% 的技术采纳始于物理观察而非直接交流——共享物理基底而非通信本身才是群体能力的主要来源。

August 27, 2026 · 3 min

The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses 精读

深度精读南洋理工大学的 LLM Agent Harness 架构收敛研究——首个对 harness 层本身做源码级多案例研究的论文。三个来自对立哲学的开源编码 agent harness(LangChain deepagents、Earendil pi、DeepSeek dsh)反向演化却汇聚于同一五要素中间形态:商品化循环、仅追加可重放会话记录、模型怪癖数据化、上下文渐进披露、显式扩展缝隙。本文逐项拆解五要素与三类收敛机制(平行发现/扩散/字面复用),还原四条汇聚断层线缺陷分类,并解读唯一零收敛维度’外部可验证性’为何是预测性缺口。

August 27, 2026 · 4 min

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents 精读

AWS Agentic AI团队用58,000次agent运行、200万次API调用、360亿token的系统实验,测量了coding agent中途切换模型的隐性代价——Handoff Tax。核心发现呈方向二重性:升级(便宜模型→贵模型)时Raw全轨迹移交只恢复不到一半质量差距且成本可达LC的4-6倍,Claude家族下甚至被’弃用重启’严格支配;降级(贵模型→便宜模型)却是甜点区,保住大部分质量同时省下大头成本。最有工程价值的是接口反转现象:升级时应丢弃前模型的轨迹只留代码改动,降级时恰恰相反。本文从实验设计讲到成本机制分解,给出模型切换策略的实操建议。

August 27, 2026 · 2 min

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure 精读

深度精读 PST 2026 的 ToolMinimize 论文——Case Western Reserve 大学提出的 LLM Agent 工具调用隐私最小化中间件。动机研究显示三个生产 LLM 默认 prompt 下 81-88% 的工具调用包含不必要的隐私敏感数据,显式隐私指令后仍剩 36-76%(Llama 几乎无效)。现有防御全是 allow/block 门控或 token 级 PII 检测,无法改写参数值。TOOLMINIMIZE 在参数构造与工具执行之间拦截调用,用「模式+实体+语义」三段分类器识别 PSD(含隐式隐私如医院名隐含诊断)、按 JSON Schema 做必要性分析、执行删除/泛化/替代/截断四种改写。307 次真实调用验证:隐私成本降 81.2-92.0% 且 100% 任务有效(TOST 等价 p<0.001),中位延迟仅 1.77ms。

August 27, 2026 · 5 min

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development 精读

深度精读 CMU 论文 TraceML:首个任务对齐的人机 ML 开发过程级配对语料,把 4465 条人类 Kaggle 轨迹与 207 条 agent 轨迹放进同一版本级标注体系,量化诊断出 agent 的「无记忆搜索」病症——不转向也不回访,一条约千 token 的规划提示能在 7 个竞赛中 5 个提分,但指令只能关闭「可命名」的那部分差距。

August 27, 2026 · 2 min

Training Alignment Auditors via Reinforcement Learning 精读

深度精读 Anthropic 论文:用 RL 训练 Claude Haiku 4.5 做对齐审计员。奖励设计三轮迭代的故事极具教学价值——生产模型标量奖励被黑化(误报率 96%)、二值奖励学会对抗盘问、最终 reference pairwise 奖励 + 50% 无行为校准 rollout 让小模型匹配 Opus 4.6(48.7 vs 48.4)、误报率压在 1% 以下,并跨脚手架迁移到 AuditBench 对抗性目标(检测率 11.5%→28.1%)。

August 27, 2026 · 3 min

Tunable Tool-Call Rates in LLM Agents via Representation Steering 精读

深度精读 UC Santa Cruz + UC Berkeley 论文:LLM agent「是否调用工具」这个离散决策,可以被残差流中的单一线性方向连续调节——无需训练、无需改提示,一个旋钮把调用率从近 0% 单调推到 90%+,且新增调用精准落在模型答不出的低流行度问题上,PopQA 准确率 0.29→0.56,方向还能零样本迁移到 6 个未见工具。

August 27, 2026 · 2 min