Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills 精读

自主 ML 研究 agent 缺的不是更强的模型或更聪明的流程,而是’怎么把方法跑通’的操作知识层。BAAI 联合中科大、人大、港理工提出 DisCo 蒸馏框架,把 1000 个 GitHub 仓库蒸馏成 5353 个经过验证的技能,构建 AREX-Skill Library。在固定 GPT-5.5+Codex 的对照实验下,技能让 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,并以更低 token 消耗帕累托支配 Claude Code。本精读拆解技能图三层结构、四阶段蒸馏流水线、对照实验设计,以及’试错成本越高、操作知识价值越大’的机制根源。

September 4, 2026 · 3 min

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? 精读

Agent 每天与环境交互积累海量轨迹,但经验真的变成了能力吗?ByteDance Seed 姊篇基准 S3Gym 把’自改进’拆成自测试、自判断、自改进三个可测环节,在 7 个可执行验证的文本游戏上比较三种经验注入通路:原始历史 ICL、摘要记忆、参数训练。7 个前沿模型的核心发现:自改进既不自动也不均匀——GPT-5.5 在 PvZ 上 History ICL 的 AUC⁺ 高达 548.5,换摘要记忆暴跌到 33.2;同一模型同一环境换个通路结果天差地别。本精读拆解宽松探索/严格评测的分离设计、自评分与环境真值的对照记录,以及’经验压缩可行性决定通路优劣’的机制规律。

September 4, 2026 · 3 min

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? 精读

ByteDance Seed 联合 SUTD/GaTech/M-A-P 发布 HarnessDev——首个把评测单元从’任务输出’改为’可运行基础设施’的基准:creator LLM 从无策略弱种子构建完整 harness(Creation),再基于下游执行反馈迭代改进自己的 harness(Evolution),在 2207 个下游实例上按 capability+efficiency 双轴评估。核心发现:模型自建 harness 在 writing/MLE 域追平甚至反超人类参考系统,但在 code/search 域差距显著;Evolution 的增益不稳定且严重绑定 executor;换 executor 后最高回退 10.32 分。这为’harness 工程能否自动化’提供了第一份系统性体检报告。

September 3, 2026 · 5 min

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases 精读

深度精读 Epiq AI Labs 与康奈尔大学联合发布的企业级问答基准 CorporateBench。论文用程序化生成的时序知识库(KB)构建四家虚拟公司(12 到 10210 名员工、共 26.3 万封邮件),并从 KB 用人工验证的 SPARQL 查询确定性导出标准答案,保证任意规模下的跨文档逻辑一致性。五个前沿模型测试显示:实体抽取基本不随规模衰减,但关系抽取与时序关系严重崩坏;KB 直连(SQL 工具)显著优于 RAG,且两者差距随规模从 0.24 扩大到 0.37,揭示大规模企业通信网络仍是当前 LLM 的重大短板。

August 31, 2026 · 3 min

Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers 精读

深度精读 Thomson Reuters Labs 与多伦多大学/Vector Institute 合作的 LLM 评分器顺序依赖论文。批式打分(reranker、奖励模型、多文档 QA)中每个分数都依赖候选排列顺序,论文发现排序质量相同的评分器在下游决策上大相径庭:五个 nDCG@10 差距不超过 0.010 的已训练评分器,重排后保留集重叠度横跨 0.656 到 0.835。提示词层修复(round-robin 划分、logit 校准)完全触达不到决策端;提出的 OC-SFT 在损失函数中显式惩罚同一窗口 N 个排列下自身分数的方差,τ-PSI 从 0.209 降至 0.083,保留集重叠升至 0.835,单次前向即超过十排列集成的 BSC,且 nDCG@10 不降反微升。

August 31, 2026 · 3 min

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 精读

深度精读阿里 DreamX 团队联合北邮、UNSW Sydney 与 Data61 CSIRO 推出的 LoopArena:首个把『模型作为运行时循环控制者』的编排能力本身作为被评测对象的基准。它冻结 Worker 编码智能体与全部执行环境,只比较 Controller 模型在 advance/verify/stop 三类决策上的表现;Type I/II/III 三级成本递减设置使其可低成本诊断循环控制能力。关键发现:完整任务上最强 Controller(GPT-5.5)Strict Success Rate 仅 24.69%,机械重复目标的 fixed control 在全任务上与无控制持平(18.52%),证明有用的循环控制必须随运行状态自适应切换;Type II 切片评估平均省 64.4% 成本且与全任务排序高度一致(Spearman ρ=0.9747)。

August 31, 2026 · 5 min

Lost in Compression 精读:抽取式提示压缩器的跨语言审计

提示压缩号称能砍掉 LLM 推理成本,但主流学习型压缩器几乎全部用英语训练和评估。这篇来自 Hostinger 与考纳斯理工大学的论文做了一次严格的受控跨语言审计:在十种语言、五种文字系统的完全平行数据上,用目标模型分词器做预算匹配对照,超过 25.8 万次评估调用后发现迁移差距真实存在且随压缩强度急剧放大——保持率 0.33 时英语保留 57 至 62 个百分点的上下文价值,中文几乎归零。差距由监督语言而非模型架构驱动:三种英语训练的压缩器全部复现差距,多语训练的 XProvence v1 完全没有差距,确定性基线也无差距。非英语的安全压缩预算只有英语的一半左右。

August 31, 2026 · 3 min

LowRankArena: A Standardized Evaluation Platform for SVD-Based LLM Compression 精读

SVD 低秩压缩号称能省显存又保精度,但各家论文的评测基准、压缩率定义、推理后端各不相同,「进步」到底是方法变强还是协议不同造成的?杜克大学与维克森林大学团队发布 LowRankArena:统一任务版本(LM-Eval-Harness v0.4.11)、统一精度下的 keep ratio 定义、统一 vLLM 0.18.1 端到端推理测量,并开放 3TiB 以上压缩 checkpoint 动物园。对 5 种代表方法(ASVD、SVD-LLM、DoBi-SVD、Basis Sharing、MoDeGPT)×3 个骨干模型的对齐审计发现:排名随骨干剧烈变动、MCQ 准确率可掩盖困惑度坍塌(ASVD 0.353 恰好贴着 0.357 随机地板)、低秩省的是 FLOPs 而非时间——prefill 提速最高 4.20 倍,decode 场景 SVD-LLM 吞吐反而跌到 0.80 倍,且 5 个方法在单张 H200 上压缩 70B 全部因工程问题失败。

August 31, 2026 · 3 min

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests 精读

编程智能体的能力几乎都用 SWE-BENCH 系基准衡量,但其任务来自精修的 GitHub issue——长、结构化、信息丰富;真实用户请求却往往短、随意、信息稀疏。成均馆大学团队先定义六类信息分类学与四个语言学维度,量化出残酷的错位:仅含问题陈述的请求占真实提示的 88% 却只占基准任务的 7%,87% 的真实提示口语化而 94% 的基准问题书面化。据此构造 381 个多变体任务族(族内共享任务与 gold patch、只变信息组合与风格),评估七个模型发现真实输入平均拉低解析率 6.4 个百分点、足以改变排名;受控消融进一步定位:期望行为 [D] 与动机 [M] 是关键信号(+6.8 到 +9.9pp),复现步骤与环境信息只增加 token 却无可测收益,语言风格几乎不影响性能。本文按九部分结构精读这个『表达方式可被逐字段归因』的评估范式。

August 31, 2026 · 4 min

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation 精读

LLM 能不能认出自己写的文字?这个『自生成文本识别(SGTR)』问题直接关系到 AI 安全:控制协议(蜜罐、受信编辑)和多智能体防合谋都依赖模型无法分辨内容来源,而 LLM-as-a-Judge 评估则可能因评审认出自己的输出而产生系统性偏袒。以往研究结论互相矛盾——有的说模型识别能力很强,有的说不超过随机。本文用『操作化』框架化解了冲突:识别精度随评估格式(成对/单条)、会话格式(用户标签/助手标签)与任务域(摘要/对话/安全问答/代码)大幅波动。核心发现是『质量启发式』主导混杂:模型倾向把自认为高质量的文本归于自己(识别精度与 Arena Elo 分差正相关 R²=0.23-0.34)。SFT 训练可提升 SGTR 并跨操作化迁移,还会放大 AlpacaEval 2.0 评审的自偏好;对抗训练则能把偏好重定向到任意目标模型。

August 31, 2026 · 2 min