Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读

清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈:自回归解码把整条推理链串行执行,难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行(AND分支,分而治之)与Trial并行(OR分支,多路试探),并测量发现Trial并行占了可并行推理计算的多数(DeepSeek-V4在HLE上65.5%),而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构,配合PA-GRPO多目标奖励(正确性+关键路径延迟+两类并行比例)训练,经SGLang真实执行。AIME24/25等基准上平均加速约1.7×,8k token延迟预算下用25%预算匹配全额性能。

August 27, 2026 · 2 min

Praxist: From Experimental Artifacts to Solution Lineages 精读

自主 R&D Agent 已经会写代码、跑实验、改工件,但多数系统把每次尝试当作近乎独立的事件——日志记下了「发生了什么」,却没建立「哪个设计元素带来了提升、证据是否经受住验证、如何与其他元素重组」。长周期研究于是反复重学同样的教训。Sapient Intelligence 联合南洋理工、清华、CMU、UPenn 的 PRAXIST 提出「证据继承」:把可复现工件与评估结果转化为类型化的发现(正/负/诊断/不确定/程序性)、四车道 frontier(confirmed/candidate/diagnostic/validation)与世代议程,失败与诊断成为一等证据。MLE-bench 全 75 题拿下 60 枚奖牌(49 金),花费 3,054 美元——约为 Claude Code+Opus 4.8 基线(38,370 美元、55 枚、34 金)的十二分之一;火箭着陆案例从 4.03% 起步做到 12,288/12,288 满分。

August 27, 2026 · 4 min

ReproAgent: Contract-Guided Paper-to-Code Reproduction 精读

ReproAgent(北航+上交+北大等纯高校合作)把论文复现代码生成失败归因于「split-specification」:显式的论文义务在长 agent 轨迹中漂移丢失,隐式的框架默认与仓库惯例根本不在论文里。它用持久化双通道实现契约对症下药——需求通道把论文片段钉成带 id 的代码义务,证据通道从参考文献仓库检索内容与结构证据,双双绑定到文件级契约并贯穿 Prepare–Plan–Generate–Repair 四阶段。在 PaperBench Code-Dev 上以 Claude-Sonnet-4.5 达到 73.7 分刷新纪录,同骨干对比超最强基线 9.2 分,通道消融显示去掉任一通道平均掉 14+ 分。本精读拆解其契约机制、覆盖不变量设计与两通道分工的因果证据。

August 27, 2026 · 3 min

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments 精读

深度精读 ServiceNow 与 Mila 的企业环境 harness 进化研究——在模型权重完全冻结的前提下,用分层搜索自动进化面向特定企业环境的 agent harness(提示词/工具接口/skills/MCP/子agent/执行循环)。通过按基线失败模式分层采样构建紧凑进化池、proposer 可见搜索集与隐藏选择集分离、test-flip 门控 + 严格爬山接受,在 ITBench SRE / EnterpriseOps-Gym ITSM / AutomationBench Finance 三个基准上较默认 harness 提升 20-35 个百分点,且冻结迁移到 Qwen/GPT 全系列模型仍有效。21 个被接受 patch 归结为三类修复:接口修复、环境约定显式化、压缩搜索的操作知识。

August 27, 2026 · 4 min

SwarmWorld: Stigmergic technological evolution in societies of language-model agents 精读

去中心化的同质 LLM Agent 群落,能在没有预设角色、配方与技术目录的条件下,仅靠共享一个可被改造的物理世界,构建出功能性的技术生态并超越同计算量的独立搜索吗?MIT 的 SwarmWorld 给出受控答案:Agent 只获局部观测并提主张,确定性模拟器独自判定后果(提议-后果分离);评估时移除全部 Agent、冻结世界克隆 8 份施加未见扰动。结果是「有界群体优势」:共享世界在组合韧性、验证发明数上几乎全面超越逐端点 best-of-N 独立包络(发明 5.75–7.00 vs 2.75),但最强单件仍属独立搜索(0.3488 vs 0.2380);约 95% 的技术采纳始于物理观察而非直接交流——共享物理基底而非通信本身才是群体能力的主要来源。

August 27, 2026 · 3 min

The Empire, Long Divided, Must Unite: Architectural Convergence in Three LLM Agent Harnesses 精读

深度精读南洋理工大学的 LLM Agent Harness 架构收敛研究——首个对 harness 层本身做源码级多案例研究的论文。三个来自对立哲学的开源编码 agent harness(LangChain deepagents、Earendil pi、DeepSeek dsh)反向演化却汇聚于同一五要素中间形态:商品化循环、仅追加可重放会话记录、模型怪癖数据化、上下文渐进披露、显式扩展缝隙。本文逐项拆解五要素与三类收敛机制(平行发现/扩散/字面复用),还原四条汇聚断层线缺陷分类,并解读唯一零收敛维度’外部可验证性’为何是预测性缺口。

August 27, 2026 · 4 min

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training 精读

字节跳动 Seed、南京大学与 Evolvent AI 合作提出「论文展开」管线:保持论文原文逐字不动,用教师模型反向重建写作请求、全局规划与逐节写作前的思考,把整篇论文展开为多轮生成轨迹用于持续预训练。1.8M 篇 arXiv 论文的 30B token 原文被展开为 57–60B token 轨迹,中位文档长度从 11.2K 提升到 28–29K token。同一反向构造还产出 200K 样本 SFT 数据集与 2,940 题的 PAW-Bench 学术写作基准。受控实验(同预算纯论文文本对照)证明增益来自「构造」而非论文内容:写作四项平均 54.34 对纯文本 52.12/无 CPT 51.90,推理不降反稳,长文档理解提升;且 4B 小生成器的语料最难拟合(loss 1.453)却下游最好——生成器越弱、数据越难拟合,收益越大。

August 27, 2026 · 4 min

Unmatched Does Not Mean False: Incomplete Reference Sets Can Reverse Calibration Rankings 精读

深度精读 UC San Diego 的评测方法论论文——当开放式输出(ToM 信念追踪、开放域 QA)遇上「有限参考集+匹配器」的评测管线时,未匹配的输出被记为假,会产生代理标签并直接反转 proper-score 校准排名。论文用固定内容、只换标签源的识别设计证明:同一批 259 条信念,参考标签下 EG 探针领先 0.227,盲评真值下反落后 0.152,六个场景全部反转;已发布的 NQ-open 真实管线同样反转。机制上 90% 以上失真来自被省略的真值,单参数 π 修正即可恢复符号。本文拆解这条「识别—分解—闭合判据—预算修复」的完整证据链。

August 27, 2026 · 5 min

Apodex 1.1 姊妹篇补遗:本日精读系列导览与 2026-08-25 学术全景

本文为 2026-08-25 精读系列的导览:16 篇触发顶会标准精读的论文横跨 Agent 评测反作弊、Harness 可学习化、经验资产化、因果测量方法学四大主题。本文给出全部精读的索引、跨论文趋势综合(verifier-grounded 成为共同底座、评测从’分数多高’转向’分数测的是什么’、产学研从联合发文转向资产+方法学互换),以及按读者角色(研究者/工程师/管理者)的阅读路线图。

August 25, 2026 · 1 min

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces 精读

深度精读HKUST(GZ)与清华大学合著的DataSpace基准:把数据智能体放进散落着数据库、CSV、长PDF与视频的异构工作区,要求其返回完整表格并通过确定性评测。410个跨语言任务、7439个工件、15.01GB规模下,六前沿模型×五智能体框架的最好成绩仅66.34%,换框架即拉差15.36点,视频证据与join是所有模型的共同短板。该基准同时是KDD Cup 2026数据智能体赛道的官方评测。

August 25, 2026 · 2 min