Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training 精读

字节跳动 Seed、南京大学与 Evolvent AI 合作提出「论文展开」管线:保持论文原文逐字不动,用教师模型反向重建写作请求、全局规划与逐节写作前的思考,把整篇论文展开为多轮生成轨迹用于持续预训练。1.8M 篇 arXiv 论文的 30B token 原文被展开为 57–60B token 轨迹,中位文档长度从 11.2K 提升到 28–29K token。同一反向构造还产出 200K 样本 SFT 数据集与 2,940 题的 PAW-Bench 学术写作基准。受控实验(同预算纯论文文本对照)证明增益来自「构造」而非论文内容:写作四项平均 54.34 对纯文本 52.12/无 CPT 51.90,推理不降反稳,长文档理解提升;且 4B 小生成器的语料最难拟合(loss 1.453)却下游最好——生成器越弱、数据越难拟合,收益越大。

August 27, 2026 · 4 min

Unmatched Does Not Mean False: Incomplete Reference Sets Can Reverse Calibration Rankings 精读

深度精读 UC San Diego 的评测方法论论文——当开放式输出(ToM 信念追踪、开放域 QA)遇上「有限参考集+匹配器」的评测管线时,未匹配的输出被记为假,会产生代理标签并直接反转 proper-score 校准排名。论文用固定内容、只换标签源的识别设计证明:同一批 259 条信念,参考标签下 EG 探针领先 0.227,盲评真值下反落后 0.152,六个场景全部反转;已发布的 NQ-open 真实管线同样反转。机制上 90% 以上失真来自被省略的真值,单参数 π 修正即可恢复符号。本文拆解这条「识别—分解—闭合判据—预算修复」的完整证据链。

August 27, 2026 · 5 min

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 精读

南洋理工大学 S-Lab 联合 A*STAR、UIUC 提出 Visual Rubrics-Based RL:把视觉忠实性从「事后评测指标」转变为「细粒度 RL 训练信号」。方法将参考答案分解为视觉忠实性/推理一致性/指令遵循三维原子评分条目,构建 5 万例训练集,并用组件化+前缀局部化的优势分配改造 GRPO。在同 SFT 起点、同 RL 数据、同预算的受控对比下,比 answer-only GRPO 再提 1.79 分,增益集中于依赖接地中间推理的基准。

August 27, 2026 · 3 min

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 精读

NTU 牵头、20 个机构 50 余位研究者共建的 VBVR-Pro,为「原生视觉推理」——把视觉生成当推理介质本身——建立了可训练、可验证、可优化、可受控比较的闭环测试床:300 个程序生成任务(347 万图+130 万视频)、100 个任务的确定性奖励评分器(人类对齐超 GPT-5.5 且完全可复现)、30+ 生成器受控比较。训练使 9 个开源模型平均 +0.29 并在 7 个外部基准迁移 +28 分级别;RLVR 优于 RLVLM;三面证据链证明「视觉轨迹比语言 CoT 更关键」是范式级发现。

August 27, 2026 · 3 min

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction 精读

实时语音助手至今没有一套像样的记忆系统:文本 Agent 记忆动辄 top-100 检索、2–3 秒延迟,而语音对话只给得起 500 毫秒预算和 5 条记忆的空间。南洋理工、新加坡国立、清华、港中文联合团队的 VoiceMem 用「双脑」架构解题:左脑以 schema-entity 两级索引把候选池收窄到稠密子集,让 top-5 检索达到别家 top-100 的精度;右脑用独立/跨实体双节点分别建模稳定人格与情境情感;四阶段流式查询把检索藏进 VAD 静默窗——134ms 完成检索、零感知延迟。信息记忆均值 76.39 超最强基线 +10.6,token 省 4.4 倍;还贡献了 53 小时音频的 ChatMem-Bench 与首批带显式记忆访问的语音语言模型。

August 27, 2026 · 4 min

When “Must“ Becomes “Maybe“: Constraint Weakening in LLM Agent Workflows 精读

LLM 多角色工作流中,上游确立的安全约束(如“未获审批不得执行“)经摘要、计划、工单等交接变换传给下游后,是否仍然“说话算数“?深圳大学团队提出“操作性状态保持“概念并设计阶段分离受控实验:1296 个主实验 episode 中,直接交接对照 100% 保持约束,而正常级别的交接压缩使约束失活率达 100%、违规执行 54.2%;恢复全部四个状态字段则将两者归零。下游验证可在不改工件的情况下消除违规(0%),证明工件修复与端点遏制是互补的系统功能层。核心发现:语义可用不等于操作保持——内容还在,约束力没了。

August 27, 2026 · 2 min

Where vs What: Decomposing Structural and Content Failures in LLM Structured Outputs 精读

深度精读深圳大学 + 中科院深圳先进院论文:把 LLM 结构化输出失败分解为「值放错位置」(structural)与「值本身错误」(content)两种模式独立测量,发现跨 6 个模型一致的「结构先退化」剪刀差——前沿模型在最复杂任务上仍放错 24-35% 的值而小模型达 74%;机制消融指向语义捷径而非拓扑寻址;SA-RLVR 把结构感知奖励用于 GRPO,VPA 从 0.26 提到 0.63 而 SFT 仅 0.28。

August 27, 2026 · 2 min

【每日AI前沿追踪】2026年08月26日 核心技术与产业动态速递

今日66篇候选论文深度阅读后聚焦25篇高新颖性工作:Recuris递归记忆演化让长程任务幻觉完成下降86%,Meta^n在ARC-AGI-2成为唯一非零自改进系统,Station开放世界环境刷新kissing数d=11纪录至604;产业侧中国开源双响炮——Qwen3.8-Flash(125B-A6B)与GLM-5.3-Flash(320B-A18B)同日发布,OpenAI Jalapeño芯片实测每瓦吞吐1.7×于GB300,Claude记忆全面打通聊天与Cowork。企业+高校合作趋势显著:复旦+腾讯、清华+MIT+NVIDIA、ServiceNow+Mila等8组产学研联合占据今日精读名单三分之一。

August 26, 2026 · 12 min

领读Kimi K3技术报告:一个清华架构博士眼中的注意力谱系与「有效scaling」

一集面向技术读者的Kimi K3技术报告领读播客,嘉宾孙宇涛(清华计算机系博士生、上海创智学院pre-doc,研究方向LLM架构与预训练)从K3出发串联起十多篇前作,把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加,讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design,MLA+QK-norm式门控的稳定性逻辑,Latent MoE对通信开销的削减,以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推;后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论:大模型架构没有本质创新了,K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率,而把size做work才是真创新。

August 26, 2026 · 1 min

【每日AI前沿追踪】2026年08月25日 核心技术与产业动态速递

今日焦点:Agent 评测与 harness 优化成为绝对主线——SWE Refactor Bench 命名行为评测 Blindness 盲区(最强模型全仓库迁移仅 47/100),Prime Agent 证明同一模型仅换 harness 即把 ARC-AGI-3 从 30% 推到 95.5%,LongWoF-Bench 用 778 个可验证任务证明只有’验证器确认的执行经验’才能稳定提升 8.7~15.5pp;Skill 注入被证明平均是负收益;产业端 OpenAI 自研推理芯片 Jalapeño 能效号称达 GB300 的 104 倍,苹果 M6/M5 Ultra 将数千亿参数模型搬上桌面,Qwen3.8-Flash-Next 预告开源 Qwen4 架构。

August 25, 2026 · 11 min