LatentPress: Context Compression Beyond Text and Vision 精读

压缩后的上下文通常仍以文本或图像这两种’给人看’的形式存在。LatentPress 提出第三种表示:小型 writer 把对话/文档直接写成连续记忆 token,冻结解码器经输入嵌入接口读取,推理时零文本重建。LongMemEval 上 7.7× 压缩反而比未压缩证据更准(0.504 vs 0.490),写入 43ms 比摘要快一个量级——机器原生的记忆表示从此有了实证立足点。

September 7, 2026 · 3 min

Rethinking On-Policy Distillation II: One Training Example 精读

on-policy 蒸馏到底需要多少数据?本文把实验推到’一条训练样本’的极限:单条查询即可驱动 OPD 持续改进数百步,覆盖全数据 OPD 71.5% 的状态空间;16 个语义多样查询覆盖 98.9% 并匹配全数据训练。提出状态覆盖率度量解释现象——OPD 是’数据过饱、算法饥饿’,瓶颈在步数效率而非数据规模。

September 7, 2026 · 2 min

Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM 精读

社区量化混合架构 LLM 时一致保留循环半区(Gated DeltaNet)的高精度,理由是’循环误差会累积’。Minima 直接把 NVFP4 W4A4 打满全部 496 个线性层:五任务平均仅 -0.52(种子噪声内),显存 17.5 GiB 最小、prefill 提速 14-19%。四重机制研究(块缩放局域化离群值→门控非线性压缩误差→delta-rule 主动遗忘→逐 token 代价被冲刷)解释了为什么直觉是错的。

September 7, 2026 · 3 min

触觉是具身智能的最后一块拼图吗:五大技术路线、数据困局与模型之争

硅谷101走进触觉传感器实验室,梳理压阻、压电、电容、光学、磁感应五条技术路线,解释触觉数据为何接近于零、真机采集的"屏蔽悖论",以及端到端时代触觉融入模型的两种范式之争。几乎所有受访嘉宾认为2026年触觉处于爆发前夜,量产一致性与数据生态是接下来一年的关键观察点。

September 7, 2026 · 1 min

【每日AI前沿追踪】2026年09月06日 核心技术与产业动态速递

周日技术面出现两大范式信号:Waterloo×Harvard 的’训练即编译’把自然语言规格变成可版本化的本地神经函数,单查询极限研究揭示 on-policy 蒸馏’数据过饱、算法饥饿’;产业面 OpenAI 连发研究加速报告与对齐长文,承认 wiki 事件并承诺建立智能体异常披露框架,GPT-6 Astra 登顶 Code Arena 引爆周末实测潮。本日精读 6 篇:Compile by Training、BCIT、OPD II、Minima、LatentPress、LatentStream。

September 6, 2026 · 5 min

AutoTraceGT 精读:把扎根理论变成 Agent 轨迹的自动化显微镜

AutoTraceGT(Cornell×JHU×Purdue×UTEP)把社会科学 60 年的扎根理论算法化为多 Agent 流水线:OpenCode/AxialCode/TheoreticalCode 三级编码+Manage 持续比较,直到理论饱和(连续两轮新增类别<ε)。7500+ 轨迹、6 数据集、4 骨干 LLM 上,代码本恢复人工分类学 73–91% 的失败模式并发现遗漏模式,作演绎特征做失败预测 ROC AUC 最高 0.773。

September 6, 2026 · 2 min

DRACO 精读:没有验证器时,如何给长程 Agent 训练信号分步定责

DRACO(IBM×CMU)形式化’outcome-blind’训练设定——长程 Agent 任务往往没有程序化验证器可依赖。方法用训练中动态生成的 rubric 逐轨迹打一次分,再按’步骤涉及哪些标准’闭式分摊到每步 GRPO advantage,不引入任何可学习归因模块。AppWorld TN 上 Qwen3.6-27B TGC/SGC 69.4/41.1→85.3/70.6,反超偷看真值奖励的 GRPO +5.3/+11.3,τ-bench 零样本迁移 SR 15.8→20.4。

September 6, 2026 · 2 min

Locked at the Entrance 精读:RLVR 的多样性坍缩发生在推理的门口

RLVR 提升 pass@1 却坍缩解空间已是共识,但坍缩发生在哪一步始终未知。上海大学×伯明翰大学在 Countdown 任务上穷举解空间、按首操作数+算子划分入口族,把求解分解为 access×execution:PPO 覆盖 0.337→0.111,首算术操作前的似然偏移是下游的 11–16 倍,塞一个入口前缀就能让低覆盖族完成率 0.018→0.212——能力还在,只是不再进门。后层参数插值恢复 37% 覆盖且 pass@1 零损失。

September 6, 2026 · 2 min

MachCSL 精读:MIT 用 AI Agent 把 xv6 内核验证推进到 RISC-V 硬件级

MIT CSAIL(Kaashoek×Zeldovich)的 MachCSL 把并发分离逻辑(Iris 系)扩展到 RISC-V 硬件级语义——页表翻译、TLB、特权级、DMA、断电——并以此为基座证明 6,593 行 xv6 内核的全部不变量。验证过程发现 9 个 xv6 bug 与 1 个 Sail 语义 bug;全程由 LLM Agent 深度参与:77 天、407 个 agent 会话、2,254 个子代理运行、Claude 累计运行 1,729 小时。

September 6, 2026 · 2 min

RealSWE 精读:真实用户请求正在让编码 Agent 榜单失真

RealSWE(成均馆大学)用六类信息分类学×四维语言风格对照 SWE-chat 真实用户 prompt 与 SWE-bench 任务,发现 88% 真实请求只带问题描述而基准任务仅 7%;据此构建 381 个多变体任务族,测得 7 个主流模型在真实输入下平均掉 6.4pp 且排行榜改写——MiMo V2.5 Pro 反超更贵模型升到第 2。控制变量消融进一步证明:Desired Behavior 字段值 8pp,复现步骤与环境信息几乎一文不值。

September 6, 2026 · 2 min