Thought-Level Beam Search for Reasoning 精读

测试时算力扩展是大推理模型性能的主引擎,但并行采样极度浪费、减法剪枝又让GPU挨饿,核心问题已从“花多少算力”变成“把算力花在哪”。本文提出思维级束搜索 Gambit:用轻量评分器探测步骤边界隐状态,周期性剪除劣迹并立即从高分前缀分支,以零和交换维持固定容量活跃池,同时保持硬件满载。在 5 个基准 × 3 个模型上严格支配 SC、Slim-SC、DeepConf、STEP 四大基线:HMMT-24 最高 +6.7%,token 消耗较并行采样最高降 68.5%,吞吐超 2 倍,管理开销仅 0.97%。本精读覆盖其问题形式化、方法细节、实验证据与因果链根源分析。

August 15, 2026 · 3 min

Vero: Can AI Agents Build Formally Verified Software Repositories? 精读

AI agent 能写出“保证正确”的软件仓库吗?UC Berkeley Dawn Song 组牵头推出 Vero——首个仓库级“实现+证明”联合合成基准:43 个多模块 Lean 4 仓库、743 个 API、2705 条规格,并首创让 agent 形式化证明“基准本身有错”的审计机制。最强配置 GPT-5.5 (xhigh) + Codex 仅完全解决 27/43,仍有 10 个实例、219 条规格抵抗全部 8 个配置。本精读覆盖其基准构建、反作弊协议、审计机制与失败模式的因果分析。

August 15, 2026 · 3 min

【每日AI前沿追踪】2026年08月14日 核心技术与产业动态速递

SpaceX 600亿美元正式完成收购Cursor,AI编程工具独立时代落幕;智谱GLM-5.3仅靠后训练将Terminal-Bench 3.0从4.6拉升至28.3、CyberGym 84.5%登顶;阿里开源Qwen3.8-27B单GPU模型与2.4T旗舰权重;学术侧DarwinX把Agent Harness进化升级为带准入契约的种群自然选择(四基准平均+17分)、AutoDesign用元harness优化将论文转海报提升至78.32分、PlayWorld以Agent-as-Player揭示世界模型’持续演化’共同瓶颈。

August 14, 2026 · 4 min

Agent 安全应当是一份运行时契约——精读《Agent Safety Should Be a Runtime Contract》

当 Agent 开始执行代码、改写文件、发送消息、操作数据库,把安全寄托在 RLHF 这类训练时对齐上,在结构上是不够的。本文精读 arXiv:2608.11274,拆解其提出的’运行时契约’范式:预防面阻止危险、证据面验证完成,并以 52 起事件、32 起虚假完成、12 个系统轨迹审计和 28560 篇论文的会议审计四条证据线汇聚论证。

August 13, 2026 · 7 min

AI4AI at Test-Time:通过脚手架实现强到弱的能力迁移

Salesforce AI Research 提出强到弱脚手架范式:让强构建者模型为固定弱目标模型构建推理时脚手架,在不更新参数的前提下,将 GPT-5.4-mini 在四个心智理论基准上的宏平均准确率从 0.49 提升至 0.91。本文从背景、定位、问题定义、解法、知识反推、通用灵感六个维度精读全文。

August 13, 2026 · 6 min

EvoX Genesis:用持久递归世界让软件自主演化

深度精读 EvoX Genesis(arXiv 2608.10450):它把’持久化’从 agent 转移到项目,用持久递归世界在 120 小时、44 美元内从空仓库长出 25 万行 Rust C 编译器,跨模型替换保持测试全通过,并把 10 万行 Fortran MESA 重写为 9 万行 Rust 获得 1.55–6.87× 加速。

August 13, 2026 · 8 min

Spark-to-Paper:将端到端论文生成做成可组合技能

深度精读 Spark-to-Paper(arXiv:2608.11924)——一个把研究论文生成做成 13 个可组合技能、预注册式实验规划、Self-Refutation Loop、6 个确定性门控、双路径可编辑图表的端到端系统。引用有效率 99.5%、图表可编辑性 96.4%、伪造检测 14%→92%、每篇 $8.1 / 3.2h / 11.9M token。

August 13, 2026 · 5 min

【每日AI前沿追踪】2026年08月13日 核心技术与产业动态速递

Agent安全从训练时对齐走向运行时合约范式;测试时强到弱Harness迁移改写蒸馏范式;端到端论文生成验证可组合技能可行性;自主软件进化围绕持久化项目而非持久化Agent组织——四大方向共同推进Agent可靠性与自进化机制的深度融合。产业端DeepSeek Harness开源、Gemini 3.7 Flash发布、GPT-5.6 Sol Ultrafast模式同日引爆AI编程工具价格战。

August 13, 2026 · 3 min

【论文精读】SkillZip:面向可扩展 Agent 技能库的契约保持图压缩框架

深度解读 SkillZip(arXiv 2608.05604):一个执行感知的程序性抽象框架,通过节级图表示、MotifZip 契约保持压缩、PathHydrate 预算内水合和 ReZip 增量维护四大组件,在 ALFWorld 上提升 12.2 分、SkillsBench 上提升 6.2 分,同时实现 3.46× 压缩比、99.2% 依赖保持和 98.7% 验证器可达性,并在 100K 技能库上保持 248.3ms 延迟的稳定检索。

August 13, 2026 · 7 min

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence 精读

深度精读 arXiv:2608.12036——浙江大学 ZJUNLP 提出的 Mechanist 是一个用 AI 研究AI的自主智能体系统。它构建了约13000篇可解释性论文的知识图谱、整合4300万篇跨26学科论文库、沉淀32种机制分析方法,形成「假设生成→因果干预→验证循环」的闭环。在复现16篇论文的可靠性评估中,比 Claude Code 高出9-13%、比 AI Scientist 高出31-38%。更重磅的是,它自主发现了跨模态安全风险转移(不安全响应率从20.3%飙升至48.6%)、提出了完整的信念机制理论,并成功将机制洞察转化为DNA序列引导生成(α-螺旋含量从43.8%提升至56.6%)。这是一篇关于「让AI成为研究AI的科学仪器」的里程碑式工作。

August 13, 2026 · 5 min