Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs 精读

腾讯朱雀实验室提出第三方托管LLM API的威胁模型驱动黑盒审计方法:把“服务商是否真的在跑你购买的模型”形式化为随机路由过程估计问题——模型名只是声明而非密码学证明。Ventor-QTest无需目标API任何概率信息:重复请求组件对冻结约束上下文多次重发、从返回文本计数重构类别输出分布,联合报告平均保真损失(AFL)与最坏情况期望保真损失(EFL)双指标,覆盖“平均诚实但最坏降级”的攻击面。论文论证两指标须联合报告(尤其对长时程agentic任务的最坏行为敏感),工具已开源并入腾讯AI-Infra-Guard。

August 19, 2026 · 1 min

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 精读

港科大广州与腾讯TEG AIPD联合发布VibeWorlding——首个面向vibe worlding agent(从用户查询端到端构建可交互3D开放世界)的开源基准+训练统一框架:VWE-Bench提供2616个高质量3D资产、323个人标种子世界、6828条逆向合成多模态查询与双约束验证器(物理可行性+意图满足);VibeWorlding-Gym把资产检索/编辑/渲染统一为MCP工具沙盒并以rubric奖励驱动GRPO多模态RL后训练。实验揭示GPT-5.5(57.3%)与Qwen3.8-Max(56.9%)均远未解决该任务、瓶颈定位在精确3D世界编辑;RL后训练使开源Qwen3-VL-30B-A3B从13.6%升至59.3%全场第一,8B版41.4%比肩Gemini 3.1-pro。验证器与人类判断系统级排序相关ρ=0.88,为agentic RL提供了可靠奖励服务。

August 19, 2026 · 2 min

物理AI的下一站:让AI发现人类不知道的方程

机器之心对话东方理工陈云天:从"知识嵌入"到"知识发现"的双向耦合范式。用AI从真实实验数据中找出人类未知的控制方程(如海浪破碎方程),用机械臂高通量实验找色谱方程替代耗时实验;他判断AI科学家"一定到了这个节点",但资本市场节奏与湿实验闭环的天然慢速之间正在撕开一个gap,而通用模型"每个行业都很浅",真正的机会在把物理一致性嵌进专业模型。

August 19, 2026 · 1 min

【每日AI前沿追踪】2026年08月18日 核心技术与产业动态速递

8月18日核心动态:Cursor在GitHub全球宕机同日发布Origin代码托管平台正面挑战GitHub;Anthropic年化收入飙升至650亿美元为IPO铺路,同时披露未发布的Model 2模型;OpenRouter将GPT-5.6 Sol调用费用下调50%引发价格战预期。学术方面:StateM用15美元的harness scaling在Terminal-Bench 2.1做到95.3%原始准确率,证明模型不是瓶颈、执行系统才是;HarnessEval-W把agentify范式引入世界模型评测,人类偏好相关性达0.93;VibeWorlding让8B开源模型经RL后训练比肩Gemini 3.1-pro;AutoResearchEval解剖800条科研Agent轨迹发现元认知循环缺失是跨模型共通短板。

August 18, 2026 · 8 min

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents 精读

长程Agent任务中早期错误同时污染上下文与环境状态,现有方法(计划精化/安全检查)只防错不恢复。中科院与清华团队提出AgentRewind:对齐记录Agent上下文与受控环境的检查点,Agent判断无法推进时回滚到早期状态并以前次尝试摘要指导续作;配套MettleBench(含隐藏有序验收清单的长程工程任务)。Terminal-Bench 2.0全量上成功率83.1% vs Continue的78.7%与Restart的70.8%;回滚增益随执行horizon增长显著扩大。案例研究揭示三策略本质差异:Continue在污染状态上修补、Restart丢弃已完成成果、Rewind选择性回滚+经验注入。

August 18, 2026 · 1 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

自动化研究Agent的评测长期被“最终分数”主导,无法回答进步从哪来、失败藏何处、经验是否有用。美团与中科院国科大团队花费约10万美元推理成本,对7个前沿模型36个长程任务756次rollout做系统解剖:提出C1方案构架/C2执行/C3反馈控制三个规则驱动的过程指标+任务内/跨任务经验复用反事实实验。结论是当前Agent更像“勤奋的工程优化器”而非自主研究者:avg@3差距0.237而best@3仅0.122(可靠性比峰值更具区分度);252个最优解中真正新颖方法仅3个(1.2%),钻评测空子的却有16个(6.3%);经验迁移使DeepSeek-V4-Pro +0.093却使Gemini-3.1-Pro -0.017;自动harness进化+0.123且可跨模型迁移。

August 18, 2026 · 1 min

Demystifying Agent Skills: Why They Work—Until They Don't 精读

技能已成为增强LLM Agent的热门方案,但“技能为何有效、何时失效”一直缺乏机制层面的回答。Princeton、Stanford、UCSD、USC、JHU五校联合团队通过8135条受控试验与238个开放编码标签,首次给出定量答案:技能的本质作用是程序性锚定(占65.7%)而非知识注入(仅4.5%),比Workflow Memory高6.06分;检索是独立瓶颈——技能池从5增至100时实际使用精确率从29.6%崩至3.3%,但下游成功率却保持稳定;技能还会引入新的调用失败面(误用率10.0% vs 裸执行的0.8%)。本文从背景、定位、问题抽象、解法机制、实验证据到根源解释逐层拆解,并提炼技能生命周期化的通用工程启示。

August 18, 2026 · 1 min

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 精读

Transformer的知识(FFN)与推理(Self-Attention)逐层绑定,模型只能靠冗长CoT弥补深层知识无法回传浅层的缺陷。上海AI Lab提出Mobius架构:全局共享的Memory(FFN知识向量库)+多个Reasoner(Self-Attention)以隐状态为载体反复查询知识库,原生获得反向残差连接与动态隐推理两大能力。7B从零训练以62.6%数据达到Transformer同等MMLU(1.6倍数据效率),Intern-S2-Mobius-35B持续预训练后MMLU Pro 89.05超Qwen3.5的85.31,端到端推理加速近4倍、输出token缩短1.2–5倍。本文拆解其知识-推理解耦机制、两大原生能力的因果链,并展望自进化、世界模型与软硬件协同四个延伸方向。

August 18, 2026 · 1 min

Latent On-Policy Self-Distillation 精读

在线策略自蒸馏(OPSD)用特权上下文让自教师比学生更知情,但特权格式由设计师手工规定——答案、反馈、技能或轨迹,各有盲区。NPS与上交团队提出LOPD:让特权上下文本身从经验中端到端学习——检索相关经验经作曲器压缩为96个连续隐token条件化自教师,特权间隔约束防止教师向学生坍缩,训练后只留学生。全部10个骨干-基准组合获最佳聚合结果:Qwen3-8B EnvScaler 66.4 vs 最强基线60.2;以不到GRPO/Skill-SD 30%的rollout预算超越两者。消融直接证明:隐上下文联合学习是全部增益的必要条件。

August 18, 2026 · 1 min

LegacyWorld: Atomicity-Aware Evaluation of GUI Agents for Legacy Workflows 精读

遗留企业系统的有状态GUI工作流中,失败的Agent运行仍可能在业务/医疗记录里留下持久污染——任务成功率完全掩盖这一状态安全风险。TUM团队与医疗/管理领域专家共建LegacyWorld:28个Windows GUI工作流(18个经外部验证,含DSWin牙科、OpenMRS医疗等真实系统),提出原子性四维结果模型(有效成功/无效成功/有效失败/无效失败)。评测发现触目对比:GPT-5.4原子性100%但有效成功仅3.6%(保守不作为);Opus-4.6有效成功78.6%但伴随非原子结果;Kimi K2.5有效成功42.9%却有最大不安全副作用率35.7%。单一指标无法同时度量自动化价值与状态安全。

August 18, 2026 · 1 min