SWE-Bench Pro Verified + Shortcutting the Fix:SWE Agent 评测的可靠性双警报 精读

两篇同期论文从互补方向敲响 SWE Agent 评测的警钟。上海AI实验室的 SWE-Bench Pro Verified 用反作弊防护与任务修正重构评测:GLM-5.2 成绩从 78.80% 骤降至 57.32%(-21.48pp,186 个 PASS 翻 FAIL,McNemar p<0.001),而 DeepSeek-V4-Pro 几乎不变——原分数里藏着大规模 reward hacking。NVIDIA 的 Shortcutting the Fix 用轨迹级审计给出机制证据:五个开源模型在 SWE-bench Multilingual 上作弊率 45.1–82.4%,一句’方案原创性’指令就能压到 4.0–10.7%,且 DeepSWE 上性能基本不降。本文精读把两文合读:评测分数虚高有多大、从哪来、怎么堵。

September 10, 2026 · 3 min

What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets 精读

数千个持有真金白银的 LLM 交易 Agent 在生产环境里到底干了什么?DX Research Group 交出首份人群规模实录:两个生产系统六个月、750 万次模型调用、30 万链上动作。四个硬发现:运营层(滑块、渲染列表、下单路径)对行为的解释力碾压策略文本;仓位 sizing 对波动率完全失明(每个波动分位中位杠杆都是 5×);Agent 捕获不到自己够到的收益(43.2% 仓位曾浮盈 300bps,其中 49.3% 负收尾);以及一个诚实的 null result——两个 fleet 都没有方向性优势,前沿模型对打决策质量统计上不可区分。

September 10, 2026 · 2 min

兰小欢:重要的事,大多无法预测|把握自己能把握的,做难的事

《置身事内》作者兰小欢在"大方之谈"访谈中反复回到同一组命题:真正重要的事都难以预料,可预测的事都不重要;宏观不可知,个体能把握的只有自己的微观世界。他谈飞升即走的焦虑与"继续做"、百万册畅销书背后的"懵"、AI从工具变成深度协作的伙伴(一天用十小时就不叫工具)、出海"谁做难的事谁就有真正的进入壁垒",以及人多的地方"至少是平均的选择"。这是一期经济学家的非典型访谈:不谈预测,谈在不确定世界里怎么做事、怎么自处。

September 10, 2026 · 1 min

通专融合、转换层与不可外包的使命感:AI科学家周伯文的世界观

澎湃《大方之谈》第十九期对话上海人工智能实验室主任周伯文。他主张 AGI 是通用与专业的融合,并将其落成「智者SAGE」三层架构;节目最新鲜的信息是他自称首次公开的「转换层」主张——防止行业 know-how 随使用反馈沉入基础模型层,他举例称 Claude 每推出一个行业插件,对应行业股票总市值最多被打掉 40%。他还重述了 1905 年思想实验:AI 若能推导出广义相对论,科学发现就从偶然变成必然;而人的使命感、批判性与品味不可外包。

September 10, 2026 · 2 min

【每日AI前沿追踪】2026年09月09日 核心技术与产业动态速递

9月8日AI领域三大主线:MBZUAI×Cerebras 等产学研联合推出 Uno 扩散增强模型实现无损 3× 推理加速;腾讯×UPenn FlowBalance 与 AllSpark TGOPD 从两个方向攻克自训练中’密集信号不可靠’的共性难题;OpenAI 声称内部 AI 系统求解 Navier-Stokes 千禧年难题引发署名争议,Anthropic 签下 5170 亿美元算力协议,Mistral 完成 30 亿欧元 D 轮。

September 9, 2026 · 6 min

83亿虚拟人格,与一门押注未来的生意:AI模拟离预测人类还有多远

硅谷101本期梳理 AI simulation 赛道:从斯坦福小镇 25 个智能体到哈佛、MIT 两百多位科学家参与、镜像全人类 83 亿人格的 Matrix 项目,再到 Simule(估值超 20 亿美元)与 Aaru(估值近 10 亿美元)两条商业化路线——前者高保真还原个体,后者群体规模换速度。节目核心判断是:这类公司的估值并非由当前营收支撑,而是提前押注未来的决策市场;真正卡住这门生意的,是评估标准缺失、预测无法自证的验证悖论,以及指数膨胀的算力成本。

September 9, 2026 · 2 min

EmbodiedSkills:把 VLA 动作预测升级为提案-验证循环的技能编排框架 精读

浙大×云深处科技等推出 EmbodiedSkills:把每个技能决策当作执行提案,守卫运行时执行前验证前置条件、执行后验证结果,固定的可执行技能契约连接 Qwen3-VL 高层选择与 π0.5 低层执行。RoboTwin 2.0 全 50 任务宏平均 86.20%(π0.5 基线 82.74%),LIBERO 四套件 97.40%,并诚实暴露记忆依赖任务 12.5% 的缺口。

September 9, 2026 · 2 min

FlowBalance:验证器锚定的自改进——把符号门控装进轨迹平衡 精读

腾讯 HY LLM Frontier×UPenn 推出 FlowBalance:冻结的特权后见视角对已采样轨迹打密集分,验证器组相对优势用符号门控决定引导方向(正保留/负反转/零关闭),profiled trajectory balance 拟合归一化目标分布。Qwen3-8B 五基准平均 67.61 超 GRPO/OPSD/RLSD/FlowRL,AIME24 达标 100 步 vs GRPO 143 步,四条目标级定理精确刻画反自确认机制。

September 9, 2026 · 2 min

Safety for Whom:把安全边界从话题级细化到边界级的数据配方 精读

Multiverse Computing 揭示话题级安全对齐的粒度错配:部署需要窄边界(拒操纵、答选举事实)而非话题级一刀切。提出窄边界形式化+离线自生成数据框架(受控话题生成/覆盖修复/补偿数据/边界对),Qwen3-8B 目标域拒绝 9.47%→84.75%、不安全率 26.26%→0.14%,并量化数据成分对安全-可用权衡的决定作用(过度拒绝 74%→5.2%)。

September 9, 2026 · 2 min

SimpleMemVLA:不做记忆模块的具身记忆——原生视频上下文的范式反转 精读

HUST×清华×面壁智能等推出 SimpleMemVLA:去掉检索/压缩/循环等专门记忆模块,把完整采样历史以时间戳视频格式直接喂给 VLM 主干,子任务隐藏状态作为唯一记忆通道。四个记忆基准全部 SOTA(RoboMME 88.3% vs 检索 31.5%/压缩 22.6%/循环 20.6%,真值感知上限也仅 84.1%),通用控制无损(LIBERO 97.5%),因果干预证实策略真实读取历史。

September 9, 2026 · 2 min