What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets 精读

数千个持有真金白银的 LLM 交易 Agent 在生产环境里到底干了什么?DX Research Group 交出首份人群规模实录:两个生产系统六个月、750 万次模型调用、30 万链上动作。四个硬发现:运营层(滑块、渲染列表、下单路径)对行为的解释力碾压策略文本;仓位 sizing 对波动率完全失明(每个波动分位中位杠杆都是 5×);Agent 捕获不到自己够到的收益(43.2% 仓位曾浮盈 300bps,其中 49.3% 负收尾);以及一个诚实的 null result——两个 fleet 都没有方向性优势,前沿模型对打决策质量统计上不可区分。

September 10, 2026 · 2 min

EmbodiedSkills:把 VLA 动作预测升级为提案-验证循环的技能编排框架 精读

浙大×云深处科技等推出 EmbodiedSkills:把每个技能决策当作执行提案,守卫运行时执行前验证前置条件、执行后验证结果,固定的可执行技能契约连接 Qwen3-VL 高层选择与 π0.5 低层执行。RoboTwin 2.0 全 50 任务宏平均 86.20%(π0.5 基线 82.74%),LIBERO 四套件 97.40%,并诚实暴露记忆依赖任务 12.5% 的缺口。

September 9, 2026 · 2 min

FlowBalance:验证器锚定的自改进——把符号门控装进轨迹平衡 精读

腾讯 HY LLM Frontier×UPenn 推出 FlowBalance:冻结的特权后见视角对已采样轨迹打密集分,验证器组相对优势用符号门控决定引导方向(正保留/负反转/零关闭),profiled trajectory balance 拟合归一化目标分布。Qwen3-8B 五基准平均 67.61 超 GRPO/OPSD/RLSD/FlowRL,AIME24 达标 100 步 vs GRPO 143 步,四条目标级定理精确刻画反自确认机制。

September 9, 2026 · 2 min

Safety for Whom:把安全边界从话题级细化到边界级的数据配方 精读

Multiverse Computing 揭示话题级安全对齐的粒度错配:部署需要窄边界(拒操纵、答选举事实)而非话题级一刀切。提出窄边界形式化+离线自生成数据框架(受控话题生成/覆盖修复/补偿数据/边界对),Qwen3-8B 目标域拒绝 9.47%→84.75%、不安全率 26.26%→0.14%,并量化数据成分对安全-可用权衡的决定作用(过度拒绝 74%→5.2%)。

September 9, 2026 · 2 min

SimpleMemVLA:不做记忆模块的具身记忆——原生视频上下文的范式反转 精读

HUST×清华×面壁智能等推出 SimpleMemVLA:去掉检索/压缩/循环等专门记忆模块,把完整采样历史以时间戳视频格式直接喂给 VLM 主干,子任务隐藏状态作为唯一记忆通道。四个记忆基准全部 SOTA(RoboMME 88.3% vs 检索 31.5%/压缩 22.6%/循环 20.6%,真值感知上限也仅 84.1%),通用控制无损(LIBERO 97.5%),因果干预证实策略真实读取历史。

September 9, 2026 · 2 min

Split-LLM 隐私失效审计:返回梯度的零模式完美暴露真实数据 精读

独立研究者对两节点 split-LLM 训练的预注册审计:隐私损失忽略诱饵行→其返回梯度恰好为零→零模式逐帧完美暴露真实数据(9 种子 4096/4096 全中)。所有运行通过前向隐私检查与质量检查,加上返回梯度后同检查失败。逐行裁剪+加噪以 0.01 nats 代价封堵,并诚实声明五类未测攻击面。

September 9, 2026 · 2 min

TGOPD:在策略蒸馏前先验证教师——提示级可靠性门控 精读

AllSpark 团队推出 TGOPD:对每个提示用少量验证器打分的教师探针估计可靠性,通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD,35B LiveCodeBench 64.0(其他蒸馏方法全部负迁移),探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。

September 9, 2026 · 2 min

Uno:扩散增强 LLM 的无损加速范式——AR 与扩散在同一架构内的参数解耦 精读

MBZUAI×Cerebras 等推出 Uno:在同一 Transformer 内解耦 AR 权重(质量)与 rank-128 LoRA 扩散适配器(速度),冻结 AR 后仅用 7B token 做块级单步扩散蒸馏,配合 Ψ-Spec 采样器做 AR 验证的拒绝采样,实现严格无损、全 batch 区间保持的至高 3× 加速。8B 模型 SWE-bench Verified 68.4%,系统吞吐 5733 toks/s 全面超越 EAGLE-3/DFlash 与闭源 Mercury 2。

September 9, 2026 · 3 min

Bilevel Coordinated Reflection: 多智能体 LLM 系统的博弈论统一理论 精读

UCL×利物浦×华为的 BCR 把 orchestrator–worker 多智能体系统建模为双层协调博弈,证明 follower 子游戏是近似势博弈,并首次给出’只看文本的门控不可能可靠’的信息论不可能性定理。据此提出的 SRMA 仅在环境验证风险严格下降时接受候选记忆,SWE-bench 500 实例解决率 72.2%(免费反思仅 58.4%)。本文精读其双层博弈建模、漂移分析、不可能性定理与 SWE-bench 端到端验证的完整因果链。

September 8, 2026 · 2 min

CoSkill: 把元技能变成可学习智能体 — 分层技能库的联合强化学习 精读

中科院自动化所×人大的 CoSkill 把静态元技能工作流重构为可学习的 Meta-Skill Agent,与 Reasoning Agent 共享单骨干联合 RL:推理智能体条件于检索到的任务技能与子技能,任务表现反向指导元技能精炼。ALFWorld 98.4%(+3.5pp)、WebShop 90.6%(+6.2pp),样本效率与墙钟效率全面占优。本文精读’技能从被动对象到主动协作者’的范式转变。

September 8, 2026 · 2 min