论文链接:arXiv:2609.22978 存储开源:github.com/kvcache-ai/AgentENV/tree/main/storage/overlaybd 发表时间:2026 年 9 月 机构:DeepSeek-AI + 清华大学(校企合作,第一作者 Jialiang Huang 为在 DeepSeek 实习的清华博士生) 领域标签:cs.DC / 系统 / 强化学习基础设施 / Agent 沙盒
一、论文背景
1.1 什么是「Agentic 训练」,为什么它格外吃基础设施
近年来,大语言模型正在从「对话」走向「Agent(智能体)」:模型不再只生成一段文本,而是在环境里多步行动——调用工具、读写文件、跑代码、观察反馈,再决定下一步。要让 Agent 变强,主流做法是 Agentic RL(智能体强化学习):让 Agent 在大量环境里试错,依据环境给的奖励(reward)更新模型。
这类训练对基础设施提出了和普通 LLM 训练完全不同的要求:
- 海量、异构的环境:要训练一个会写代码、会查资料、会操作的 Agent,需要成千上万个「沙盒环境」同时跑——每个环境可能是不同的操作系统镜像、装了不同的软件、预置了不同的任务。
- 高密度、短生命周期:每个训练步会产生成百上千条 Agent 轨迹,每条轨迹对应一个临时沙盒;沙盒创建/销毁极频繁(秒级),且峰值并发巨大。
- 与 GPU 训练耦合:Agent 的「大脑」(模型推理)跑在 GPU 上,而「身体」(环境交互)跑在 CPU/沙盒里;二者必须高效协同。
1.2 现有方案的三个瓶颈
论文指出,直接用现有容器/虚拟化技术做 Agentic 训练,会撞上三道墙:
瓶颈一:环境镜像的组合爆炸。 假设有 M 种「基础工具集」和 N 种「任务场景」,朴素做法是给每种组合都打一个完整镜像——镜像数 = M×N,即 O(mN)。当 M、N 增长,存储与分发成本爆炸。
瓶颈二:资源密度上不去。 传统容器/虚拟机为每个沙盒预留大量内存与 CPU,导致单节点能跑的沙盒数有限;而 Agent 沙盒往往「大部分时间空闲、偶尔忙」,资源利用率低。
瓶颈三:镜像加载太慢、太重。 每次创建沙盒都要把完整镜像拉下来、解压、启动——在「每秒数千创建」的训练节奏下,这是致命延迟。且大量重复镜像层造成磁盘写放大。
1.3 一个核心设计哲学
DSec 的出发点是一个朴素却关键的判断:Agentic 训练的本质是「在弹性、隔离、短暂的环境里高频试错」。因此基础设施不该把每个环境当成「一台长命的机器」,而该把它当成「一个可秒级拼装、用完即弃、且能复用公共部件的计算单元」。围绕这个哲学,DSec 用三支柱拆解上述三道墙。
二、论文定位和关联工作
DSec 处在「为 LLM/Agent 训练服务的沙盒与弹性计算」这一交叉领域。按谱系梳理:
2.1 Serverless 沙盒系统
- SAND(Akkus et al., 2018):早期 serverless 容器系统,关注轻量、快速启动的函式执行环境。
- RunD(Li et al., 2022):基于轻量安全容器(microVM)、单节点可跑 2000+ 容器,常借助 Firecracker 等 microVM 技术。
- REAP / TrEnv:面向 ML 训练的环境管理系统。
这些工作解决了「轻量沙盒」的某一方面,但多面向通用 serverless 或普通训练,**未专门针对 Agentic RL 的「海量异构环境 + 与 GPU 训练协同 + 可抢占弹性」**做端到端设计。
2.2 商业/产品级 Agent 沙盒
- E2B、OpenAI Code Interpreter、Kimi-K2.5 等:提供代码执行/工具调用的沙盒能力,面向推理期(inference-time)的 Agent 使用,而非大规模训练期的批量环境供给。
2.3 底层存储与虚拟化技术
- DADI / CoFS / FaaSNet:面向函数的快速镜像分发与存储优化;
- EROFS:只读压缩文件系统(华为开源,主打高吞吐、省空间);
- Firecracker:AWS 的 microVM 技术,轻量安全虚拟化基石。
DSec 站在这些底层技术之上,组合出面向训练的新系统。
2.4 RL 训练基础设施
- Slime / veRL / OpenRLHF / Seer:各类 RL 训练框架,关注「如何高效跑 RL 训练循环」。但它们通常假设「环境已经备好」,较少深入环境供给本身的规模化问题——这正是 DSec 补上的那一层。
2.5 定位小结
| 维度 | 前人路线 | DSec 的突破 |
|---|---|---|
| 环境组合 | O(mN) 全量镜像 | overlayfs+EROFS 可组合层,降到 O(m) |
| 资源密度 | 传统容器/VM 预留多 | virtio-pmem+DAX+DAMON+核调度,microVM 内存峰值 −40.2% |
| 镜像加载 | 全量拉取/解压 | 3FS 按需懒加载,EROFS 比 tar 快 1.76× |
| 与训练协同 | 环境/训练割裂 | Agent 循环与可抢占 GPU 解耦,支持弹性训练 |
| 规模目标 | 通用 serverless | 300 万沙盒/日、38 万并发、>5000/秒 |
三、问题定义
3.1 把「Agentic 训练的基础设施」抽象成什么
DSec 面对的具体问题:给定一个 RL 训练循环,每秒需要创建/销毁海量短时沙盒,每个沙盒(a)必须是某任务环境的准确副本、(b)彼此隔离、(c)资源占用尽量小、(d)启动尽量快、(e)能与 GPU 上的模型推理解耦地协同。
论文把它抽象为三个可独立优化的子问题:
子问题 1(环境组合):给定 M 个基础层与 N 个任务变体,如何以 O(m) 而非 O(mN) 的存储与分发成本,按需拼装出任意「M×N」组合的环境镜像? 子问题 2(资源密度):在隔离性不降级的前提下,如何把一个物理节点能承载的沙盒数最大化、且峰值内存/CPU 干扰最小化? 子问题 3(弹性协同):如何让 Agent 的环境交互循环与「可抢占的 GPU 推理」解耦,从而能用廉价的可抢占算力做大规模训练?
3.2 一个类比
把 DSec 想象成一个**「乐高式」的临时实验室工厂**:
- 旧做法(O(mN)):为「化学+生物」、「物理+生物」、「化学+地理」……每一种组合,都盖一座完整独立的实验室。组合数一多,土地(存储)和建造时间(加载)都爆了。
- DSec 做法:先盖好「化学间、生物间、物理间、地理间」几个公共模块(基础层),再给每个任务加一个薄薄的专属插件层(overlay)。要「化学+生物」实验室?把化学间和生物间叠一起即可。模块数 = M+N,而非 M×N。
而「高密度资源」相当于让每个实验室「人走灯灭、按需供电」,「弹性协同」相当于让「实验员(Agent 循环)」和「超级计算机(GPU)」通过统一工单系统解耦——计算机随时可能被调走(抢占),但实验员的进度单(状态)保存在一个可靠的地方,计算机回来就能续上。
四、问题解法
DSec 用三大支柱对应三个子问题,外加一个把一切串起来的控制平面。
4.1 支柱一:可组合环境层(解决 O(mN) 爆炸)
核心机制:overlayfs + EROFS。
- 基础层(base layer):用 EROFS(只读压缩文件系统)存放不变的基础环境(如操作系统、通用工具链)。EROFS 高压缩比、高读取吞吐,适合「只读 + 多实例共享」。
- 可组合覆盖层(overlay):每个任务变体只需一个薄 overlay 层,叠在基础层之上。运行时通过 overlayfs 把「基础只读层 + 任务 overlay 层」合并成 Agent 看到的完整文件系统视图。
- 复杂度收益:原本需要 M×N 个完整镜像,现在只需 M 个基础层 + N 个任务层 = O(m)(m = M+N)。存储与镜像分发成本从乘积级降到加和级。
- 存储层开源:论文把存储侧的 OverlayBD 实现开源(见文首链接),作为可组合镜像的底层支撑。
4.2 支柱二:高密度资源管理(解决密度上不去)
在 microVM(轻量虚拟机,基于 Firecracker 一类技术)里做精细化资源治理:
- virtio-pmem + DAX:用虚拟化持久内存设备 + 直接访问(DAX,绕过页缓存)来承载某些内存映射需求,显著降低 microVM 的内存峰值占用。论文实测 microVM 峰值内存降 40.2%。
- DAMON + balloon 空闲页上报:DAMON 是 Linux 的内存访问监控;配合 balloon 驱动把「被沙盒分配但实际空闲」的页回收给宿主机。论文实测 时间积分内存(time-integrated memory)降 21.2%。
- 核调度(core scheduling)+ SCHED_IDLE:把沙盒这类「可抢占、低优先」的 CPU 工作,调度到与关键 GPU 工作不同的 SMT 兄弟核,并以 SCHED_IDLE 降级其优先级,避免沙盒的 CPU 噪声干扰 GPU 上的推理吞吐。论文实测 CPU QoS 的 SMT 延迟从 45.2% 降到 17.3%。
4.3 支柱三:3FS 按需镜像加载(解决加载慢/写放大)
- 3FS(DeepSeek 的分布式文件系统)存放环境镜像。DSec 不在创建沙盒时「全量拉取」,而是按需(on-demand)加载——只把启动与当前执行真正需要的镜像块从 3FS 拉到本地,其余懒加载。
- 收益:启动延迟大幅降低;同时由于只读基础层被多实例共享、overlay 仅含增量,磁盘写被大幅削减。论文实测 8192 容器突发比 eager Docker 快 1.71×、磁盘写少 57%;EROFS 镜像加载比 tar 快 1.76×。
4.4 支柱四:Agent 循环与可抢占 GPU 解耦(弹性训练)
这是 DSec 与「普通沙盒系统」最不同的地方——它为 RL 训练而生:
- 解耦架构:Agent 的「推理/决策循环」(在哪调用模型、怎么把观测喂回模型)跑在沙盒侧;模型的「前向推理」(GPU 计算)跑在独立、可抢占的 GPU 池里。两者通过明确定义的接口通信。
- 可抢占(preemptible)GPU:训练可以用廉价的「可抢占/竞价 GPU」——一旦 GPU 被云厂商收回,Agent 循环的状态(轨迹进度、环境状态)仍保存在沙盒里;GPU 回来后从断点续训。这把「训练可用性」从「必须常驻昂贵 GPU」变成「弹性复用闲置算力」。
- 奖励黑客(reward hacking)缓解:环境通过 AppArmor + eBPF 做访问控制,限制 Agent 能触碰的文件/系统调用,降低其通过「篡改环境/奖励信号」作弊的可能——这是 Agentic RL 里一个现实且棘手的问题。
4.5 控制平面:libdsec + IAM/apiserver/placement/watcher + edge/aether/chronus
- libdsec SDK:Agent 侧的用户态库,训练代码用它来「请求一个沙盒」;
- IAM:身份认证与访问控制;
- apiserver:对外 API 入口;
- placement:把沙盒调度到合适节点;
- watcher:监控与故障恢复;
- edge:节点上的数据面 agent,真正创建/销毁沙盒;
- aether / chronus:控制面与(时间/调度相关的)协调组件;
- 3FS:底层按需镜像存储。
4.6 全景对照
| 支柱 | 输入 | 关键技术 | 输出/收益 |
|---|---|---|---|
| 可组合环境 | M 基础 + N 任务 | overlayfs + EROFS + OverlayBD | O(m) 镜像,免 O(mN) |
| 高密度资源 | microVM | virtio-pmem/DAX、DAMON+balloon、核调度 | 峰值内存 −40.2%,SMT 延迟 45.2%→17.3% |
| 按需镜像 | 3FS 镜像 | 懒加载 on-demand | 突发快 1.71×,写少 57%,EROFS 快 1.76× |
| 弹性协同 | Agent 循环 + GPU | 解耦 + 可抢占 + AppArmor/eBPF | 支持竞价 GPU 训练、抑奖励黑客 |
五、评估指标与实验证据
5.1 评估维度
论文从「性能/成本」「资源效率」「规模」三个维度评估,且所有数字来自 DeepSeek 真实训练集群的部署。
5.2 性能与成本(突发创建)
- 8192 容器突发测试:DSec 相比「eager Docker」(每次都全量拉起)快 1.71×,且磁盘写少 57%。这直接证明「按需加载 + 可组合层」对冲掉了全量拉起的冗余。
- EROFS vs tar:只读镜像用 EROFS 加载比传统 tar 解压快 1.76×——印证基础层选 EROFS 的取舍正确。
5.3 资源效率(microVM 密度)
- virtio-pmem + DAX:microVM 峰值内存降 40.2%——同样物理内存能塞下更多沙盒。
- DAMON + balloon:时间积分内存降 21.2%——不只是峰值,整个训练过程的「内存-时间」积分都更省。
- 核调度 + SCHED_IDLE:CPU QoS 的 SMT 延迟从 45.2% 降到 17.3%——沙盒的 CPU 噪声对同核 GPU 工作的干扰被显著压低,保护推理吞吐。
5.4 规模(生产部署)
DSec 在 DeepSeek 的真实训练里达到:
- 300 万(3M)沙盒/日;
- 峰值 38 万(380k)并发沙盒;
- >5000 个/秒的沙盒创建速率。
这些数字说明它不只是「实验室原型」,而是扛住了工业级 Agentic RL 的训练节奏。
5.5 指标如何支撑核心主张
| 实验 | 设定 | 结果 | 支撑的主张 |
|---|---|---|---|
| 8192 容器突发 | DSec vs eager Docker | 1.71× 更快、写少 57% | 可组合层+按需加载消除冗余 |
| 镜像格式 | EROFS vs tar | 1.76× 更快 | 基础层选 EROFS 正确 |
| microVM 内存 | +virtio-pmem/DAX | 峰值 −40.2% | 高密度资源支柱有效 |
| 内存积分 | +DAMON/balloon | −21.2% | 空闲页回收有效 |
| CPU QoS | +核调度/SCHED_IDLE | SMT 延迟 45.2%→17.3% | 隔离 GPU 噪声有效 |
| 生产规模 | 真实集群 | 3M/日、380k 并发、>5000/s | 工业级可扩展性 |
证据链清晰:每一项资源/性能优化都对应一个具体机制,且最终汇聚到「工业级规模」这一总体验证。
六、效果优势的根源解释
6.1 根源机制与证据链
因果链 1:组合而非复制 → 消除 O(mN) 冗余。
朴素方案给每种 M×N 组合存完整镜像 → 存储/分发随组合乘积爆炸 → DSec 用「只读基础层(EROFS)+ 薄 overlay(overlayfs)」按需拼装 → 镜像数降到 O(m) → 8192 突发快 1.71×、写少 57%、EROFS 加载快 1.76×。 证据等级:论文实验已支持(突发测试、EROFS 对比)。
因果链 2:精细化内存/CPU 治理 → 密度质变。
传统 microVM 为每个实例预留内存 → 峰值内存高、节点密度低 → DSec 用 virtio-pmem/DAX 把部分内存映射移出常驻占用、用 DAMON+balloon 回收空闲页、用核调度把沙盒隔离出 GPU 关键核 → 峰值内存 −40.2%、积分内存 −21.2%、SMT 延迟 45.2%→17.3% → 单节点沙盒数显著提升。 证据等级:论文实验已支持(microVM 与 CPU QoS 实测)。
因果链 3:状态与算力解耦 → 弹性可规模化。
Agent 循环状态存于沙盒、独立于 GPU → GPU 可抢占/竞价而不丢训练进度 → 训练能用廉价闲置算力横向扩 → 达成 3M/日、380k 并发、>5000/s。 证据等级:论文实验已支持(生产规模数字);「可抢占 GPU 提升总利用率」属论文合理工程结论。
因果链 4(安全):访问隔离抑制奖励黑客。
Agentic RL 中 Agent 可能篡改环境/奖励作弊 → AppArmor+eBPF 限制其系统调用与文件访问 → 作弊面收窄。 证据等级:论文设计性论述 + 机制合理;具体「作弊率下降多少」论文未给量化,属机制推测,标注为论文主张未量化。
反事实推理:若退回 eager Docker(全量拉起、无组合层),则 8192 突发会变慢且写放大,且镜像存储随任务数乘积增长——直接反证组合层的必要性。若 microVM 不用 virtio-pmem/DAX 与 DAMON,则密度回到传统水平,38 万并发所需节点数将数倍增加。
6.2 相关工作检索与对照(WebSearch 交叉验证)
围绕「serverless 沙盒(SAND/RunD)」与「RL 训练基础设施(AgentGym/AgentScale)」做外部检索,注意区分「方法相似」与「结论相近」。
| 研究(可核验链接) | 相似尝试(方法) | 相关结论 | 与 DSec 的差异与边界 | 对根源解释的影响 |
|---|---|---|---|---|
| SAND(Akkus et al., 2018;ATC'18)早期 serverless 容器系统,强调轻量快速启动 | 方法相似:轻量沙盒/快速启动理念 | 证明「为短任务设计轻量执行环境」可行且高效 | 面向通用 serverless 函式,未针对 Agentic RL 的海量异构环境与 GPU 协同 | 支持因果链1 的「轻量快速」方向,但 DSec 在组合层上更进一步 |
| RunD(Li et al., 2022;面向 ML 的轻量安全容器)单节点 2000+ microVM,基于 Firecracker | 方法相似:microVM 高密度 + 安全隔离 | 证明 microVM 可把单节点容器密度推到千级 | 它解决「密度」,DSec 额外解决「组合镜像 + 与训练协同 + 按需加载」 | 支持因果链2 的 microVM 高密度路线 |
| AgentGym(Xi et al., 2024/2025)14 个环境、89 个任务的 Agent 训练框架,支持 RL+模仿、AgentEvol | 场景相似:为 Agent RL 提供多环境 | 结论:多样化环境对 Agent 能力泛化至关重要 | AgentGym 关注「环境与算法」,DSec 关注「环境如何规模化供给」——互补而非竞争 | 支持因果链1 动机:Agent RL 确实需要海量环境,DSec 补供给层 |
| AgentScale / 同类 RL 训练规模化工作关注把 RL 训练跑到大规模 | 目标相近:RL 训练规模化 | 共识:环境供给是规模化瓶颈之一 | DSec 给出「弹性+可抢占+解耦」的具体解法 | 支持因果链3 的规模化动机 |
| **3FS / Fire-Flyer(DeepSeek 开源基础设施)**分布式文件系统(6.6 TB/s 聚合读、NVMe+RDMA+CRAQ) | 方法相同(同源):DSec 的按需镜像即建于 3FS | 3FS 高吞吐使「按需懒加载」在训练节奏下可行 | 属 DSec 的底层依赖,非外部独立验证 | 支持因果链3 的按需加载可行性 |
| **Firecracker(AWS)**microVM 技术基石 | 方法相同(底层):DSec 的 microVM 基于此思路 | 轻量安全虚拟化的工业标准 | 同属底层技术 | 支持因果链2 的 microVM 路线 |
证据缺口说明:本次检索覆盖 SAND、RunD、AgentGym、3FS/Fire-Flyer、Firecracker 等直接相关工作。在检索范围内,未发现「把 overlayfs+EROFS 可组合层、virtio-pmem/DAX+DAMON 高密度治理、3FS 按需镜像、Agent 循环与可抢占 GPU 解耦这四者端到端组合、并用 300 万/日级生产数据验证」的公开同名系统——DSec 的端到端组合是其增量。亦未发现否定「组合层能消除 O(mN) 冗余」的反例(该结论与 overlayfs/容器分层的标准认知一致)。
6.3 综合判断与未决问题
- 多研究共同支持的机制:(a) 轻量/microVM 沙盒高密度可行(SAND/RunD 共识);(b) Agent RL 需要海量多样环境(AgentGym 共识);(c) 高吞吐分布式存储使懒加载可行(3FS 实证)。
- 本文强支撑的机制:可组合层降 O(mN)→O(m)、virtio-pmem/DAX 与 DAMON 降内存、核调度隔离 GPU 噪声、按需加载提速——均由具体实测数字支撑。
- 仍属设计论述/待量化:AppArmor+eBPF 对「奖励黑客」的实际抑制幅度未给量化;可抢占 GPU 对「总训练成本」的净节省未给端到端账单对比。
- 优势成立的条件:训练负载具备「环境异构 + 短时高频 + 与 GPU 推理可分离」特征(典型 Agentic RL 符合)。
- 可能失效的条件:若 Agent 与环境状态强耦合、难以在沙盒侧保存断点,则「GPU 可抢占解耦」收益下降;若环境几乎不可分层(大量任务专属写操作),overlay 的共享收益收窄。
七、必要知识反推
一个无基础者要做出 DSec,须掌握并融合:
7.1 领域知识层
- 容器与虚拟化:Docker/overlayfs 原理、microVM 与 Firecracker、只读层与可写层的联合挂载。不懂这个就无法设计可组合环境。
- 文件系统与存储:EROFS、DAX、virtio-pmem、分布式文件系统(3FS 类的 NVMe+RDMA)的角色。
- RL/Agentic 训练流程:Agent 循环、奖励、可抢占算力的含义——否则无法理解「为何要与 GPU 解耦」。
7.2 方法论知识层
- 操作系统资源治理:Linux 内存管理(balloon、空闲页回收)、DAMON 访问监控、CPU 调度(core scheduling、SCHED_IDLE、SMT 干扰)。
- 安全隔离:AppArmor、eBPF 如何限制系统调用与文件访问,以抑制奖励黑客。
7.3 工程知识层
- 分布式控制平面设计:SDK/IAM/apiserver/placement/watcher/edge 的分工与故障恢复(watcher 如何重建失败的沙盒)。
- 性能评测方法:如何测「突发创建延迟、磁盘写、峰值/积分内存、SMT 延迟、并发与创建速率」。
7.4 知识融合的关键节点
创造性节点在于:把「训练需要的环境」重新理解为「可分层拼装、可弹性复用、与算力解耦的计算单元」,并用「overlayfs+EROFS 组合层 + microVM 精细治理 + 3FS 懒加载 + 循环-GPU 解耦」四件套实现。这需要容器/虚拟化、OS 内核、分布式存储、RL 系统四类知识的融合。
八、论文中可以提取的通用性灵感
8.1 关注点分离类:「状态与算力解耦,算力即可抢占」
- 核心思想:把「易失的昂贵算力(GPU)」与「需要持久的状态(Agent 轨迹)」分离,算力就能用廉价闲置资源弹性供给。
- 论文证据:Agent 循环独立于可抢占 GPU,支撑 300 万/日规模。
- 推广场景:① 任何「贵算力 + 长时任务」的批处理(渲染、仿真);② Serverless 中把有状态部分外置;③ 容灾:把「进度」与「机器」解耦。
8.2 机制类:「组合优于复制,把 O(mN) 压到 O(m)」
- 核心思想:当对象由「少量公共部件 + 大量变体」构成时,用「只读基础 + 薄覆盖层」替代「每种组合一份完整副本」。
- 论文证据:可组合环境层使镜像数从 M×N 降到 M+N。
- 推广场景:① 测试环境/CI 镜像分层;② 多租户 SaaS 的配置组合;③ 任何「组合爆炸」的资源预置。
8.3 信号利用类:「按需加载,不为用不着的付费」
- 核心思想:资源(镜像块、内存页)不必在创建时全量就位,用到再取(lazy/on-demand),既快又省。
- 论文证据:3FS 按需加载使突发快 1.71×、写少 57%;DAMON 回收空闲页使积分内存 −21.2%。
- 推广场景:① 大模型权重分片懒加载;② 浏览器/App 的按需资源加载;③ 数据库冷数据分层。
8.4 机制类:「密度来自精细化治理,而非堆硬件」
- 核心思想:单节点能塞多少实例,往往不取决于硬件上限,而取决于是否用对内存映射、空闲回收、CPU 隔离。
- 论文证据:virtio-pmem/DAX 降峰值 40.2%、核调度降 SMT 延迟到 17.3%。
- 推广场景:① 高密度容器编排;② 边缘设备上多模型共跑;③ 任何「噪声干扰关键路径」的隔离设计。
8.5 安全类:「能力最小化是抑制作弊的第一道防线」
- 核心思想:在开放执行环境(Agent 可任意行动)里,用最小权限(AppArmor/eBPF)收窄可触碰面,能从根上减少「钻空子」的空间。
- 论文证据:DSec 以访问控制缓解奖励黑客。
- 推广场景:① 代码执行沙盒;② 多 Agent 协作中的权限边界;③ 任何「模型可能对抗环境」的部署。
小结:DSec 把「Agentic RL 训练」从一个被基础设施拖累的难题,重新工程化为「可组合、高密度、按需、弹性」的沙盒供给问题。它的四大支柱——overlayfs+EROFS 可组合层(O(mN)→O(m))、virtio-pmem/DAX+DAMON+核调度的高密度治理、3FS 按需镜像加载、Agent 循环与可抢占 GPU 解耦——各自有清晰的因果机制与实测数字支撑(突发快 1.71×、写少 57%、峰值内存 −40.2%、SMT 延迟降到 17.3%、300 万/日规模)。它开源了存储侧 OverlayBD,为社区提供可直接复用的底层。局限在于「奖励黑客抑制」与「可抢占净成本节省」仍缺端到端量化。总体而言,DSec 为「规模化 Agentic 训练」补上了长期被忽视、却至关重要的环境供给这一环,其「组合优于复制、状态与算力解耦、按需加载」等思想也广泛适用于各类弹性计算场景。