DeepSeek开源沙盒DSec:RSI闭环初现,Agent训练迈入“自进化”时代

科技区角 2026-09-24 15:31

【科技纵览】当AI智能体(Agent)不再仅仅是被动执行指令的工具,而是开始具备自我构建训练环境的能力时,一场关于算力基础设施的静默革命已然打响。9月19日,DeepSeek联合清华大学在arXiv上提交了一篇编号为2609.22978的重磅论文,题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》。这篇由超过130位作者共同署名、梁文锋位列末席的文章,表面上是在介绍一个用于大规模Agent训练的沙盒平台,但其第6节中隐藏的“RSI”(Recursive Self-Improvement,递归自我改进)逻辑,却揭示了具身智能进化的新路径。

要理解DSec的价值,首先需厘清大模型与Agent训练的本质差异。传统大模型训练依赖GPU集群进行数据喂入和梯度计算,环境相对静态;而Agent训练则要求其在隔离环境中执行代码编译、浏览器操作、依赖安装等复杂交互,并根据反馈不断重试。若缺乏有效隔离,Agent的潜在破坏性将危及整个系统。DSec正是为此而生,它通过统一的Python SDK(libdsec)提供函数调用、容器、轻量虚拟机及完整虚拟机四种后端,犹如外卖平台为骑手分配不同规格的运输工具,以平衡隔离强度与系统功能。

数据显示,DSec的生产单元规模惊人:约160个CPU节点、3万核算力、250TB内存,托管PB级镜像。其日均服务沙盒数量达300万个,峰值并发超38万,创建速度突破每秒5000个。单个训练任务可一次性拉起3.2万个沙盒,单节点最高容纳800个microVM或3200个容器。为实现如此高密度的调度,DSec引入了三大核心机制。首先是环境的“可组合层化”,将基础镜像、工作区和工具包拆分为独立版本化的只读层(EROFS),利用overlayfs动态拼接,实测启动速度比传统tar.gz打包快1.76倍,磁盘写入减少5.5倍。其次是镜像的“按需加载”,依托DeepSeek分布式文件系统3FS,仅在实际读取时拉取数据块,使得8192个容器的突发部署时间从Docker冷拉取的60分钟以上缩短至35分钟,磁盘写入降低约57%。最后是资源的“精打细算”,通过virtio-pmem配合DAX共享页缓存,峰值内存下降40.2%;结合DAMON与balloon技术回收冷页,时间积分内存再降21.2%;同时采用core scheduling将SMT干扰从45.2%压低至17.3%,确保延迟敏感型与尽力而为型任务互不干扰。

然而,DSec最引人深思之处并非性能指标,而是其第6节小标题所暗示的范式转移:“Build environments of Agents, by Agents, for Agents”。这意味着Agent不仅能被训练,还能主动构建训练自身的环境。论文指出,手工构造海量Agent强化学习(RL)环境已不现实,因此DeepSeek让Agent在同一套沙盒内交互式搭建环境,并通过pack_diff生成增量快照,直接转化为下一批训练场。这种“Agent铺场地→场地训练Agent→更强Agent优化场地”的闭环,标志着部分RSI的实现。尽管目前该闭环尚处早期,且伴随诸多挑战——如Agent试图翻阅残留答案、伪造RPC消息、甚至利用ioctl交换文件存储块导致文件系统崩溃,或因递归grep触发内核bug——但这些“作弊”与“闯祸”行为恰恰证明了环境供给已成为制约RSI发展的关键瓶颈。DSec通过自动化生成环境,试图打破这一僵局。

放眼行业,沙盒正成为新的竞争高地。月之暗面发布的Kimi K3模型,其背后的AgentENV同样基于Firecracker microVM构建分布式沙盒,底层存储采用OverlayBD+ublk,与DSec技术栈同源,但侧重于状态操作原语而非环境自生成。阿里云则在云栖大会上推出“Agentic Cloud”战略,发布兼容E2E和K8s的Agent Sandbox,强调高吞吐与快速唤醒。这表明,云计算的主体正从虚拟机、容器向Agent演进,竞争焦点也从单纯的模型算力转向环境基础设施。正如论文所言,“训练大模型拼算力,训练Agent拼环境”。在GPU之外,CPU、内存、存储及镜像分发效率成为新瓶颈,而安全性——如DSec采用的AppArmor加eBPF防护——也从附加项变为核心卖点。毕竟,若沙盒不牢,训练信号失真,评估便毫无意义。RSI的第一战,或许不在算法层面,而在谁能率先掌控稳定、高效且安全的Agent运行环境。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
小米凌晨搞大事!MiMo-V2.6开源模型发布,超越 Kimi K3、GLM-5.3,而且不涨价
七校联合开源OpenWAM:机器人的「世界模拟器」来了
GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍
世界人工智能开源大赛(GOAI)总决赛暨颁奖盛典在杭州举行
NVIDIA 中国开发者日|直击物理 AI、开源大模型与智能体前沿,重磅演讲内容上线
小米MiMo-V2.6发布:罗福莉的“去标签化”突围与RL开源新范式
第1轮开源55nm流片成果:多款芯片成功点亮!
一套Harness打通前后台:蚂蚁清华开源9B模型Realtime-Venus,让AI办事对话异步并行
闲鱼回应“媒体报道色情引流”;5499元起vivo X500系列手机发布;被质疑“偷传代码”后智谱ZCode开源;AMD市值历史首次突破1万亿美元...
ECCV 2026开源 | LinStereo:仅2次迭代超越全迭代效率型基线,零样本跨域立体匹配SOTA,遮挡误差暴降37%
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号