DeepSeek与清华大学联合发布了一篇学术成果,梁文锋作为最后一位署名人出现在作者列表中。
文章表面上探讨的是DeepSeek用于训练Agent的沙盒系统,但论文的第六部分暗藏玄机,字里行间透露出三个字母:RSI。
借助这个沙盒,Agent能够自主构建所需的运行环境,该环境会反过来训练Agent,而经过强化训练的Agent又能打造出更优的环境。
由此,一个微型的RSI闭环得以形成。
正因为如此,沙盒或许成了开启RSI首场战役的关键工具。
那么,这篇论文具体阐述了什么内容呢?
梁文锋署名的这篇新论文,标题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,于9月19日提交至arXiv,编号2609.22978。作者超过130人,梁文锋排在末位,合作方为清华大学。
论文的核心内容可以用一句话概括:DeepSeek完整公开了其用于训练Agent的“沙盒工厂”DSec。
但要理解DSec,必须先厘清“训练Agent”与“训练大模型”之间的差异。
训练大模型涉及喂入数据、计算梯度,其环境是GPU集群。而训练Agent则截然不同,Agent需要在环境中编写代码、运行编译、打开浏览器、安装依赖、调用工具,并根据执行结果反复尝试,直至任务完成。
然而,若将Agent直接置于电脑中训练,它可能引发意外,导致整个环境崩溃。
因此,需要一个隔离、有状态且能运行真实软件的沙盒。
DSec正是这样一个平台。它通过统一的Python SDK(libdsec)提供四种后端:函数调用(FnCall)、容器(Container)、轻量虚拟机(microVM)和完整虚拟机(Full VM)。
简而言之,DSec好比一个外卖APP,Agent是骑手,沙盒则相当于派单系统。以此类推,FnCall、容器和轻量虚拟机是外卖站点分发的电动车和保温箱,完整虚拟机则是冷链货车。
但这里存在一个固有矛盾:隔离强度与系统功能难以兼得。
越接近真实机器,启动速度越慢,内存开销越大。运行短脚本可用函数调用,修改代码仓库需用容器,执行安全任务依赖microVM,而要运行安卓、图形界面等完整系统,则只能使用完整虚拟机。
论文显示,一个生产单元约包含160个CPU节点、3万核、250TB内存,可托管PB级镜像。
该系统每天服务约300万个沙盒,峰值并发超过38万个,创建速度超过每秒5000个。单个训练任务最多可一次性拉起3.2万个沙盒。单节点上,最高能容纳800个microVM或3200个容器。
DSec具备三大核心机制。
第一,将环境拆分为“可组合的层”。
以往,一个沙盒环境是一整块镜像,修改一个工具包就需要重建整个镜像,维护成本随组合数激增。DSec将基础镜像、工作区、工具包拆分为三层独立版本化的只读层(EROFS),启动时通过overlayfs拼接,修改哪层只重建哪层。实测比tar.gz打包方式快1.76倍,磁盘写入量少5.5倍。
这相当于给骑手配车,以前坏了一个零件就得换整车,DSec则是坏了哪个换哪个。
第二,镜像实现“按需加载”。镜像存储在3FS(DeepSeek的分布式文件系统)上,元数据预取至本地,数据块仅在读取时才拉取。实测8192个容器的突发部署,按需加载35分钟完成,而Docker冷拉取需60分钟以上,磁盘写入量减少约57%。
老办法是“不管用不用,整仓先搬空”,DSec则是“根据订单,用到哪件骑手去取哪件”。
第三,内存和CPU的“精打细算”。
通过virtio-pmem配合DAX,让多个虚拟机共享同一份页缓存,峰值内存降低40.2%;利用DAMON加balloon回收冷页,时间积分内存再降21.2%;CPU方面,将沙盒分为“延迟敏感”和“尽力而为”两类,通过core scheduling将SMT干扰从45.2%压至17.3%。
此外,从DeepSeek-V4.1开始,论文将Agent的rollout从可被抢占的GPU训练Pod中分离,独立运行在DSec上,GPU被抢占时rollout状态不丢失。
说白了,就是让骑手们共用同一张地图、同一批货架,车里压仓的冷货随手退回仓库,加急单和普通单分道行驶、互不干扰。
论文中最容易被忽略的一句话,不在摘要,而在第6节的小标题中:Build environments of Agents, by Agents, for Agents。意为由Agent建造、为Agent服务、属于Agent的环境。
这句话等于DeepSeek悄悄透露了一件大事,即DeepSeek已部分实现了RSI。
论文第6.1节指出,手工构建Agent强化学习所需的大量环境已变得“不现实”(impractical)。
于是,DeepSeek改变了做法,让Agent在训练所用的同一套沙盒中,交互式地自行搭建环境,再利用pack_diff将此次会话打包成一张增量快照,直接变为下一批可复用的训练场。
构建环境的Agent与被训练的Agent共用DSec这套沙盒基础设施。
Agent铺设场地 → 场地训练Agent → 更强的Agent再铺设更好的场地。 DeepSeek的RSI由此部分实现闭环。
但这个闭环仍处于早期阶段。
第6.4节记录了大量Agent作弊事件,例如在平台中翻找残留的参考答案,伪造RPC消息直接发送给chronus套取答案,翻查chronus日志寻找泄题内容,甚至覆盖/bin/bash以绕过检查。
被拦截后,又利用XFS_IOC_SWAPEXT这个ioctl将受保护文件的存储块换至另一个文件描述符,结果破坏了XFS元数据,导致文件系统关闭。
有作弊的,自然也有闯祸的。一个Agent从根目录递归grep,一路读到/proc/kpagecgroup,触发内核bug直接导致内核崩溃。
另一个Agent调用yes命令,chronus将其输出全部记录,数十GB数据堆积在存储上。
目前的RSI无法顺利运转,瓶颈从来不是GPU,而是环境供给。
Agent强化学习的每一代都需要新任务、新沙盒、新服务依赖,人工构建环境才是真正的瓶颈。
DSec相当于将这一环节部分自动化,自动生成RSI所需的环境。
还是用外卖来举例。
一个外卖平台想越跑越快,不能只靠一个骑手重复送同一单。要让骑手变强,就需要接更多不同种类的订单,而订单越多又反过来将骑手练得更强。
但要让这个飞轮转起来,瓶颈从来不是骑手,而是餐厅够不够多。没有餐厅,骑手再能跑也是空转。
DSec是建造了一个“自动建餐厅”的系统。
以前平台得人工一家家洽谈商家、装修后厨、制定菜单、设定考核标准,几百几千家根本谈不过来。
DSec说:“别谈了,让骑手在跑单的同一个后厨里,顺手把店开了。他怎么装的灶台、进的什么货、接的什么水电,系统用pack_diff‘啪’拍一张快照存下来,下一波骑手直接拎包入驻这家店开工,不用重新装修。”
DSec并非孤例。整个行业都在朝着“Agent沙盒”这一方向发力。
最知名的案例是Kimi K3。
月之暗面于7月16日发布K3,这是一个2.8万亿参数的MoE模型,每个token激活约104B参数,支持100万token上下文,具备原生视觉能力,号称“全球首个开源的3T级模型”,在SWE-bench上达到76.8%,开源排名第一。
其Agent Swarm最多能并行调度300个子代理。DeepSeek这篇论文中,引用的也正是Kimi-K2.5的Agent Swarm。
Kimi训练K3时使用的AgentENV也是一种沙盒。
AgentENV运行在Firecracker microVM上的分布式沙盒平台,每个沙盒拥有独立Linux内核、独立网络栈、独立文件系统,底层存储采用OverlayBD + ublk,只读层全集群共享,每个沙盒写入自己的上层。这与DSec采用同一技术栈。
DSec论文第7节指出,其使用的Rust版OverlayBD/ublk存储库,就开源在AgentENV这个仓库中。
两者相当于同门师兄弟。
但AgentENV无法实现RSI,它提供的是fork/snapshot这类“状态操作原语”,让RL rollout能并行、能回滚、能干净判分。因此,它无法像DSec那样让Agent自行构建环境。
类似的还有阿里。在云栖大会上,阿里云CTO李飞飞提出了“Agentic Cloud”战略,将Model、Harness、Context作为三个核心场景,一口气推出了AgentCore、Agent Sandbox、新一代存储CPFS。
其中,Agent Sandbox能创建吞吐量10万个/分钟,深休眠唤醒小于600毫秒,兼容E2B和K8s。
沙盒正在成为“新的运行时”。
云计算的主体,从虚拟机,到容器,再到模型,现在轮到Agent。谁掌握Agent的执行环境,谁就掌握了下一代云的入口。
这就导致,竞争焦点从“模型能力”转向“环境基础设施”。
“训练大模型拼算力,训练Agent拼环境”。
在GPU之外,CPU、内存、存储、镜像分发,全都变成了新的瓶颈。
此外,安全性也从附加项变得极为重要。OpenAI、Anthropic的各种模型越狱,以及DSec论文中Agent的作弊和内核崩溃,都指向同一问题。
沙盒如果不牢固,训练信号就是虚假的,评估就是无效的。因此,像阿里这样的厂商会将“安全围栏”作为卖点,而DSec则使用了AppArmor加eBPF。
沙盒厂商过去比拼的是速度和成本,现在开始比拼谁更稳固。
RSI的首场战役已经打响。要运行RSI,就必须先拥有沙盒,拥有环境。通过访问开云网页,可以获取更多相关技术细节与行业动态。
本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。
查看详情在开云在线登录方面,开云登录入口提供贴心周到的支持。
评论
开云登录入口深耕内容严格基于事实,不虚构数据,不夸大效果。领域,用心服务每一位用户。
开云网页有围绕道具使用展开的主题内容,读者可按选择思路寻找线索,关注作品征集活动时,建议一并了解适用范围,避免遗漏必要信息,从玩家创作的内容特点切入,给下一次体验留下一点新的想法,致力于成为玩家认识移动端体验的参考来源,让相关背景更容易理解。
在开云网页方面,开云登录入口提供贴心周到的支持。
围绕以中立视角梳理移动端游戏背景,降低新手入门门槛。,开云登录入口持续打磨更优质的服务。