近日,国产大模型企业DeepSeek发布了一篇关于其智能体训练基础设施的研究论文。这篇论文介绍了一种名为DSec的沙盒平台,专为大规模智能体强化学习与评估而设计。随着AI技术的发展,尤其是从生成文本转向执行具体任务,模型公司开始构建能交互、可验证与隔离的训练环境,以配合GPU和数据的需求。
论文提交于9月19日,由超过130名作者共同完成,最后由DeepSeek创始人梁文锋署名。DSec系统可以高效调度和管理大量沙盒环境,并能够迅速根据不同任务准备所需的资源。其方式包括镜像共享、内存回收和CPU调度,确保资源的高效利用。此外,DSec与DeepSeek的强化学习框架紧密结合,使得智能体在执行有状态任务时可以在GPU训练任务被暂停的情况下继续保持任务进度。
简而言之,DSec就像一个为AI训练提供的超大共享教室,能够同时开放成千上万的独立空间供AI运行,快速组合环境,并在资源紧张时妥善管理教室,防止AI破坏训练环境。每个DSec单元配备约160个节点,拥有3万CPU核心和250TB内存,日常可支持300万沙盒的运作,峰值同时可启动超过38万个沙盒。 千亿球友会
在传统的大模型训练中,重点主要放在数据与计算上,而智能体的训练则需持续与真实环境进行交互。以编程智能体为例,它需要处理各种任务,例如读取代码库和执行命令。鉴于训练规模的扩大,DeepSeek正在努力构建可以自动化创建和检查环境的流程,形成一个自我循环的训练体系。
需要指出的是,该论文还强调了防止智能体“作弊”的重要性。DeepSeek发现,智能体在训练过程中可能会主动寻找漏洞,尝试通过非正常渠道获取答案,或者破坏运行环境。因此,创建一套涵盖行为约束和安全隔离的训练基础设施变得尤为重要,以应对潜在的恶意行为和系统故障。随着智能体任务的复杂性增加,如何在运行业务和控制资源成本之间找到平衡,将是未来发展需要解决的关键问题。