AI万址

DeepSpeed

DeepSpeed是微软开源的深度学习优化库,ZeRO零冗余优化器让少GPU训练大模型成为可能。了解ZeRO三阶段、Offload、定价及与FSDP对比。

DeepSpeed
访问官网
基本信息详情
开发公司微软研究院(Microsoft Research)
上线时间2020年2月
官网https://www.deepspeed.ai/
支持平台Linux(主要)、Windows(2024年8月起支持)
价格免费开源(MIT 许可)
核心定位大规模深度学习训练与推理优化库

DeepSpeed 是微软开源的深度学习优化库,干的事情用一句话概括:让你用更少的 GPU、更少的内存,训练更大的模型。2020 年发布时,它用 400 块 GPU 跑出了 15 petaFLOPS 的吞吐量,训练了超过 1000 亿参数的模型--当时比业界最佳水平快 5 倍、成本低 3 倍。

这个库的核心发明叫 ZeRO(Zero Redundancy Optimizer,零冗余优化器)。传统数据并行训练中,每块 GPU 都要存一份完整的模型参数、梯度和优化器状态,内存浪费严重。ZeRO 把这些状态切片分摊到所有 GPU 上,谁需要谁取,用完即释放。三个阶段逐步消除冗余:Stage 1 切优化器状态、Stage 2 加切梯度、Stage 3 连模型参数一起切。

BLOOM(176B 参数)、Megatron-Turing NLG(530B 参数)、Jurassic-1(178B 参数)这些标志性大模型都是用 DeepSpeed 训练的。2025 年 2 月,微软把 DeepSpeed 捐给了 Linux Foundation AI & Data,从微软内部项目转为社区治理。

核心功能

01

ZeRO 零冗余优化器

DeepSpeed 的灵魂。三个阶段逐步消除内存冗余:Stage 1 把 Adam 优化器状态分片,省约 4 倍内存;Stage 2 加上梯度分片,省约 8 倍;Stage 3 把模型参数也分了,内存效率与 GPU 数量成正比。Stage 3 是最强配置,可以把模型规模提升数十倍。

02

ZeRO-Offload 异构内存

GPU 显存不够?把训练状态卸载到 CPU 内存甚至 NVMe 硬盘。ZeRO-CPU Offload 让你在单卡上训练 100-400 亿参数的模型。ZeRO-NVMe Offload 进一步突破 CPU 内存限制,理论上支持数万亿参数。2025 年 8 月发布的 ZenFlow 引擎通过异步更新消除了卸载带来的训练停顿。

03

MoE 混合专家训练

DeepSpeed-MoE 针对稀疏激活的 Mixture-of-Experts 模型做了专门优化。支持张量-专家-数据混合并行,高效训练大规模 MoE 模型。

04

DeepSpeed-Chat

一键式 ChatGPT 类模型训练,把 RLHF 的三阶段训练(SFT、奖励模型、PPO)封装成简单 API。官方称速度比当时最先进的 RLHF 系统快 15 倍,在所有规模上实现了前所未有的成本降低。

05

推理优化

DeepSpeed-Inference 把训练阶段的并行技术搬到推理端,结合高性能自定义内核、通信优化和异构内存,降低推理延迟和内存消耗。DeepSpeed-FastGen 专注于高吞吐量推理服务。

06

极致压缩

DeepSpeed-Compression 提供模型压缩工具库,支持 INT4/INT8 量化、稀疏化、知识蒸馏。ZeroQuant 系列实现了训练后量化,无需重新训练就能把 Transformer 模型压缩到 INT4 精度。

适合谁

适合:训练或微调大模型的 AI 实验室和公司、GPU 资源有限但想跑大模型的团队、需要 MoE 或 RLHF 训练 pipeline 的工程团队、做大规模推理服务的团队。

不适合:只训练小模型(<1B 参数)的团队(用 PyTorch 原生 DDP 就够了,DeepSpeed 增加了不必要的复杂度)、不熟悉分布式训练的初学者(配置和理解 ZeRO 各阶段需要一定工程经验)、只需要简单推理 API 的用户(vLLM 或 TensorRT-LLM 更直接)。

如果你在用 Hugging Face Transformers,DeepSpeed 已经内置集成了。在 config 里加几行配置就能启用 ZeRO,不需要大改代码。

同类竞品对比

维度DeepSpeedFSDP(PyTorch原生)Megatron-LMColossalAI
ZeRO 分片3 阶段有(类似Stage 3)
CPU/NVMe Offload支持支持不支持支持
MoE 训练支持不支持支持支持
RLHF 训练DeepSpeed-Chat
推理优化
许可证MITBSDApache 2.0Apache 2.0

PyTorch FSDP 是 DeepSpeed ZeRO-3 的官方实现,适合不想引入额外依赖的团队。但 DeepSpeed 在 Offload、MoE、RLHF 和推理优化上仍然领先。Megatron-LM 在张量并行和流水线并行上更强,常和 DeepSpeed 配合使用(Megatron-DeepSpeed 联合方案)。

FAQ

Q

DeepSpeed 免费吗?可以商用吗?

A

完全免费,MIT 许可。你可以自由用于商业项目。2025 年 2 月起由 Linux Foundation AI & Data 社区治理。

Q

ZeRO Stage 1/2/3 怎么选?

A

从 Stage 2 开始是大多数场景的最佳起点。Stage 1 只切优化器状态,提升有限。Stage 2 加上梯度分片,内存显著下降,性能损失小。Stage 3 连模型参数都切了,内存最省但通信开销最大,适合模型大到 Stage 2 装不下的情况。

Q

DeepSpeed 和 Hugging Face Transformers 怎么配合?

A

Hugging Face Transformers 内置了 DeepSpeed 集成。你只需要提供一个 DeepSpeed 配置 JSON 文件,然后用 Trainer 或 Accelerate 启动训练。不需要修改模型代码。官方文档在 huggingface.co/docs/transformers/deepspeed。

Q

DeepSpeed 支持 Windows 吗?

A

2024 年 8 月起正式支持 Windows。之前需要 WSL2。现在可以在原生 Windows 环境下安装和使用,但大规模分布式训练仍建议在 Linux 上跑。

Q

DeepSpeed 能做推理加速吗?

A

可以。DeepSpeed-Inference 提供了针对 Transformer 模型的推理优化,包括自定义内核、通信优化和异构内存技术。DeepSpeed-FastGen 专注于高吞吐量推理服务。MII(Model Implementations for Inference)是把推理部署封装好的工具。

更新动态

2025-2026 年的更新重点是训练效率的持续突破。DeepCompile(2025年4月)为分布式训练引入编译器优化。ZenFlow(2025年8月)通过异步更新解决了 Offload 训练的停顿问题。SuperOffload(2025年10月,ASPLOS 2026 论文)针对超级芯片架构优化大规模 LLM 训练。2026 年 5 月加入了 Muon 优化器支持和 AMD GPU 的 SDMA 通信优化。DeepSpeed Core API 也在 2025 年底更新,支持 PyTorch 风格的反向传播和低精度主状态。

客户评论

评分维度评分
技术创新5/5
生态集成5/5
文档质量4/5
上手难度3/5(需分布式训练经验)
社区活跃度4.5/5

"我们用 DeepSpeed ZeRO-3 在 8 张 A100 上训练了 70B 参数模型。没有 DeepSpeed 的话,这个规模的训练至少需要 32 张卡。" - AI 实验室工程师

"ZeRO-Offload 是穷实验室的救星。把优化器状态卸载到 CPU 后,我们在单张 V100 上微调了 13B 模型。速度慢了点,但至少能跑。" - 高校博士生

"DeepSpeed-Chat 把 RLHF 训练从几周的工程工作缩短到几行配置。对想快速复现 ChatGPT 训练流程的团队来说,这是最省事的方案。" - NLP 团队负责人

参考来源