
PyTorch
PyTorch 是主流深度学习框架,支持动态图、torch.compile 加速、分布式训练与端侧推理。2.13 版 FlexAttention 快 12 倍,nn.LinearCrossEntropyLoss 内存降 4 倍。附与 TensorFlow、JAX 对比。
| 基本信息 | 详情 |
|---|---|
| 开发公司 | PyTorch 基金会(Linux 基金会托管,原 Meta AI Research) |
| 上线时间 | 2016年9月 |
| 官网 | https://pytorch.org |
| 支持平台 | Linux、macOS、Windows;CUDA、ROCm、Intel XPU、Apple MPS、CPU |
| 价格 | 开源免费(BSD 风格协议) |
| 核心定位 | 深度学习训练与推理框架 |
PyTorch 是 2016 年 Meta AI Research 开源的深度学习框架。它的动态计算图设计让调试变得直觉化--你可以随时 print 张量、打断点、在 GPU 上逐步执行,而不是像 TensorFlow 1.x 那样先建图再跑。这个设计哲学让它在学术圈迅速铺开,到 2020 年前后基本成了深度学习研究的默认选择。
2023 年起 PyTorch 进入 2.x 时代,重心从研究转向生产。torch.compile 把 Python 代码编译成优化过的图,不用改写就能拿到 30%-200% 的加速。2025 年 PyTorch 基金会扩展为多项目基金会,旗下托管了 PyTorch、vLLM、DeepSpeed、Ray、Helion、Safetensors 六个项目,覆盖从训练到推理的完整链路。
2026 年 7 月刚发布的 2.13 版本由 526 位贡献者提交了 3328 次代码。它是目前唯一一个在 CUDA、ROCm、TPU、Apple Silicon 上都能跑的成熟框架,虽然各后端的成熟度有差距。
核心功能
torch.compile 编译加速
2.x 的核心特性。把你的 eager 模式代码编译成优化的计算图,支持 Triton 和 CuTeDSL 两种后端。2.13 新增了 CuTeDSL "原生 DSL" 后端,为关键 GPU 操作提供第二条高性能代码路径,编译速度更快。
FlexAttention
灵活的注意力机制实现。2.13 把它搬到了 Apple Silicon(MPS),稀疏模式下比 SDPA 快 12 倍。同时为 CUDA 带来了确定性的反向传播路径,梯度计算可复现。
分布式训练
torch.distributed 后端支持多机多卡训练。FSDP2(完全分片数据并行)在 2.13 中开启了 all-gather 与 reduce-scatter 通信重叠,提升分布式训练吞吐量。全新的 torchcomms 通信后端提升了大规模集群的容错性和可调试性。
ExecuTorch 端侧推理
2.13 标志着 ExecuTorch 正式集成进 PyTorch 核心,端侧推理成为框架的原生能力。每周更新端侧 LLM 示例,和 Hugging Face 合作简化模型导入。
内存优化
2.13 新增 nn.LinearCrossEntropyLoss,把最终预测和损失计算融合在一起,大词汇量语言模型训练中 GPU 峰值内存降低 4 倍。
适合谁
动态图让实验迭代快,调试直觉。论文里的实现基本都是 PyTorch 写的,复现成本低。
分布式训练和编译优化已经成熟到可以扛生产负载。Amazon 广告团队用 PyTorch 加 TorchServe 加 AWS Inferentia 把推理成本降了 71%。
ExecuTorch 把 PyTorch 模型部署到手机和嵌入式设备,端侧推理成了原生能力。
一套代码在 NVIDIA、AMD、Intel、Apple 上跑,虽然 CUDA 仍是最成熟的后端。
同类竞品对比
| 维度 | PyTorch | TensorFlow | JAX |
|---|---|---|---|
| 开发主体 | PyTorch 基金会 | ||
| 计算图 | 动态优先 + 编译 | 静态优先 | 函数式 + JIT |
| 研究采用率 | 最高 | 下降中 | 上升中 |
| 生产部署 | TorchServe + ExecuTorch | TF Serving + TFLite | 成熟度较低 |
| 多硬件支持 | CUDA/ROCm/TPU/MPS/XPU | CUDA/TPU | TPU/CUDA |
| 社区生态 | 最大,vLLM/DeepSpeed 等 | 大但增长放缓 | 小但质量高 |
实际选择上:做研究选 PyTorch 几乎没争议;做 TPU 上的大规模训练 JAX 有优势;Google 内部和部分 GCP 重度用户仍在用 TensorFlow。
FAQ
PyTorch 免费吗?
免费。BSD 风格开源协议,商用不需要付费。你为 GPU 和云资源花钱,框架本身不收费。
最新稳定版是什么?
2026 年 7 月发布的 PyTorch 2.13。需要 Python 3.10 以上。安装命令在官网首页,选好操作系统和 CUDA 版本直接跑 pip install。
torch.compile 真的能加速吗?
能,但幅度取决于你的模型。简单模型可能只快 10%-20%,涉及大量自定义算子的复杂模型可能翻倍。第一次编译有开销,后续运行缓存。
支持 AMD GPU 吗?
支持。ROCm 后端在 MI300X/MI325X 级别的环境上已经可以用于生产训练。2.13 还加了 AOTriton 0.12b 原生 HIP CMake 支持。
ExecuTorch 和 LibTorch 有什么区别?
LibTorch 是 C++ 推理库,适合服务端。ExecuTorch 面向手机和嵌入式设备,模型经过裁剪和量化后部署到端侧。
更新动态
近半年重点动态:2.13 发布带来 FlexAttention 落地 Apple Silicon、CuTeDSL 后端、nn.LinearCrossEntropyLoss 内存优化、torchcomms 通信后端、FSDP2 通信重叠、Python 3.15 wheel 支持(含 free-threaded 构建)。ExecuTorch 正式集成进核心。基金会旗下 vLLM 项目发布了 Q3 2026 路线图,聚焦生产 Agent 负载和高交互场景。PyTorch Conference 北美站定于 2026 年 10 月 20-21 日在 San Jose 举办。
客户评论
汇总评分:GitHub Stars 90k+ · 学术圈采用率第一
"从 1.x 到 2.13,torch.compile 是最大的体验提升。我们的 Transformer 训练速度提了 40%,代码几乎没改。" -- ML 工程师,自动驾驶公司
"FSDP2 通信重叠对我们 8 卡 H100 的集群效果明显,训练吞吐量涨了不少。分布式调试的痛点一直在改善。" -- 算法研究员,大模型团队
"ExecuTorch 集成进核心是个好信号。之前端侧部署要折腾半天,现在流程顺多了。" -- 移动端 AI 开发者
参考来源
- ▸PyTorch 官网 | PyTorch, PyTorch 官方网站及安装入口
- ▸PyTorch 博客 | PyTorch 2.13 发布博客, 2.13 版本更新详情
- ▸PyTorch 基金会 | Driving the Future of Open Source AI, 基金会多项目更新
- ▸GitHub | pytorch/pytorch 2.6.0 Release, 版本发布说明
- ▸GitHub | State of PyTorch Hardware Acceleration May 2026, PyTorch 硬件加速现状报告
