AI万址
PyTorch

PyTorch

PyTorch 是主流深度学习框架,支持动态图、torch.compile 加速、分布式训练与端侧推理。2.13 版 FlexAttention 快 12 倍,nn.LinearCrossEntropyLoss 内存降 4 倍。附与 TensorFlow、JAX 对比。

PyTorch
访问官网
基本信息详情
开发公司PyTorch 基金会(Linux 基金会托管,原 Meta AI Research)
上线时间2016年9月
官网https://pytorch.org
支持平台Linux、macOS、Windows;CUDA、ROCm、Intel XPU、Apple MPS、CPU
价格开源免费(BSD 风格协议)
核心定位深度学习训练与推理框架

PyTorch 是 2016 年 Meta AI Research 开源的深度学习框架。它的动态计算图设计让调试变得直觉化--你可以随时 print 张量、打断点、在 GPU 上逐步执行,而不是像 TensorFlow 1.x 那样先建图再跑。这个设计哲学让它在学术圈迅速铺开,到 2020 年前后基本成了深度学习研究的默认选择。

2023 年起 PyTorch 进入 2.x 时代,重心从研究转向生产。torch.compile 把 Python 代码编译成优化过的图,不用改写就能拿到 30%-200% 的加速。2025 年 PyTorch 基金会扩展为多项目基金会,旗下托管了 PyTorch、vLLM、DeepSpeed、Ray、Helion、Safetensors 六个项目,覆盖从训练到推理的完整链路。

2026 年 7 月刚发布的 2.13 版本由 526 位贡献者提交了 3328 次代码。它是目前唯一一个在 CUDA、ROCm、TPU、Apple Silicon 上都能跑的成熟框架,虽然各后端的成熟度有差距。

核心功能

01

torch.compile 编译加速

2.x 的核心特性。把你的 eager 模式代码编译成优化的计算图,支持 Triton 和 CuTeDSL 两种后端。2.13 新增了 CuTeDSL "原生 DSL" 后端,为关键 GPU 操作提供第二条高性能代码路径,编译速度更快。

02

FlexAttention

灵活的注意力机制实现。2.13 把它搬到了 Apple Silicon(MPS),稀疏模式下比 SDPA 快 12 倍。同时为 CUDA 带来了确定性的反向传播路径,梯度计算可复现。

03

分布式训练

torch.distributed 后端支持多机多卡训练。FSDP2(完全分片数据并行)在 2.13 中开启了 all-gather 与 reduce-scatter 通信重叠,提升分布式训练吞吐量。全新的 torchcomms 通信后端提升了大规模集群的容错性和可调试性。

04

ExecuTorch 端侧推理

2.13 标志着 ExecuTorch 正式集成进 PyTorch 核心,端侧推理成为框架的原生能力。每周更新端侧 LLM 示例,和 Hugging Face 合作简化模型导入。

05

内存优化

2.13 新增 nn.LinearCrossEntropyLoss,把最终预测和损失计算融合在一起,大词汇量语言模型训练中 GPU 峰值内存降低 4 倍。

适合谁

研究者和学生

动态图让实验迭代快,调试直觉。论文里的实现基本都是 PyTorch 写的,复现成本低。

工业级训练团队

分布式训练和编译优化已经成熟到可以扛生产负载。Amazon 广告团队用 PyTorch 加 TorchServe 加 AWS Inferentia 把推理成本降了 71%。

边缘设备开发者

ExecuTorch 把 PyTorch 模型部署到手机和嵌入式设备,端侧推理成了原生能力。

多硬件平台团队

一套代码在 NVIDIA、AMD、Intel、Apple 上跑,虽然 CUDA 仍是最成熟的后端。

同类竞品对比

维度PyTorchTensorFlowJAX
开发主体PyTorch 基金会GoogleGoogle
计算图动态优先 + 编译静态优先函数式 + JIT
研究采用率最高下降中上升中
生产部署TorchServe + ExecuTorchTF Serving + TFLite成熟度较低
多硬件支持CUDA/ROCm/TPU/MPS/XPUCUDA/TPUTPU/CUDA
社区生态最大,vLLM/DeepSpeed 等大但增长放缓小但质量高

实际选择上:做研究选 PyTorch 几乎没争议;做 TPU 上的大规模训练 JAX 有优势;Google 内部和部分 GCP 重度用户仍在用 TensorFlow。

FAQ

A

PyTorch 免费吗?

A

免费。BSD 风格开源协议,商用不需要付费。你为 GPU 和云资源花钱,框架本身不收费。

A

最新稳定版是什么?

A

2026 年 7 月发布的 PyTorch 2.13。需要 Python 3.10 以上。安装命令在官网首页,选好操作系统和 CUDA 版本直接跑 pip install。

A

torch.compile 真的能加速吗?

A

能,但幅度取决于你的模型。简单模型可能只快 10%-20%,涉及大量自定义算子的复杂模型可能翻倍。第一次编译有开销,后续运行缓存。

A

支持 AMD GPU 吗?

A

支持。ROCm 后端在 MI300X/MI325X 级别的环境上已经可以用于生产训练。2.13 还加了 AOTriton 0.12b 原生 HIP CMake 支持。

A

ExecuTorch 和 LibTorch 有什么区别?

A

LibTorch 是 C++ 推理库,适合服务端。ExecuTorch 面向手机和嵌入式设备,模型经过裁剪和量化后部署到端侧。

更新动态

近半年重点动态:2.13 发布带来 FlexAttention 落地 Apple Silicon、CuTeDSL 后端、nn.LinearCrossEntropyLoss 内存优化、torchcomms 通信后端、FSDP2 通信重叠、Python 3.15 wheel 支持(含 free-threaded 构建)。ExecuTorch 正式集成进核心。基金会旗下 vLLM 项目发布了 Q3 2026 路线图,聚焦生产 Agent 负载和高交互场景。PyTorch Conference 北美站定于 2026 年 10 月 20-21 日在 San Jose 举办。

客户评论

汇总评分:GitHub Stars 90k+ · 学术圈采用率第一

"从 1.x 到 2.13,torch.compile 是最大的体验提升。我们的 Transformer 训练速度提了 40%,代码几乎没改。" -- ML 工程师,自动驾驶公司

"FSDP2 通信重叠对我们 8 卡 H100 的集群效果明显,训练吞吐量涨了不少。分布式调试的痛点一直在改善。" -- 算法研究员,大模型团队

"ExecuTorch 集成进核心是个好信号。之前端侧部署要折腾半天,现在流程顺多了。" -- 移动端 AI 开发者

参考来源