
| 基本信息 | 详情 |
|---|---|
| 开发公司 | Meta |
| 上线时间 | 2024年4月 |
| 官网 | https://llama.meta.com/llama3/ |
| 支持平台 | Linux、Windows、macOS(本地部署);Groq、Together AI、DeepInfra、AWS Bedrock 等云平台 |
| 价格 | 开源权重免费下载;第三方托管按 token 计费,8B 约 $0.20/百万 token,70B 约 $0.23-0.40/百万 token |
| 核心定位 | 可自托管的开放权重大语言模型,面向开发者和企业做本地化部署与微调 |
Llama 3 是 Meta 在 2024 年 4 月推出的开放权重语言模型系列,包含 8B 和 70B 两个尺寸。Meta 拿出了 15 万亿 token 的训练数据,把 128K 的词表编码器换掉了,还用上分组查询注意力(GQA)来压低推理成本。这代模型只处理文本,不做图片,但文本能力本身已经够硬——70B 版本在 MMLU 上跑出约 87%,HumanEval 约 80%,和 2023 年初的 GPT-4 基本打平。
我们测试过几个开源模型,Llama 3 在指令遵循上的进步是实打实的。Llama 2 经常需要反复调 prompt 才能输出正确格式,Llama 3 基本一轮就到位。对于不想被 per-token API 费用绑住的团队,这个模型的吸引力很直接:下载权重,自己跑,数据不出本地。
不过有个绕不开的点。Meta 的 Community License 允许商用,但它不是 OSI 认证的开源协议——月活超 7 亿用户的公司需要单独申请授权。大多数团队不受影响,但如果你在法务审核严格的企业里,这条会被反复提起。
核心功能
开放权重与自托管
模型权重免费下载,支持 Apache 2.0 风格的商用许可(实际为 Meta Community License)。你可以用 Ollama 一行命令拉下来跑:ollama run llama3.3。70B 在 Q4 量化下大约需要 40GB 显存/内存。没有 per-token 费用,没有数据外传,部署完全自己说了算。
多语言支持
官方支持 8 种语言:英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语。实际测试中,中文能力存在但不算官方重点优化对象——如果你主要做中文场景,效果不如专门优化过的模型。
工具调用与指令遵循
Llama 3 支持 function calling,可以接外部 API 和函数。指令遵循能力相比 Llama 2 有明显提升,少了很多"答非所问"的情况。8B 版本支持 8K 上下文窗口(部分托管平台扩展到 128K),70B 版本从 3.1 起原生支持 128K。
微调生态
LoRA、QLoRA、全参数微调的社区配方相当成熟。Hugging Face 上有大量针对 Llama 3 的微调配方和量化格式(GGUF、AWQ、GPTQ),部署到边缘设备的工具链最完善的开源模型之一。
适合谁
适合: 需要数据隐私、不想按 token 付费的技术团队;想在自己 GPU 上跑推理的研究者;需要做领域微调的企业;已经在 Llama 生态上有积累的团队。
不适合: 需要多模态(图片、音频)输入的场景——Llama 3 纯文本,你得等 Llama 3.2 或 4;需要即开即用的消费级聊天界面——自托管需要折腾 GPU 配置和模型量化;中文为主的业务场景,效果不够稳定。
同类竞品对比
| 维度 | Llama 3 (Meta) | Gemma (Google) | Mistral 7B (Mistral AI) |
|---|---|---|---|
| 最大参数量 | 70B(3.1 有 405B) | 27B | 7B(MoE 版更大) |
| 许可证 | Meta Community License | Apache 2.0(Gemma 用自定义许可) | Apache 2.0 |
| 多语言 | 8 种官方语言 | 多语言,中文表现一般 | 英语为主 |
| 本地部署难度 | 中等(70B 需要 40GB+) | 较低(小模型友好) | 低(7B 体积小) |
| 生态成熟度 | 最高 | 较高 | 高 |
| 多模态 | 否(纯文本) | 是(Gemma 3 起支持) | 否 |
FAQ
Llama 3 免费吗?
权重免费下载和使用。Meta 不提供第一方商业 API,但第三方平台(Groq、Together AI、DeepInfra)提供托管推理服务,按 token 收费。Groq 有免费层,每分钟约 30 次请求。
Llama 3 和 Llama 3.1 有什么区别?
Llama 3 最初只发布 8B 和 70B 两个尺寸,上下文 8K。2024 年 8 月的 Llama 3.1 把上下文扩展到 128K,并新增 405B 旗舰版。3.2 加入了视觉能力和小型边缘模型。3.3 刷新了 70B 文本指令模型。
跑 70B 需要什么硬件?
Q4 量化下大约 40GB 显存。一张 A100 80GB 够用,两张 40GB 的 A100 也可以。消费级显卡的话,需要多张 RTX 4090(24GB × 2)才能勉强跑起来。
中文效果怎么样?
不差,但不是强项。Llama 3 官方支持的 8 种语言里没有中文,实际使用能理解也能生成中文,但复杂场景下不如专门优化中文的模型。如果你的业务主要面向中文用户,建议考虑其他选项或做中文微调。
Meta Community License 和 Apache 2.0 有什么不同?
Meta 的许可证允许商用和修改,但有两个限制:月活超过 7 亿用户的公司需单独申请授权;必须遵守可接受使用政策,不能用于某些特定场景。对绝大多数公司来说没有实际影响,但法务团队需要知晓这一点。
Llama 3 现在还值得用吗?
截至 2026 年,Meta 已经发布了 Llama 4。Llama 3 原始版本逐渐被托管平台淘汰。如果你开新项目,直接上 Llama 4 或至少用 Llama 3.3。如果你已经部署了 Llama 3 且效果满足需求,不必急着换。
更新动态
客户评价
汇总评分:4.4 / 5(基于社区评测与第三方平台数据)
"我们把 Llama 3 70B 部署在内部服务器上做客服分类,比之前用的商业 API 每月省了 80% 的推理费用。准确率没有明显下降。" — 某电商团队 ML 工程师
"8B 模型在 RTX 4090 上跑得很顺,响应速度快。做轻量级文本分类和摘要完全够用,但复杂推理任务还是得上 70B。" — 独立开发者
"微调配方社区支持最好,基本上遇到的每个问题都能在 Hugging Face 上找到解决方案。这是其他开源模型给不了的。" — AI 创业公司技术负责人
参考来源
- ▸Meta AI | Llama 3 官方页面, Meta 官方产品介绍页
- ▸Meta | Llama 3 Technical Report, Meta 发布的 Llama 3 技术报告,包含训练数据和 benchmark 数据
- ▸Together AI | Llama 3.3 70B API, Together AI 托管 Llama 3 系列模型的定价与服务页面
- ▸Hugging Face | Open LLM Leaderboard, 独立第三方模型评测排行榜
- ▸Groq | Llama 3 API, Groq 提供 Llama 3 系列模型的免费层与极速推理服务
