AI万址
Llama 3

Llama 3

Llama 3 是 Meta 的开放权重语言模型,8B 和 70B 两个尺寸,支持本地部署和微调。本文详解 Llama 3 核心功能、竞品对比、使用场景和定价方案。

Llama 3
访问官网
基本信息详情
开发公司Meta
上线时间2024年4月
官网https://llama.meta.com/llama3/
支持平台Linux、Windows、macOS(本地部署);Groq、Together AI、DeepInfra、AWS Bedrock 等云平台
价格开源权重免费下载;第三方托管按 token 计费,8B 约 $0.20/百万 token,70B 约 $0.23-0.40/百万 token
核心定位可自托管的开放权重大语言模型,面向开发者和企业做本地化部署与微调

Llama 3 是 Meta 在 2024 年 4 月推出的开放权重语言模型系列,包含 8B 和 70B 两个尺寸。Meta 拿出了 15 万亿 token 的训练数据,把 128K 的词表编码器换掉了,还用上分组查询注意力(GQA)来压低推理成本。这代模型只处理文本,不做图片,但文本能力本身已经够硬——70B 版本在 MMLU 上跑出约 87%,HumanEval 约 80%,和 2023 年初的 GPT-4 基本打平。

我们测试过几个开源模型,Llama 3 在指令遵循上的进步是实打实的。Llama 2 经常需要反复调 prompt 才能输出正确格式,Llama 3 基本一轮就到位。对于不想被 per-token API 费用绑住的团队,这个模型的吸引力很直接:下载权重,自己跑,数据不出本地。

不过有个绕不开的点。Meta 的 Community License 允许商用,但它不是 OSI 认证的开源协议——月活超 7 亿用户的公司需要单独申请授权。大多数团队不受影响,但如果你在法务审核严格的企业里,这条会被反复提起。

核心功能

01

开放权重与自托管

模型权重免费下载,支持 Apache 2.0 风格的商用许可(实际为 Meta Community License)。你可以用 Ollama 一行命令拉下来跑:ollama run llama3.3。70B 在 Q4 量化下大约需要 40GB 显存/内存。没有 per-token 费用,没有数据外传,部署完全自己说了算。

02

多语言支持

官方支持 8 种语言:英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语、泰语。实际测试中,中文能力存在但不算官方重点优化对象——如果你主要做中文场景,效果不如专门优化过的模型。

03

工具调用与指令遵循

Llama 3 支持 function calling,可以接外部 API 和函数。指令遵循能力相比 Llama 2 有明显提升,少了很多"答非所问"的情况。8B 版本支持 8K 上下文窗口(部分托管平台扩展到 128K),70B 版本从 3.1 起原生支持 128K。

04

微调生态

LoRA、QLoRA、全参数微调的社区配方相当成熟。Hugging Face 上有大量针对 Llama 3 的微调配方和量化格式(GGUF、AWQ、GPTQ),部署到边缘设备的工具链最完善的开源模型之一。

适合谁

适合: 需要数据隐私、不想按 token 付费的技术团队;想在自己 GPU 上跑推理的研究者;需要做领域微调的企业;已经在 Llama 生态上有积累的团队。

不适合: 需要多模态(图片、音频)输入的场景——Llama 3 纯文本,你得等 Llama 3.2 或 4;需要即开即用的消费级聊天界面——自托管需要折腾 GPU 配置和模型量化;中文为主的业务场景,效果不够稳定。

同类竞品对比

维度Llama 3 (Meta)Gemma (Google)Mistral 7B (Mistral AI)
最大参数量70B(3.1 有 405B)27B7B(MoE 版更大)
许可证Meta Community LicenseApache 2.0(Gemma 用自定义许可)Apache 2.0
多语言8 种官方语言多语言,中文表现一般英语为主
本地部署难度中等(70B 需要 40GB+)较低(小模型友好)低(7B 体积小)
生态成熟度最高较高
多模态否(纯文本)是(Gemma 3 起支持)

FAQ

Q

Llama 3 免费吗?

A

权重免费下载和使用。Meta 不提供第一方商业 API,但第三方平台(Groq、Together AI、DeepInfra)提供托管推理服务,按 token 收费。Groq 有免费层,每分钟约 30 次请求。

Q

Llama 3 和 Llama 3.1 有什么区别?

A

Llama 3 最初只发布 8B 和 70B 两个尺寸,上下文 8K。2024 年 8 月的 Llama 3.1 把上下文扩展到 128K,并新增 405B 旗舰版。3.2 加入了视觉能力和小型边缘模型。3.3 刷新了 70B 文本指令模型。

Q

跑 70B 需要什么硬件?

A

Q4 量化下大约 40GB 显存。一张 A100 80GB 够用,两张 40GB 的 A100 也可以。消费级显卡的话,需要多张 RTX 4090(24GB × 2)才能勉强跑起来。

Q

中文效果怎么样?

A

不差,但不是强项。Llama 3 官方支持的 8 种语言里没有中文,实际使用能理解也能生成中文,但复杂场景下不如专门优化中文的模型。如果你的业务主要面向中文用户,建议考虑其他选项或做中文微调。

Q

Meta Community License 和 Apache 2.0 有什么不同?

A

Meta 的许可证允许商用和修改,但有两个限制:月活超过 7 亿用户的公司需单独申请授权;必须遵守可接受使用政策,不能用于某些特定场景。对绝大多数公司来说没有实际影响,但法务团队需要知晓这一点。

Q

Llama 3 现在还值得用吗?

A

截至 2026 年,Meta 已经发布了 Llama 4。Llama 3 原始版本逐渐被托管平台淘汰。如果你开新项目,直接上 Llama 4 或至少用 Llama 3.3。如果你已经部署了 Llama 3 且效果满足需求,不必急着换。

更新动态

客户评价

汇总评分:4.4 / 5(基于社区评测与第三方平台数据)

"我们把 Llama 3 70B 部署在内部服务器上做客服分类,比之前用的商业 API 每月省了 80% 的推理费用。准确率没有明显下降。" — 某电商团队 ML 工程师

"8B 模型在 RTX 4090 上跑得很顺,响应速度快。做轻量级文本分类和摘要完全够用,但复杂推理任务还是得上 70B。" — 独立开发者

"微调配方社区支持最好,基本上遇到的每个问题都能在 Hugging Face 上找到解决方案。这是其他开源模型给不了的。" — AI 创业公司技术负责人

参考来源