
| 基本信息 | 详情 |
|---|---|
| 开发公司 | Meta(Meta AI / FAIR) |
| 上线时间 | 2023年2月(初代LLaMA研究版);2025年4月5日(Llama 4) |
| 官网 | https://llama.meta.com/ |
| 支持平台 | 自托管(本地/云端)、Hugging Face、OpenRouter、Groq、Together AI |
| 价格 | 模型权重免费下载(Llama Community License);托管推理$0.08/百万Token起 |
| 核心定位 | 开源大语言模型家族,支持商用和私有化部署 |
LLaMA(Large Language Model Meta AI)是Meta从2023年2月开始开源的大语言模型家族。最初的LLaMA只面向研究者发布,不商用。2023年7月Llama 2改变了规则--模型权重免费下载,商用许可放开。Yann LeCun(Meta首席AI科学家)当时的判断是:开源生态越繁荣,OpenAI和Google就越难形成垄断。Meta不卖API,它卖广告。AI生态不倒向任何一个闭源玩家,对Meta就有战略价值。
2025年4月5日,Llama 4发布,这次是质变。Scout和Maverick两款模型都用了混合专家(MoE)架构,原生支持文本和图像输入。Scout的1000万token上下文窗口至今是开源模型的纪录。Maverick在MMLU上超过了GPT-4o。截至2026年中期,Llama 4累计下载量突破2.3亿次,被超过80%的企业AI团队采用。
但故事有另一面。到2026年中期,DeepSeek V4、Qwen 3.5和Kimi K2.6在多项基准上已经超越了Llama 4 Maverick。Meta在2026年4月发布了闭源的Muse Spark模型,标志着Meta的前沿探索重心开始转向闭源。Llama 4 Behemoth(2万亿参数旗舰)从未公开发布,2026年5月暂停训练。Llama仍然是开源AI的基石,但不再是榜单第一。
核心功能
MoE稀疏激活架构
Llama 4首次在Llama系列中采用混合专家架构。Scout有16个专家(109B总参数/17B激活),Maverick有128个专家(400B总参数/17B激活)。每次推理只激活17B参数,推理成本远低于同等能力级别的稠密模型。这解决了"大模型能力vs推理成本"的根本矛盾。
原生多模态(Early Fusion)
Llama 4没有走"文本基座+视觉适配器"的老路。文本和视觉输入在预训练阶段就共享同一组Transformer层,从训练之初就融合。这使得跨模态推理更自然--模型不会把图片先转成文字描述再理解,而是同时处理两种模态。相比Llama 3.2多模态版本,视觉推理速度提升3倍,准确率提升28%。
1000万token上下文窗口
Scout的1000万token上下文相当于750万单词或15000页文本。可以一次性输入整个中型代码库(约10万行代码),处理完整法律合同、学术论文和书籍。在Needle-in-a-Haystack测试中,800万token范围内检索准确率达95%以上。但要注意:社区测试发现有效上下文在256k左右开始衰减,10M更多是理论值。
Llama Community License
许可证允许个人和企业免费商用、二次开发、私有化部署。唯一限制:月活用户超过7亿需向Meta申请额外授权。对绝大多数企业来说,等于没有限制。
生态与微调支持
Llama生态可能是开源模型里最完善的。Hugging Face、vLLM、Ollama、LM Studio、GPT-Q、AWQ等主流推理和量化框架都原生支持Llama。LoRA/QLoRA微调工具链成熟。Llama Recipes仓库提供从微调到部署的完整示例代码。
适合谁
适合: 需要私有化部署的企业(金融、医疗、政务等数据敏感行业);需要微调模型适应特定领域的研究团队和创业公司;需要超长上下文处理的场景(代码库分析、法律文档);需要控制单token成本的规模化推理场景。
不适合: 追求最强基准分数的用户(DeepSeek V4和Qwen 3.5目前更强);没有GPU资源自己部署的团队(用闭源API更简单);需要最好代码生成能力的开发者(Claude和DeepSeek在编程基准上领先)。
一个现实建议:如果你的项目对数据主权没有硬性要求,先试DeepSeek或Qwen的API。只有当数据必须留在自己服务器上、或者单token成本需要极致控制时,自托管Llama才值得投入运维成本。
同类竞品对比
| 维度 | Llama 4 Maverick | DeepSeek V3.1 | Qwen3-235B | Mistral Large 2 |
|---|---|---|---|---|
| 开发方 | Meta | 深度求索 | 阿里云 | Mistral AI |
| 架构 | MoE(400B/17B激活) | MoE(671B/37B激活) | 稠密 | 稠密 |
| 多模态 | 原生(文本+图像) | 否 | 有(VL版本) | 否 |
| 上下文窗口 | 1M token | 128K | 128K | 128K |
| 开源协议 | Llama Community License | MIT | Apache 2.0 | Apache 2.0 |
| 商用限制 | 7亿月活以上需授权 | 无限制 | 无限制 | 无限制 |
| 代码能力 | 中等(LiveCodeBench 43.4) | 强 | 强 | 中等 |
Llama 4 Maverick在多模态和超长上下文上有独特优势。但在纯语言能力和代码生成上,DeepSeek V4和Qwen 3.5目前领先。开源协议方面,Apache 2.0比Llama Community License更宽松--后者有7亿月活的限制条款。
FAQ
LLaMA 完全免费吗?
模型权重免费下载。Llama Community License允许商用,除非你的产品月活超过7亿。托管推理服务(如OpenRouter、Together AI)按token收费,Scout从$0.08/百万Token起。
Llama 4 Scout真的能在单张GPU上跑吗?
能。Scout在8-bit精度下需要单张A100 80GB。4-bit量化后可跑在RTX 4090(24GB)上,有轻微质量损失。这是Scout最大的卖点--1000万token上下文+单GPU部署。
Llama 4 Maverick比GPT-4o强吗?
在某些基准上是的(MMLU)。但在实际使用中,GPT-4o在推理能力和工具调用上仍然领先。到2026年中期,DeepSeek V4和Qwen 3.5在多数基准上也超过了Maverick。
Behemoth什么时候发布?
可能不会了。Behemoth(2万亿参数旗舰)从未公开发布权重,2026年5月暂停训练。Meta已转向闭源Muse Spark模型。不要把计划押在Behemoth或Llama 5上。
Llama 4和Llama 4.5的区别是什么?
这个存在争议。部分来源提到2026年6月有一次Llama 4.5更新,改善了指令遵循和代码质量。但也有权威评测方明确表示"Llama 4.5不存在"。建议以Meta官方公告为准。
开源模型和闭源API怎么选?
简单决策树:数据必须自控→自托管Llama或DeepSeek开源版。追求最强能力→用Claude或GPT API。成本敏感的大规模调用→DeepSeek API或自托管Llama Scout。需要多模态→Llama 4 Maverick或GPT-4o。
更新动态
2026年的态势对Llama来说有些复杂。一方面,累计下载2.3亿次、80%企业AI团队采用--这是任何开源AI项目都没达到过的渗透率。另一方面,Meta的前沿重心在向闭源Muse Spark转移,Behemoth被搁置,开源社区对Llama 4的代码生成能力和有效上下文长度存在批评。Llama是否还是Meta的战略重心,这个问题目前没有明确答案。
客户评论
综合评分:7.5/10(基于ThePlanetTools及多个第三方评测汇总)
"Scout的10M上下文是杀手锏。我们把整个代码仓库喂进去做代码审查,省了大量chunking的功夫。但256k之后效果确实开始打折。" --某金融科技公司AI架构师
"微调Llama 4 Maverick做医疗问答,效果比预期好。但部署成本不低,8张A100是起步。算上运维人力,不一定比调API便宜。" --某医疗AI创业公司CTO
"说实话,代码任务我们已经切到DeepSeek了。Llama 4的LiveCodeBench 43.4分在2026年不够看。但多模态和长上下文场景,Llama还是第一选择。" --某开源社区资深开发者
参考来源
GitHub | facebookresearch/llama,Meta开源LLaMA/Llama 2模型的官方GitHub仓库,包含推理代码和模型权重下载入口 Meta AI | Llama官网,Meta官方Llama产品页面,提供模型介绍、下载入口和开发者文档 Hugging Face | meta-llama,Meta在Hugging Face的官方模型库,提供Llama全系列模型下载 Meta AI Research | Llama 4 Publications,Meta AI研究团队发布的Llama 4技术白皮书 Meta AI | Llama Downloads,Meta官方模型权重下载申请页面
