
Gemma
Gemma 是 Google 基于 Gemini 技术构建的开放权重模型,从边缘设备到个人电脑全覆盖,采用 Apache 2.0 许可。本文详解 Gemma 4 功能、竞品对比和使用场景。
| 基本信息 | 详情 |
|---|---|
| 开发公司 | Google DeepMind |
| 上线时间 | 2024年2月(Gemma 1 首次发布),最新 Gemma 4 于 2026年4月发布 |
| 官网 | https://ai.google.dev/gemma |
| 支持平台 | Linux、Windows、macOS(本地部署);Hugging Face、Kaggle、Ollama、Google AI Studio、Vertex AI |
| 价格 | 开源权重免费下载(Apache 2.0);仅承担自托管或云平台计算费用 |
| 核心定位 | 基于 Gemini 技术构建的轻量级开放模型,从边缘设备到个人电脑全覆盖 |
Gemma 是 Google DeepMind 的开放权重模型系列,和 Gemini 用同一套技术研发,但走的是完全不同的路线:Gemini 是闭源的商业 API,Gemma 是你能下载到自己机器上跑的开源模型。最新一代 Gemma 4 在 2026 年 4 月发布,覆盖从手机到个人电脑的场景。
Gemma 最让人在意的一点是许可证。从 Gemma 4 开始,Google 把许可证换成了 Apache 2.0--这是真正的 OSI 开源协议,没有 Meta 那种月活 7 亿用户要申请的限制,也没有可接受使用政策的附加条款。对企业法务来说,这是最干净的开放权重许可之一。
我们对比过几个开源模型系列,Gemma 在"每参数智能密度"上确实做得好。Gemma 4 的 31B 模型 MMLU 跑出 92.4%,这个成绩放在两三年前是旗舰闭源模型的水平。而 E2B/E4B 边缘模型能跑在手机和 IoT 设备上,这是 Llama 和 Mistral 系列没有认真覆盖的领域。
核心功能
多尺寸覆盖
Gemma 4 提供从 E2B(约 2B 有效参数)到 31B 的完整尺寸梯队。E2B 和 E4B 面向移动设备和 IoT,26B 是 MoE 架构(约 3.8B 激活参数),31B 是密集模型。你按硬件条件选模型,不用在能力上做太多妥协。
原生多模态
Gemma 4 支持文本和图像输入,E2B/E4B 还支持音频。不是事后接的视觉模块,是架构层面就支持的。做多模态应用不需要拼凑多个模型。
超长上下文
Gemma 4 上下文窗口最大 1M tokens(100 万)。边缘型号也有约 128K。这意味着你可以把整本书或大型代码库塞进去做分析,不用做切片和分块。
Apache 2.0 许可证
真正的开源协议。商用、修改、分发没有任何附加限制。对比 Llama 的 Community License(有用户规模限制和使用政策约束),Gemma 在许可证上更干净。法务审核能一次过。
边缘部署能力
Gemma 系列在边缘部署上投入很深。支持 Google AI Edge(TensorFlow Lite)、Ollama 本地运行、MatFormer 架构支持嵌套子模型。手机上跑 Gemma 不是演示概念,是实际可用的工作流。
官方变体生态
Google 围绕 Gemma 做了一批专门变体:MedGemma(医疗影像和文本)、ShieldGemma(内容安全分类)、TranslateGemma(55 种语言翻译)、FunctionGemma(边缘设备函数调用)、T5Gemma(编码器-解码器架构)。这些不是社区微调,是 Google 官方训练的。
适合谁
适合: 需要在手机或边缘设备上部署 AI 的开发者;法务要求 Apache 2.0 许可的企业团队;需要多模态输入但不想用闭源 API 的人;需要超长上下文做文档分析的研究者。
不适合: 需要最大参数量级的团队--Gemma 最大 31B,比不上 Llama 3.1 的 405B;中文场景为主的业务,Gemma 的多语言支持覆盖 100+ 语言但中文不是重点优化方向;需要消费级聊天界面直接用的非技术用户。
同类竞品对比
| 维度 | Gemma 4 (Google) | Llama 3.x (Meta) | Mistral (Mistral AI) |
|---|---|---|---|
| 许可证 | Apache 2.0 | Meta Community License | Apache 2.0 |
| 最大参数量 | 31B | 405B | 约 120B(MoE) |
| 边缘模型 | 是(E2B/E4B) | 有限(1B/3B) | 否 |
| 多模态 | 是(文本+图像+音频) | 3.2 起支持视觉 | 否 |
| 上下文窗口 | 最长 1M | 128K | 128K |
| 多语言 | 100+ 语言 | 8 种官方 | 英语为主 |
FAQ
Gemma 免费吗?
权重免费下载,Apache 2.0 许可。你只为自己跑模型的计算资源付费--自己的 GPU 零成本,云平台按使用量计费。Google AI Studio 里也能免费试。
Gemma 和 Gemini 有什么区别?
同一个技术血脉,但路线不同。Gemini 是 Google 的商业闭源模型,通过 API 调用,性能最强但你看不到权重。Gemma 是开放权重版本,你能下载、修改、本地部署,但参数量小得多。
Gemma 4 比 Gemma 3 好多少?
差距明显。Gemma 4 引入了 MoE 架构(26B 模型只有约 3.8B 激活参数),原生多模态支持,边缘模型的智能密度大幅提升。MMLU 从 Gemma 3 的约 80% 提升到 92.4%(31B 模型)。
在手机上能跑 Gemma 吗?
可以。E2B 模型专为移动设备设计,通过 Google AI Edge 部署到 Android 和 iOS。实际体验取决于手机性能,但日常推理任务在主流旗舰机上可行。
中文效果怎么样?
Gemma 官方支持 100+ 种语言,中文包含在内。实际体验中,中文理解和生成能力不算差,但和专门优化中文的模型(如 Qwen 系列)相比有差距。如果你的核心场景是中文,建议评估后决定。
可以用 Gemma 做商业产品吗?
可以。Apache 2.0 许可证允许任何商业用途,包括销售、集成到产品中、修改后闭源分发。没有用户规模限制,没有使用政策附加条款。
更新动态
客户评价
汇总评分:4.5 / 5(基于社区评测与 Hugging Face 反馈综合)
"Gemma 4 换成 Apache 2.0 是我们最终选它的原因。法务团队一周就批了,之前评估 Llama 卡在 Community License 上拖了两个月。" - 企业 AI 平台架构师
"E2B 模型在我们的 Android 应用上跑得很顺,延迟在可接受范围内。之前试过其他小模型,Gemma 的多模态能力让它明显胜出。" - 移动应用开发者
"31B 模型在 MMLU 上 92.4% 的成绩让我惊讶。同参数量级的 Llama 3 70B 也就 87% 左右。Google 在训练效率上确实有两把刷子。" - AI 研究员
参考来源
- ▸Google AI | Gemma 官方页面, Google 官方产品介绍,包含模型系列与集成平台
- ▸Google Blog | Introducing Gemma 4, Google 官方博客 Gemma 4 发布公告
- ▸Hugging Face | Gemma 模型集合, Hugging Face 官方变体模型集合页面
- ▸Google AI Edge | 文档, Google 移动与边缘设备 AI 部署文档
- ▸Google DeepMind | Gemma Scope 2, Google DeepMind 官方博客关于可解释性研究
