
| 基本信息 | 详情 |
|---|---|
| 开发公司 | 阿里巴巴达摩院(联合清华大学唐杰团队) |
| 上线时间 | 2021年1月(百亿参数版);2021年10月(十万亿参数版) |
| 官网 | https://m6.aliyun.com/ (已整合至通义千问体系) |
| 支持平台 | 阿里云PAI平台、M6服务化平台(内部及生态使用) |
| 价格 | 非公开API产品;后续由通义千问Qwen系列继承,Qwen API输入约0.5-2元/百万tokens |
| 核心定位 | 国内首个中文多模态预训练大模型,通义千问Qwen的技术前身 |
阿里巴巴M6,全称 MultiModality-to-MultiModality Multitask Mega-transformer,是达摩院在 2021 年推出的中文多模态预训练模型。说"M6"你可能没听过,但说"通义千问"你一定知道。M6 就是通义千问的前身,阿里大模型技术线的起点。
论文 2021 年 3 月发在 arXiv(2103.00823),后被 KDD 2021 接收。第一作者是林俊旸(Junyang Lin),他后来成为通义千问的灵魂人物,2026 年 3 月才卸任。通信作者是清华的唐杰教授和当时阿里 AI 负责人杨红霞。这条线很清楚:M6 是阿里达摩院和清华唐杰团队联合研发的,后来直接演化为通义千问 Qwen。
M6 最让我印象深刻的是训练效率。2021 年 5 月,达摩院用 480 张 V100 GPU 训出了万亿参数模型。对比一下:英伟达用了 3072 张 GPU,谷歌用了 2048 块 TPU。阿里把能耗降低了超过 80%,效率提升近 11 倍。到 2021 年 10 月,M6 参数从万亿跳到十万亿,用 512 张 GPU 花了 10 天就训完了。同等参数规模下,能耗只有 GPT-3 的 1%。这不是实验室数字游戏--这是实打实的工程突破。
核心功能
MoE 混合专家架构
M6 采用 Mixture-of-Experts 架构扩展参数规模。核心思路:每个 token 只激活部分专家模块,而不是跑满全部参数。这样总参数可以做到十万亿级,但单次推理的计算量远小于同等规模的稠密模型。达摩院在阿里云自研的 Whale 框架上实现了 expert 并行,配合 CPU offload 技术把 10 万亿参数塞进 512 张 GPU。
跨模态理解与生成
M6 同时支持文本和图像的理解与生成。它能做商品描述生成、视觉问答、社区问答、古诗词创作。更重要的是,M6 在国内最早探索了文本到图像生成--用 VQ-GAN 把图像编码为离散 token,再用预训练的 M6 学习文本和图像 code 之间的关系。这在 2021 年的中文社区是开创性的。
多任务统一预训练
通过不同的 mask 策略,M6 在同一个模型里同时学习了单模态和多模态的完形填空和语言模型任务。这意味着一个模型既能理解纯文本,也能理解图文混合内容,还能生成。后来这个思路发展为 M6-OFA(ICML 2022),一个模型处理超过 30 种跨模态任务。
中文原生训练
M6 的训练数据包含 1.9TB 图像和 292GB 中文文本,覆盖百科、问答、论坛讨论、商品描述等领域。这是当时中文社区最大的多模态预训练数据集。不是把英文模型翻译成中文,是从预训练阶段就原生中文。
Pseudo-to-Real 训练加速
M6 团队设计了"共享解除"机制:先用共享参数的小模型训练,再用它初始化大模型,让收敛效率提升 7 倍。达到同样 loss 的用时只有从头训练的 6%。这个技术后来影响了整个阿里大模型的训练范式。
适合谁
适合了解但不再适合直接使用。 M6 作为研究项目已经完成了它的历史使命。如果你研究大模型训练效率优化、MoE 架构演进,M6 的论文和技术报告是必读材料。如果你做中文多模态应用,应该直接用它的继任者通义千问 Qwen 系列。
不适合: 需要直接调用 API 的开发者--M6 没有公开 API,已整合进通义体系。需要最新多模态能力的团队--Qwen-VL、Qwen2.5-Omni 在能力上已远超 M6。追求开源模型自部署的团队--应该用 Qwen 开源系列(Apache 2.0),而不是 M6。
同类竞品对比
| 维度 | 阿里M6 (2021) | 百度ERNIE 3.0 (2021) | 华为盘古α (2021) | 智源悟道2.0 (2021) |
|---|---|---|---|---|
| 参数规模 | 10万亿 | 未公开 | 2000亿 | 1.75万亿 |
| 模态 | 多模态(文本+图像) | 文本为主 | 文本为主 | 文本+图像 |
| 训练GPU | 512张V100 | 未公开 | 未公开 | 未公开 |
| 能效 | GPT-3的1% | - | - | - |
| 后续发展 | →通义千问Qwen | →文心一言 | 断线 | →智谱GLM |
FAQ
M6 和通义千问是什么关系?
M6 是通义千问的直接前身。2022 年 9 月达摩院发布"通义"大模型系列,底层技术底座就是 M6-OFA。2023 年 4 月通义千问 Qwen 正式发布,继承了 M6 的多模态技术积累。M6 核心团队(林俊旸、周畅等)直接转入了通义千问项目。
M6 现在还能用吗?
不能。M6 作为独立项目已不再维护,m6.aliyun.com 已整合到通义体系。需要类似能力请使用通义千问 Qwen 系列 API 或开源模型。
M6 的十万亿参数是怎么做到的?
靠 MoE 架构。每个 token 只激活部分专家模块,所以总参数可以做到十万亿,但单次推理计算量远小于同等规模的稠密模型。配合阿里云自研 Whale 框架的 CPU offload 技术,512 张 GPU 就能装下十万亿参数。
M6 的论文在哪里?
主论文 "M6: A Chinese Multimodal Pretrainer" 发表在 KDD 2021(arXiv:2103.00823)。MoE 扩展论文 "M6-T: Exploring Sparse Expert Models and Beyond"(arXiv:2105.15082)。统一底座论文 M6-OFA 发表在 ICML 2022。
M6 参与了哪些实际业务?
2021 年双11期间,M6 在犀牛智造为品牌设计服饰(已在淘宝上线),为天猫虚拟主播创作剧本,提升淘宝和支付宝的搜索与内容认知精度。日调用量上亿,覆盖超过 40 个业务场景。
为什么 M6 没有像 ChatGPT 那样火?
M6 的重心是多模态预训练和工程效率,不是对话交互。它发布于 2021 年,比 ChatGPT 早了一年多,但当时大模型的公众认知还没打开。阿里后来用通义千问补上了对话能力这一课。
更新动态
M6 项目本身已经完成了历史使命。它最重要的遗产是技术基因:MoE 架构经验、多模态预训练方法论、高效训练框架。这些全部传给了通义千问。到 2026 年,通义千问已开源 300 余个模型,全球下载量突破 6 亿次,衍生模型 17 万个。M6 的核心团队也有变化:第一任负责人周畅 2024 年离职转投字节跳动,林俊旸 2026 年 3 月卸任,由从 Google DeepMind 挖来的周浩接手。但技术路线没有断。
客户评论
M6 作为内部研究项目没有公开的用户评分体系。以下评价来自后续通义千问的使用反馈,体现了 M6 技术遗产的实际价值。
评论一: "M6 在 2021 年就用 480 张卡跑出万亿参数,这个能效放到今天看也是顶尖的。后来通义千问能这么快迭代,底子是 M6 打的。"--AI 架构师(来源:今日头条技术社区)
评论二: "阿里大模型技术族谱里,M6 是最容易被漏掉的一环。但它确实是通义千问的根,林俊旸从 M6 一路带到 Qwen,多模态能力是阿里区别于其他国产大模型的护城河。"--行业分析(来源:今日头条)
参考来源
- ▸arXiv | M6: A Chinese Multimodal Pretrainer,M6 主论文,KDD 2021 接收,第一作者林俊旸,详细描述了模型架构、训练数据和下游任务
- ▸CSDN | 仅用480块GPU跑出万亿参数!全球首个"低碳版"巨模型M6来了,CSDN 资讯报道,含 MoE 架构原理和训练效率对比数据
- ▸阿里云开发者社区 | 覆盖200+服务场景,阿里「通义」大模型系列打造国内首个AI统一底座,阿里云官方技术博客,详解 M6-OFA 统一底座架构
- ▸InfoQ | Alibaba Announces 10 Billion Parameter Multi-Modal AI M6,InfoQ 英文报道,M6 百亿参数版发布的国际媒体报道
- ▸通义官网 | 通义大模型发展历程,阿里通义官方页面,记录了从 M6 到 Qwen 的完整发展时间线
