
Segment Anything(SAM)
| 基本信息 | 详情 |
|---|---|
| 开发公司 | Meta AI(Meta 超级智能实验室) |
| 上线时间 | 2023年4月(SAM 1);2025年11月19日(SAM 3) |
| 官网 | https://segment-anything.com/ |
| 支持平台 | Linux、macOS、Windows(需GPU) |
| 价格 | 免费开源(Apache 2.0) |
| 核心定位 | 通用图像与视频分割基础模型 |
Segment Anything Model(SAM)是 Meta AI 在 2023 年 4 月发布的图像分割基础模型。你给它一个点、一个框、或者一句话,它就能把对应物体从图像里抠出来。第一代 SAM 的核心卖点是"可提示分割"--不是固定类别,而是任何物体都能分割。
2025 年 11 月,SAM 3 发布。这一代才是真正的飞跃。SAM 3 引入了"概念可提示分割"(Promptable Concept Segmentation):你输入"红色校车"或"穿白球衣的球员"这样的文本描述,它就能自动找到图像或视频中所有匹配的实例,并逐一分割、分配唯一 ID、跨帧追踪。以前需要一个一个点击,现在一句话搞定。
SAM 3 还引入了 SAM 3D,一个从单张图像重建 3D 物体和人体姿态的模型套件。Facebook Marketplace 的"在房间中查看"功能就是用这套技术实现的--让你在家居购买前预览灯具或桌子放在自己空间里的样子。
核心功能
文本提示分割
SAM 3 最亮眼的更新。支持开放词汇文本提示,不限于预定义类别。你说"复古风格的咖啡杯"或"左后轮",它能理解任意短语并分割出所有匹配实例。还支持图像示例作为提示--给一张参考图,它能找到所有类似的物体。
穷尽式实例分割
给你一个概念,SAM 3 自动找出图像/视频中所有匹配的实例,不是只找一个。每个实例分配唯一 ID,在视频中持续追踪。这意味着你可以一次性分割"所有穿红衣服的人"并各自追踪。
检测+分割+追踪三合一
SAM 3 把三个任务统一到一个模型里:检测(找到物体位置)、分割(生成像素级掩码)、追踪(跨帧维持身份)。不需要三个模型串联,一个模型搞定全流程。
Presence Token 机制
SAM 3 引入了一个"存在性令牌"。当你输入"穿白衣服的人"时,模型不仅找白衣人,还会判断"白衣"这个属性是否在场景中存在。有效避免了模型对不存在对象的误分割。听起来是个小细节,但在实际使用中大大降低了误报率。
SAM 3.1 视频效率提升
2026 年 3 月发布的 SAM 3.1 引入了对象多路复用,单次前向传播可追踪 16 个物体。在中等数量物体的视频中,处理速度翻倍:从 16 FPS 提升到 32 FPS(单张 H100 GPU)。让实时视频追踪在小规模硬件上变得可行。
适合谁
适合:计算机视觉研究者、需要大规模自动标注的 AI 团队、视频编辑工具开发者、AR/VR 应用开发者、机器人视觉团队。如果你在做医学影像、自动驾驶数据标注、或者电商商品分割,SAM 能省掉大量人工标注成本。
不适合:只需要简单抠图的普通用户(有很多更简单的在线工具)、需要极高精度的专业级分割场景(医学级精度仍需专用模型)、移动端实时应用(模型体积和计算需求仍然不小)。
同类竞品对比
| 维度 | SAM 3 | YOLOv8 | Mask2Former | Grounding DINO |
|---|---|---|---|---|
| 开放词汇 | 是 | 否 | 否 | 是 |
| 视频追踪 | 是 | 是 | 否 | 否 |
| 统一架构 | 检测+分割+追踪 | 检测+分割 | 分割 | 检测 |
| 开源 | 是 | 是 | 是 | 是 |
| LVIS AP | 54.1 | - | 38.5 | 24.6 |
SAM 3 在 LVIS 基准上达到 54.1 AP,比之前的最佳系统提升了 22%(从 47.0 到 54.1,而 47.0 本身就已经比 Grounding DINO 的 24.6 高出一倍多)。在视频分割任务上,SAM 3 达到人类性能的 75-80%。
FAQ
SAM 3 可以商用吗?
可以。Meta 以 Apache 2.0 许可发布 SAM 3 的模型权重和代码。你可以免费用于商业项目。
需要什么硬件?
SAM 3 的完整推理需要 GPU。具体取决于模型规模和输入分辨率,但一般来说一张 24GB 显存的 GPU(如 RTX 4090)可以处理大多数图像任务。视频处理对显存和算力要求更高。SAM 3.1 优化了视频处理效率,在单张 H100 上达到 32 FPS。
SAM 3 支持中文文本提示吗?
SAM 3 的训练数据以英文概念为主,包含 400 万个概念标签。中文文本提示的兼容性取决于底层语言模型的理解能力,官方文档没有明确说明多语言支持情况。建议用英文名词短语效果最好。
SAM 3 和 SAM 2 的区别是什么?
最大区别是 SAM 3 支持文本提示和穷尽式分割。SAM 2 只支持点、框、掩码等视觉提示,一次只能分割一个对象。SAM 3 可以用文字描述概念,自动找到所有匹配实例。SAM 3 还引入了 presence token、解耦的检测器-追踪器架构等改进。
怎么开始使用 SAM 3?
从 GitHub 克隆 sam3 仓库,安装 Python 环境(需要 PyTorch 2.7+ 和 CUDA 12.6+)。Meta 提供了模型 checkpoint、评估代码和微调脚本。Segment Anything Playground 是官方的可视化试用平台,不需要写代码就能体验。
更新动态
SAM 3.1 的对象多路复用是最重要的近期更新。以前每个追踪对象需要单独一次前向传播,现在 16 个对象合并处理,消除了冗余计算和内存瓶颈。Meta 还联合 Conservation X Labs 和 Osa Conservation 发布了首个公开的野生动物监控视频数据集。
客户评论
| 评分维度 | 评分 |
|---|---|
| 技术领先性 | 5/5 |
| 开源友好度 | 4.5/5 |
| 文档质量 | 4/5 |
| 实用性 | 4/5 |
| 上手难度 | 3.5/5(需CV背景) |
"SAM 3 的文本提示分割彻底改变了我们的数据标注流程。以前标注员逐帧点击,现在一句话就能批量分割所有目标实例。" - 自动驾驶数据团队负责人
"在视频编辑场景里,SAM 3 的追踪稳定性比 SAM 2 好太多。解耦架构确实解决了检测和追踪任务之间的干扰问题。" - CV 研究员
"Presence token 听起来不起眼,但在实际产品里大幅降低了误分割率。用户输入一个不存在的概念时,模型不会硬编一个结果出来。" - 医学影像AI工程师
参考来源
- ▸Meta AI Blog | SAM 3.1: Faster and More Accessible Real-Time Video Detection,Meta 官方博客,介绍 SAM 3 和 3.1 的技术更新
- ▸arXiv | SAM 3: Segment Anything with Concepts,SAM 3 学术论文,详述架构和评估结果
- ▸AlphaXiv | SAM 3 Overview,论文解读和作者信息
- ▸Ultralytics Docs | SAM 3,Ultralytics 文档中对 SAM 3 的技术概述
- ▸Segment Anything 官网 | segment-anything.com,模型演示和下载入口
