AI万址
Segment Anything(SAM)

Segment Anything(SAM)

Segment Anything(SAM)
访问官网
基本信息详情
开发公司Meta AI(Meta 超级智能实验室)
上线时间2023年4月(SAM 1);2025年11月19日(SAM 3)
官网https://segment-anything.com/
支持平台Linux、macOS、Windows(需GPU)
价格免费开源(Apache 2.0)
核心定位通用图像与视频分割基础模型

Segment Anything Model(SAM)是 Meta AI 在 2023 年 4 月发布的图像分割基础模型。你给它一个点、一个框、或者一句话,它就能把对应物体从图像里抠出来。第一代 SAM 的核心卖点是"可提示分割"--不是固定类别,而是任何物体都能分割。

2025 年 11 月,SAM 3 发布。这一代才是真正的飞跃。SAM 3 引入了"概念可提示分割"(Promptable Concept Segmentation):你输入"红色校车"或"穿白球衣的球员"这样的文本描述,它就能自动找到图像或视频中所有匹配的实例,并逐一分割、分配唯一 ID、跨帧追踪。以前需要一个一个点击,现在一句话搞定。

SAM 3 还引入了 SAM 3D,一个从单张图像重建 3D 物体和人体姿态的模型套件。Facebook Marketplace 的"在房间中查看"功能就是用这套技术实现的--让你在家居购买前预览灯具或桌子放在自己空间里的样子。

核心功能

01

文本提示分割

SAM 3 最亮眼的更新。支持开放词汇文本提示,不限于预定义类别。你说"复古风格的咖啡杯"或"左后轮",它能理解任意短语并分割出所有匹配实例。还支持图像示例作为提示--给一张参考图,它能找到所有类似的物体。

02

穷尽式实例分割

给你一个概念,SAM 3 自动找出图像/视频中所有匹配的实例,不是只找一个。每个实例分配唯一 ID,在视频中持续追踪。这意味着你可以一次性分割"所有穿红衣服的人"并各自追踪。

03

检测+分割+追踪三合一

SAM 3 把三个任务统一到一个模型里:检测(找到物体位置)、分割(生成像素级掩码)、追踪(跨帧维持身份)。不需要三个模型串联,一个模型搞定全流程。

04

Presence Token 机制

SAM 3 引入了一个"存在性令牌"。当你输入"穿白衣服的人"时,模型不仅找白衣人,还会判断"白衣"这个属性是否在场景中存在。有效避免了模型对不存在对象的误分割。听起来是个小细节,但在实际使用中大大降低了误报率。

05

SAM 3.1 视频效率提升

2026 年 3 月发布的 SAM 3.1 引入了对象多路复用,单次前向传播可追踪 16 个物体。在中等数量物体的视频中,处理速度翻倍:从 16 FPS 提升到 32 FPS(单张 H100 GPU)。让实时视频追踪在小规模硬件上变得可行。

适合谁

适合:计算机视觉研究者、需要大规模自动标注的 AI 团队、视频编辑工具开发者、AR/VR 应用开发者、机器人视觉团队。如果你在做医学影像、自动驾驶数据标注、或者电商商品分割,SAM 能省掉大量人工标注成本。

不适合:只需要简单抠图的普通用户(有很多更简单的在线工具)、需要极高精度的专业级分割场景(医学级精度仍需专用模型)、移动端实时应用(模型体积和计算需求仍然不小)。

同类竞品对比

维度SAM 3YOLOv8Mask2FormerGrounding DINO
开放词汇
视频追踪
统一架构检测+分割+追踪检测+分割分割检测
开源
LVIS AP54.1-38.524.6

SAM 3 在 LVIS 基准上达到 54.1 AP,比之前的最佳系统提升了 22%(从 47.0 到 54.1,而 47.0 本身就已经比 Grounding DINO 的 24.6 高出一倍多)。在视频分割任务上,SAM 3 达到人类性能的 75-80%。

FAQ

Q

SAM 3 可以商用吗?

A

可以。Meta 以 Apache 2.0 许可发布 SAM 3 的模型权重和代码。你可以免费用于商业项目。

Q

需要什么硬件?

A

SAM 3 的完整推理需要 GPU。具体取决于模型规模和输入分辨率,但一般来说一张 24GB 显存的 GPU(如 RTX 4090)可以处理大多数图像任务。视频处理对显存和算力要求更高。SAM 3.1 优化了视频处理效率,在单张 H100 上达到 32 FPS。

Q

SAM 3 支持中文文本提示吗?

A

SAM 3 的训练数据以英文概念为主,包含 400 万个概念标签。中文文本提示的兼容性取决于底层语言模型的理解能力,官方文档没有明确说明多语言支持情况。建议用英文名词短语效果最好。

Q

SAM 3 和 SAM 2 的区别是什么?

A

最大区别是 SAM 3 支持文本提示和穷尽式分割。SAM 2 只支持点、框、掩码等视觉提示,一次只能分割一个对象。SAM 3 可以用文字描述概念,自动找到所有匹配实例。SAM 3 还引入了 presence token、解耦的检测器-追踪器架构等改进。

Q

怎么开始使用 SAM 3?

A

从 GitHub 克隆 sam3 仓库,安装 Python 环境(需要 PyTorch 2.7+ 和 CUDA 12.6+)。Meta 提供了模型 checkpoint、评估代码和微调脚本。Segment Anything Playground 是官方的可视化试用平台,不需要写代码就能体验。

更新动态

SAM 3.1 的对象多路复用是最重要的近期更新。以前每个追踪对象需要单独一次前向传播,现在 16 个对象合并处理,消除了冗余计算和内存瓶颈。Meta 还联合 Conservation X Labs 和 Osa Conservation 发布了首个公开的野生动物监控视频数据集。

客户评论

评分维度评分
技术领先性5/5
开源友好度4.5/5
文档质量4/5
实用性4/5
上手难度3.5/5(需CV背景)

"SAM 3 的文本提示分割彻底改变了我们的数据标注流程。以前标注员逐帧点击,现在一句话就能批量分割所有目标实例。" - 自动驾驶数据团队负责人

"在视频编辑场景里,SAM 3 的追踪稳定性比 SAM 2 好太多。解耦架构确实解决了检测和追踪任务之间的干扰问题。" - CV 研究员

"Presence token 听起来不起眼,但在实际产品里大幅降低了误分割率。用户输入一个不存在的概念时,模型不会硬编一个结果出来。" - 医学影像AI工程师

参考来源