
| 基本信息 | 详情 |
|---|---|
| 开发公司 | AssemblyAI |
| 上线时间 | 2017年 |
| 官网 | https://www.assemblyai.com/ |
| 支持平台 | Web API(REST)、WebSocket流式、Python/JavaScript/Go SDK |
| 价格 | 免费$50额度;Universal-3.5 Pro $0.21/小时;流式 $0.45/小时;Voice Agent API $4.50/小时 |
| 核心定位 | 面向开发者的语音转文字API,准确率行业领先 |
AssemblyAI是一家2017年成立的语音AI公司,核心产品是developer-first的语音转文字API。跟那些给你一个网页界面、转完就完了的工具不同,AssemblyAI只做API——你写代码调用它,它返回高精度转录文本。这种定位决定了它的用户群体:不是想快速转个会议记录的普通用户,而是需要把语音识别能力嵌入自己产品的开发团队。
截至2026年,AssemblyAI的Universal-3.5 Pro模型在英文转录准确率上处于行业第一梯队。根据其公开的基准测试数据,在CommonVoice数据集上的WER(词错误率)为4.87%,比上一代Universal-2的6.48%有明显提升,幻觉率比OpenAI Whisper低30%。如果你做过语音转文字就知道这意味着什么——少改几遍稿子,少花几小时校对。
超过200,000名开发者在用AssemblyAI,G2评分4.8/5。Siro切换到Universal模型后客户投诉减少了90%,CallRail的转录准确率提升了23%。这些数字比任何营销文案都有说服力。
核心功能
Universal-3.5 Pro 转录引擎
旗舰模型。支持英语、西班牙语、法语、德语、意大利语、葡萄牙语6种语言的代码切换,可以在同一段音频中自动识别语言切换。异步转录$0.21/小时,适合会议记录、播客转录、呼叫中心质检等批量处理场景。
实时流式转录
Universal-3.5 Pro Realtime提供300ms P50延迟的实时转录,通过WebSocket连接。注意计费方式——按session持续时间而非音频时长计费。一个开了60分钟但只发送30分钟音频的连接,按60分钟收费。价格$0.45/小时。调用完记得马上断开连接。
LLM Gateway
2026年3月LeMUR正式更名为LLM Gateway。一个API就能调用OpenAI GPT、Anthropic Claude、Google Gemini等模型,直接对转录文本提问、生成摘要、提取行动项。不用自己搭RAG管线,省掉一大堆工程量。
说话人分离
标准版+$0.02/小时,实验版+$0.065/小时。在多人会议和访谈场景中表现稳定,能准确标注"谁说了什么"。实验版适合高说话人数量或音频质量差的场景。
Medical Mode
医疗领域专用模式,+$0.15/小时。支持英、西、德、法四种语言的医学术语识别。如果你做的是医疗文档系统,这个附加项基本是刚需。
PII Redaction
自动检测并脱敏转录文本和音频中的个人信息——信用卡号、电话号码、邮箱地址等50多种实体类型。对合规要求高的金融和医疗场景尤其重要。
Sync API
2026年7月14日上线的新接口。一个HTTP POST请求返回完整的Universal-3.5 Pro转录结果,中位数延迟134ms。适合语音指令、听写等短音频场景。价格$0.45/小时。
适合谁
适合: 正在构建会议记录工具、播客平台、呼叫中心分析系统、医疗文档系统或语音助手的开发团队。如果你的产品需要把音频变成可搜索、可分析的文字,AssemblyAI是目前API层面的最优选之一。
不适合: 只想转写几段录音的非技术用户。AssemblyAI没有终端用户界面,不会自动加入Zoom会议,也不帮你导出Word文档。你需要写代码才能用它。如果你只是想转个会议记录,去用Otter或讯飞听见更合适。
同类竞品对比
| 对比维度 | AssemblyAI | Deepgram | OpenAI Whisper | Google STT |
|---|---|---|---|---|
| 英文准确率(WER) | 4.87%(CommonVoice) | 约5.5% | 约5.8% | 约6.2% |
| 异步价格 | $0.21/小时 | $0.0043/分钟(约$0.26/小时) | 免费(自部署) | $0.024/分钟(约$1.44/小时) |
| 流式延迟(P50) | 300ms | 约400ms | N/A | 约500ms |
| 说话人分离 | +$0.02/小时 | 含在基础价 | 不支持 | 支持 |
| LLM集成 | LLM Gateway(GPT/Claude/Gemini) | 无原生 | 无原生 | 无原生 |
| 免费额度 | $50(约185小时) | $200额度 | 开源免费 | 每月60分钟 |
我测试过AssemblyAI和Deepgram的对比。AssemblyAI在实体识别(信用卡号、电话号码)上明显更好,附加功能也更丰富。但Deepgram的基础价格更低,如果你的需求只是纯转写且量很大,Deepgram的性价比更高。自部署Whisper免费但运维成本不低,还缺说话人分离和PII脱敏这些生产级功能。
FAQ
AssemblyAI免费额度够用吗?
$50免费额度,按Universal-2的$0.15/小时算约333小时,按Universal-3.5 Pro的$0.21/小时算约185小时。对开发和测试阶段来说足够了。不需要绑信用卡。
流式转录和异步转录怎么选?
能等结果就用异步($0.21/小时),需要实时反馈就用流式($0.45/小时)。价格差一倍多。语音助手、实时字幕这种场景没得选,必须用流式。播客转录、会议后处理这种能等的场景,异步就够了。
支持中文吗?
Universal-2支持99种语言包括中文,但Universal-3.5 Pro目前只支持英、西、法、德、意、葡6种语言。如果你的核心需求是中文转录,讯飞听见或阿里云语音识别可能更合适。
LLM Gateway额外收费吗?
是的,按token计费,输入和输出分开计价。具体费率取决于你选的模型。但通过AssemblyAI调用比直接调用各模型API更省事——一个端点搞定多家模型,还有prompt caching节省成本。
Medical Mode值得买吗?
如果你处理的是医疗相关的音频——医生口述病历、医患对话、临床记录——值得。普通转录模型在药品名称、剂量、解剖学术语上的错误率很高,Medical Mode能显著改善这一点。
有没有文件大小限制?
免费层有1小时单文件限制。付费层支持更大文件。多通道音频按通道数计费——1小时的双通道文件按2小时计费。
更新动态
近半年最值得关注的是三个动作:2026年3月LLM Gateway取代了旧版LeMUR,统一了多家大模型的调用入口;4月Voice Agent API上线,把STT+LLM+TTS打包成一个WebSocket,$4.50/小时全包;7月Sync API发布,为短音频场景提供了一个比流式更简单的调用方式。
客户评论
汇总评分: G2 4.8/5 | Trustpilot 未有足够数据
"Hands down SOTA accuracy, especially with challenging audio with lots of speakers and lots of noise. A massive step up over on-device transcription and noticeably better than OpenAI's Whisper." —— G2用户评论
"Assembly has saved us countless hours managing models, and provided exceptional accuracy." —— AssemblyAI官网客户反馈
Siro在切换到Universal模型后,客户投诉和支持工单减少了90%。CallRail的转录准确率提升了23%。这些是实打实的业务指标改善,不是实验室跑分。
参考来源
- ▸AssemblyAI官网 | Voice AI infrastructure for builders, AssemblyAI官方主页,提供产品概览和客户案例
- ▸AssemblyAI | Speech-to-text API pricing guide, 2026年7月更新的官方定价指南,涵盖所有模型和附加功能的费率
- ▸AssemblyAI | Models Authoritative Reference, 官方模型参考文档,包含基准测试数据、功能支持矩阵和迁移指南
- ▸AssemblyAI | Pricing Reference, 官方定价权威参考,2026年5月更新
- ▸G2 | AssemblyAI Reviews, G2平台用户评价聚合,评分4.8/5
