语音识别服务器是 BigUncle 开发的 MCP 服务器:基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转录功能。接入两步走:pip install -r requirements.txt,再把下文配置粘进客户端 mcpServers 段重启即可。
它是干什么的
先把话说清楚:语音识别服务器不是又一个大模型,而是一个标准的 MCP 服务器。装好之后,你的 AI 客户端多出一组新工具,模型可以按需调用。基于Faster Whisper的高性能语音识别MCP服务器,提供高效的音频转录功能
| 项目 | 数据 |
|---|---|
| 开发者 | BigUncle |
| Star | 17 |
| 收藏 | 0 |
| 质量等级 | C |
| 平台分类 | 内容生成 |
| 部署标签 | 本地部署、语音识别、音频转录 |
| 仓库 | Fast-Whisper-MCP-Server |
核心能力
- Integrated with Faster Whisper for efficient speech recognition
- Batch processing acceleration for improved transcription speed
- Automatic CUDA acceleration (if available)
- Support for multiple model sizes (tiny to large-v3)
- Support for batch transcription of audio files in a folder
- Model instance caching to avoid repeated loading
- Dynamic batch size adjustment based on GPU memory
适合谁用
两类人最该装:一是靠 AI 出稿、出图、做内容流水线的内容团队;二是已经在用 MCP 生态、想按需拼装能力的折腾型用户。反过来,如果你只需要偶尔手动用它背后的服务,直接开网页就行,不必上 MCP。
完整安装配置步骤
动手前确认环境齐了:
- Python 3.10+ 与 pip(个别仓库要求 3.11+,以 README 为准)。
- 一个支持 MCP 的客户端:Claude Desktop、Cursor、Cline、Windsurf 任选其一。
第 1 步:安装语音识别服务器
终端里任选一条(不同安装方式,效果等价):
pip install -r requirements.txt
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu126
pip install torch==2.5.1 torchvision==0.20.1 torchaudio==2.5.1 --index-url https://download.pytorch.org/whl/cu121
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cpu第 2 步:按官方说明写入配置
语音识别服务器的 README 没给标准 mcpServers JSON,配置入口见 官方文档 的 Usage/Configuration 章节。原则不变:客户端配置文件里加 mcpServers 条目,重启生效。
第 3 步:重启并验证
完全退出客户端再打开(是托盘里真正退出,不是关窗口)。工具列表里出现语音识别服务器的工具即接入成功;调用报错的话,先查下面的坑点清单。
容易踩的坑
- 改了配置没反应:客户端只重启了窗口没退进程。macOS 按 Cmd+Q,Windows 检查托盘。
- JSON 报错打不开客户端:多半是最后多个逗号。粘进任何 JSON 校验器里查一遍再保存。
常见问题
语音识别服务器免费吗?
代码在 GitHub(https://github.com/BigUncle/Fast-Whisper-MCP-Server)开放获取。个别功能依赖第三方服务时费用另算,看仓库 LICENSE 和定价页。
语音识别服务器能用在 Cursor / Cline 吗?
能。MCP 是通用协议,同一份 mcpServers 配置在这些客户端之间基本通用,只是配置文件位置不同。
需要外网或代理吗?
拉包和调用官方 API 需要能访问 GitHub 与对应服务域名,内网环境先测 git ls-remote 和接口连通性。
