无需编程或命令行即可使用 OpenAI Whisper。 简单的桌面界面,包含所有 Whisper 模型。支持离线运行或使用 OpenAI API。
OpenAI Whisper 是 OpenAI 于 2022 年 9 月发布的自动语音识别 (ASR) 系统。它在从互联网收集的 680,000 小时的多语言和多任务监督数据上进行了训练,在英语和多语言语音识别方面树立了新的基准。与之前需要特定领域的微调才能达到专业精度的最先进的 ASR 系统不同,Whisper 的训练数据规模产生了一个通用模型,在各种录音条件、口音、说话风格和语言中都具有强大的鲁棒性。
OpenAI Whisper 语音转文字的关键创新不在于新颖的架构,它使用的是标准的编码器-解码器 Transformer。创新之处在于训练数据的规模和多任务框架:该模型同时在 96 种语言的转录、翻译、语言识别和语音活动检测上进行了训练。这种多任务训练产生的泛化能力明显优于在更窄的语音分布上训练的模型。
StarWhisper 将 OpenAI Whisper 语音转文字打包成一个 Windows 桌面应用程序,使用 whisper.cpp,这是一个 C++ 运行时,消除了 Python 依赖关系,使非技术用户无需命令行工作即可进行本地 Whisper 处理。本页面解释了 Whisper 的功能、模型变体以及 StarWhisper 如何在日常生活中展示它们。
Whisper 发布了五种不同精度和速度权衡的模型尺寸。了解哪种模型适合您的工作,可以避免在任一方面做出不必要的妥协:
| 模型 | 参数 | 英语 WER | CPU 速度(估算) | StarWhisper 计划 |
|---|---|---|---|---|
| tiny | 39M | ~14% WER | ~10x 实时 | 免费(内置) |
| base | 74M | ~10% WER | ~7x 实时 | 免费(内置) |
| small | 244M | ~5.5% WER | ~1x 实时 | 免费(内置) |
| medium | 769M | ~3.5% WER | ~0.3x 实时 | Pro |
| large-v3 | 1.5B | ~2.5% WER | ~0.1x 实时 | Pro |
WER = LibriSpeech 清洁测试集上的词错率。越低越好。CPU 速度是基于现代桌面 CPU 的估算值;对于中大型模型,GPU 速度要快 5-10 倍。
对于大多数实时听写用例,small 模型(免费内置)可实现 94-96% 的准确率,处理速度足够快,能提供近乎实时的输出,这是我们要推荐的实用默认选项,即使是对于 GPU 用户也是如此。large-v3 模型最好保留用于长文件的批量转录,因为其在长片段上的训练值得其计算成本;在短听写片段上,large-v3 可能会过度纠错,产生的幻觉比 small 更多。
从官方仓库运行 OpenAI Whisper 语音转文字需要 Python 3.9+、PyTorch、ffmpeg,通常还需要与您的 GPU 驱动程序匹配的特定 CUDA 工具包版本。对于非开发人员来说,这是一个巨大的障碍。StarWhisper 完全消除了这一点。whisper.cpp 运行时是打包在安装程序中的编译型原生 Windows 可执行文件。安装 StarWhisper,打开它,转录。无需终端,无需包管理器,无需版本冲突。
StarWhisper 在安装程序中内置了 tiny、base 和 small 模型,可立即使用。Pro 用户可以从设置面板直接在应用程序内下载 medium 和 large-v3。模型管理、下载、切换、验证完整性均通过 GUI 处理,无需手动放置文件或配置。
StarWhisper 会自动检测 NVIDIA GPU,并在可用的情况下将 whisper.cpp 推理路由到 CUDA。GPU 加速使 OpenAI Whisper 语音转文字的速度比仅 CPU 处理快 5-15 倍,具体取决于模型大小。large-v3 模型在 CPU 上需要 10 倍实时时间,而在中端 NVIDIA GPU 上以大约 1.5-2 倍实时时间运行,这意味着 30 分钟的录音在 25 分钟内转录完成,而不是 5 小时。
官方的 OpenAI Whisper 模型并非为实时流式传输而设计,它以固定块处理音频。StarWhisper 的流式分段器以 3-5 秒的滚动窗口处理音频,通过使用重叠的上下文窗口提供近乎实时的输出,同时保持准确性。这在技术上比批处理更复杂,但对于实时听写工作流程至关重要。结果是在实时听写语境中获得 OpenAI Whisper 语音转文字的准确性,而不仅仅是针对上传的文件。
与使用 OpenAI Whisper API(将音频发送到 OpenAI 服务器并产生每分钟费用)不同,StarWhisper 的本地实现将所有音频保留在您的设备上。有关本地 Whisper 处理的隐私和安全详细信息,请参阅离线语音转文字 Windows 页面。
OpenAI 以每分钟音频 $0.006 的价格提供 Whisper 云端 API。乍一看这似乎很便宜;对于专业使用(每月 4 小时),费用为 $1.44。但这种比较忽略了几个重要因素:
OpenAI Whisper API 文档是云端 API 的参考。对于想要获得相同的 Whisper 准确度而没有云成本和隐私影响的用户,StarWhisper 是实用的替代方案。
使用 small 模型(内置,免费)。它在 CPU 上以大约实时速度处理,在 GPU 上更快,并且在清晰语音上提供 94-96% 的准确率。对于大多数听写任务,如电子邮件、笔记、文档,这就足够了,只需极少的更正。
对于长格式文件转录(讲座、访谈、播客),如果您不是实时等待,GPU 上的 large-v3 (Pro) 是正确的工具。额外的上下文有助于处理具有挑战性的长音频(口音、噪音、技术词汇)。保持 small 作为您的实时听写默认值,并专门针对批处理作业切换到 large-v3;在短片段上,large-v3 倾向于过度纠错。
对于非拉丁字母文字(中日韩 CJK、阿拉伯语、西里尔文)和长篇多语言录音,medium 模型通常是比 small 更合适的升级选择,因为 small 的多语言性能在这些文字上可能会下降。请参阅多语言语音转文字指南以获取针对每种语言的推荐。
CPU 上的 medium 模型很慢(0.3 倍实时),但可实现 96-97% 的准确率,对于批量文件转录是可以接受的,因为您不需要实时等待。对于想要比 small 更高准确率的 CPU 用户,可以运行批量转录过夜,而不是主动等待。
在您的 Windows 机器上进行 OpenAI Whisper 语音转文字,免费开始
下载 StarWhisperOpenAI Whisper 是模型,是一个开源语音识别系统。Whisper API 是一项云服务,在 OpenAI 的服务器上运行模型并按分钟收费。StarWhisper 在您的机器上本地运行相同的模型,不传输音频,也没有每分钟的费用。
对于短片段听写和大多数语音输入工作,Small 模型是我们推荐的实用默认选项。虽然 Large-v3 是开源版本中最大的通用 Whisper 模型,但在短音频上,它倾向于产生比 Small 更多的幻觉,因为它是在更长的片段上训练的。将 Medium 用于长音频或非拉丁字母文字(中日韩、阿拉伯语、西里尔文);将 Large-v3 保留用于长文件的批量转录。新的官方 Whisper 版本发布后将会得到支持。
StarWhisper 不需要 Python,不需要 CUDA 工具包配置,不需要命令行工作,并提供带有实时听写、文件转录、模型管理和热键控制的 GUI。这是使用专业软件和运行研究代码之间的区别。
Whisper 在包含医疗讲座、法律程序和技术内容的网络音频上进行了训练。它能相当好地处理常见的医疗和法律术语。对于高度专业化的词汇,准确度取决于这些术语在训练数据中出现的频率;罕见的技术术语可能需要后期编辑。