识别您的语音。支持马拉地语、印地语、古吉拉特语、泰米尔语、马拉雅拉姆语、阿拉伯语、日语以及其他 90 多种语言。 无需额外的语言包。
多语言语音转文字是语音技术中最常被过度承诺且兑现不足的功能之一。软件公司在功能页面上列出“支持 99 种语言”,却掩盖了其中许多语言在实际应用中表现较差的事实。对于整天在西班牙语和英语之间切换的双语专业人士,或转录阿拉伯语采访的研究人员来说,这种差距可能使工具无法使用。
OpenAI Whisper 在 2022 年发布时改变了这一格局。它在从网络上收集的 680,000 小时的多语言音频数据上进行了训练,是除主要云提供商 API 之外训练最广泛的公开可用的语音识别模型。重要的区别在于,Whisper 是一个单一模型,可以原生处理语言识别和转录。不存在“法语 Whisper”或“日语 Whisper”。同一个模型可以处理 96 种语言,而且英语与世界主要语言之间的质量差距明显小于旧系统。
StarWhisper 将这种多语言语音转文字功能以实用的、无需配置的桌面应用程序形式带到了 Windows 上。您不需要 Python、命令行或任何技术设置。只需选择您的语言,按下热键,然后说话。本页面是一份真实指南,介绍不同模型大小和用例下多语言语音转录的适用范围、局限以及如何获得最佳效果。
研究人员、国际商务专业人士、内容创作者和双语用户对多语言转录工具有不同的需求。以下是真正重要的功能:
一个工具如果只能很好地处理英语,却在您的第二语言上表现不佳,对于多语言工作来说并不是真正有用的。您需要一个引擎,它使得您的语言之间的质量差距足够小以便于工作。较大的 Whisper 模型通常在世界主要语言上表现更好,但输出仍然取决于音频质量和语言覆盖范围。
在录音之间手动切换语言设置会扼杀工作流。良好的多语言语音转文字应该能够从音频本身识别所说的语言,而无需您每次会话前都预先声明。
国际团队通常需要英文的会议记录、采访逐字稿或研究输出,而无论源语言是什么。内置的语音转英文翻译功能消除了以前需要转录再使用单独翻译工具的工作流步骤。
按分钟收费转录的云端服务通常会对非英语语言收取额外费用,或者在收费相同的情况下表现更差。适用于所有语言的统一费率定价是使多语言工作流在经济上可预测的唯一模式。
多语言用户更有可能在不同国家工作,且各国的数据驻留法律不同。在 US 服务器上处理的法语商务音频会引发 GDPR 问题。本地离线处理完全消除了这些跨境合规性难题。
真正的双语语音通常会在句子中混用语言。"So the meeting was at 3 o'clock, aber wir haben keine Einigung erreicht"(会议是在 3 点,但我们没有达成一致)在德语商务环境中是很自然的。成熟的多语言引擎可以在不失主要转录上下文的情况下处理这些语言切换。
较旧的语音识别架构为每种语言维护单独的声学模型。日语需要日语模型,阿拉伯语需要阿拉伯语模型,依此类推。这造成了组合扩展问题:支持 20 种语言意味着 20 个模型、20 个维护负担,以及取决于每种语言投资多少的极不一致的质量。
Whisper 的工作方式不同。它是一个同时在多语言数据上训练的单一编码器-解码器 Transformer。该模型学习将语言识别作为转录的一部分,而不是作为一个单独的步骤。当您安装 StarWhisper 并下载大模型时,您只需一个 3GB 的文件即可获得所有 96 种支持语言的功能性多语言语音转文字。没有法语附加组件或日语语言包。
StarWhisper 的自动检测模式要求 Whisper 在转录开始之前从初始音频片段中识别所说的语言。对于世界主要语言,这种识别通常既可靠又快速。您可以录制语音备忘录,对其进行转录,并接收源语言的格式化输出,而无需打开设置。
对于少数语言、与较大语言共享语音特征的区域方言,以及非常短的录音,自动检测的可靠性较低。对于这些情况,在设置中明确设置语言会产生更一致的结果。检测准确性也取决于模型:大模型的语言识别能力明显优于小模型,特别是对于 Whisper 训练数据有限的语言。
StarWhisper 包括一个“翻译成英文”模式,可在单次通过中执行转录和翻译。这是 Whisper 模型本身的直接功能,而不是将文本通过单独翻译 API 的后处理步骤。说法语,得到英语。说日语,得到英语。对于主要语言,翻译质量很强,足以满足大多数专业用途,尽管出版质量的翻译应由母语人士审核。
这对于国际研究团队、标准化为英语文档的跨国公司,以及希望快速理解外语音频内容的内容创作者来说很重要。本地管道可以在您的设备上运行,用于私密的源语言音频工作流。
对于多语言语音,模型选择比简单的英语听写更重要。对于覆盖良好的拉丁文字语言(德语、法语、西班牙语、葡萄牙语、意大利语和类似语言),Small 模型仍然是实时听写的实用默认选项。对于非拉丁文字(CJK、阿拉伯语、西里尔字母)和资源较少的语言,Medium 模型通常是正确的升级选择。
Pro 用户可以访问 large-v2 和 large-v3 模型,它们对于长篇多语言录音的批量转录最有用,而不是短时的实时剪辑。在短听写片段上,较大的模型可能会过度校正;将它们留给额外上下文值得其计算开销的文件。拥有 NVIDIA GPU 的用户处理大模型音频的速度明显快于仅 CPU 的系统,使长篇多语言内容更实用。
在所需模型可用后,StarWhisper 可以在本地处理多语言转录。多语言转录不需要单独的云端语言服务即可进行本地工作流。这对于跨境数据合规性很重要:转录客户对话的德国律师、采访消息来源的法国记者以及处理敏感采访数据的韩国研究人员,无论内容语言如何,都可以从本地处理中受益。请参阅离线语音转文字指南了解更多隐私注意事项。
多语言转录格局有三个明显的类别,每个类别都有真正的权衡取舍。
| 工具 | 语言 | 处理方式 | 定价 | 非英准确度 |
|---|---|---|---|---|
| StarWhisper (大) | 96 种语言 | 100% 本地 | $10/月 统一 | 各异 |
| Google Cloud Speech | 100+ 种语言 | 云端上传 | $0.016/分钟+ | 各异 |
| Otter.ai | 主要英语 | 云端上传 | $16.99/月 | 有限 |
| Whisper CLI (原生) | 96 种语言 | 100% 本地 | 免费 | 各异 |
| Azure Speech | 100+ 种语言 | 云端上传 | $0.017/分钟 | 各异 |
由于共享相同的底层模型,原生 Whisper CLI 产生的转录质量与 StarWhisper 相同。StarWhisper 增加的是 Windows 桌面 UX、实时麦克风听写、浮动小部件、GPU 加速预配置以及自动将文本插入任何应用程序。在原生 Whisper 和 StarWhisper 之间的选择在于您想要的是工具还是工作流。
Whisper 的多语言准确度基准记录在 arXiv 上的原始 Whisper 论文中,其中包含跨语言组的详细词错误率表。具有强大 Whisper 训练覆盖的欧洲语言通常在较大的本地模型上表现良好。对于资源较少的语言,专门针对这些语言投资的云端系统可能仍具有优势。
在 StarWhisper 的设置中明确设置语言。明确选择比自动检测稍快,并避免了短音频片段被错误识别的罕见情况。对于覆盖良好的拉丁文字语言(德语、法语、西班牙语、葡萄牙语、意大利语),小模型是实用的默认选项。对于非拉丁文字和资源较少的语言,请升级到 Medium。大模型最好保留用于长篇录音的批量转录,其长片段训练能物尽其用;在短时实时听写上,较小的模型通常表现一样好甚至更好。
使用大模型的自动检测模式。StarWhisper 可以自动识别每次录音的语言。对于切换语言的实时听写会话,创建两个预配置语言的 StarWhisper 配置文件,并根据需要切换。这比依赖检测进行快速切换更快。请参阅语音转文字软件概述了解更多工作流配置。
启用“翻译成英文”选项。这会直接从非英语语音生成英文文本,无需通过单独的翻译服务路由。对于大多数专业用途,翻译质量足以满足笔记、摘要和工作文档。对于法律或出版语境,请让母语人士审核输出。对于西班牙语、法语、德语、葡萄牙语、意大利语以及 Whisper 训练集中代表充分的其他语言,翻译质量最高。
在模型可用后,StarWhisper 的本地处理可以将音频保留在您的设备上以进行离线工作流。这与欧洲 GDPR 敏感工作、音频不应越境的敏感研究背景,以及无论法律管辖区如何主题都需要保密的专业背景相关。请参阅离线语音转文字页面以获取完整的隐私信息。
将 StarWhisper 配置为多语言使用大约需要 10 分钟,其中大部分时间是等待模型下载。之后,它需要零持续配置。
Windows 版多语言语音转文字,支持本地离线工作流
免费下载 StarWhisper虽然 Whisper 可以相当好地处理语码转换,但在单一语言中使用完整的句子比密集的语言混合能产生更准确的输出。如果您正在口述笔记并自然地切换语言,那没关系。如果您正在处理以长块交替使用两种语言的录音,在转录前按语言部分拆分音频通常会产生更清晰的结果。
Whisper 对比旧系统的稳健性优势在英语方面最大。对于非英语语言,噪音和压缩伪影对准确度有更大的负面影响。对于有背景噪音的录音,语音增强或降噪预处理(甚至是 Audacity 降噪等免费工具)可以在将音频输入 StarWhisper 之前显着提高多语言转录准确性。
自动检测很方便,但会增加一点处理开销。如果您大部分时间都在转录一种语言,请明确设置它。将自动检测保留给您真的不知道录音是什么语言的情况,或用于混合语言文件的批量处理。
Whisper 对大多数主要语言应用适当的标点和大小写。德语名词会自动大写。法语标点间距规则通常被遵循。日语输出使用适当的汉字、平假名和片假名。然而,对于正式文档,最后审查特定语言的惯例是值得的,特别是对于较不常见的标点符号和专有名词大写。
StarWhisper 通过 Whisper 引擎支持 96 种语言。该应用程序在设置下拉菜单中包含 29 多种语言的预设;可以通过其 ISO 代码选择其他语言。语言准确性随 Whisper 训练数据的可用性而变化,世界主要语言表现最好。
是的。自动检测模式会在转录开始之前从前几秒音频中识别所说的语言。对于主要语言,检测是可靠的。对于与较大语言共享语音特征的少数语言或方言,手动选择语言会产生更一致的结果。
不需要。Whisper 是一个处理所有 96 种语言的单一模型。下载 large-v3 模型可以为您提供所有语言的完整多语言功能。没有按语言划分的模型文件或语言包下载。
是的。在设置中启用“翻译成英文”选项,即可从非英语语音接收英文文本输出。翻译使用 Whisper 的内置翻译功能,完全在本地运行。对于主要欧洲和东亚语言,质量最强。对于正式文件,建议由母语人士审核。
对于具有强大 Whisper 覆盖的拉丁文字语言(德语、法语、西班牙语、葡萄牙语、意大利语和类似语言),小模型是实用的默认选项。对于非拉丁文字(CJK、阿拉伯语、西里尔字母)和资源较少的语言,请升级到 Medium。大模型最好保留用于长篇多语言录音的批量转录;在短剪辑上,较小模型通常表现更好,因为它们是在较短片段上训练的。
可以,在所需模型可用后,对于本地工作流可以离线工作。支持语言的音频可以在本地处理,无需单独的云端语言服务。
当语言在语音上截然不同时,Whisper 可以相当好地处理句内语言混合(语码转换)。德语文本中的英语技术术语,或英语采访中的法语短语,通常会被正确转录。对于在长部分中交替使用两种语言的录音,在转录前按语言部分拆分音频会产生更清晰的结果。