单词错误率通常写作 WER,是衡量语音识别准确度的一种方法。它是转录中与实际说话内容不符的单词的百分比。2% 的 WER 意味着 100 个单词中有 98 个被正确转录;5% 的 WER 意味着 100 个单词中有 95 个。数字越低越好。
就这样了:一次特定测试中的错误计数,在一个特定的条件组合下运行。关于准确度的营销主张几乎总是引用单词错误率,单词错误率几乎总是在与实际使用情况完全不相似的条件下测量。
单词错误率是如何实际测量的
单词错误率通过让某人在安静的房间内朗读文本进行录音、在其上运行语音转文本引擎以及计算出错单词的百分比来计算。标准测试使用专业录音、专业麦克风以及事先写好以便朗读的文本——几乎总是用几个标准英语种类之一。
这就是为什么它很有用:它是可重复的,并且可以在引擎间比较。不同的引擎在相同的基准上运行,百分比是这些确切条件下转录质量的苹果对苹果的衡量。本地设备语音识别和云端服务都以这种方式进行测量。
这也是为什么在实践中它具有误导性。
公布的单词错误率在实际使用中不衡量什么
语音识别引擎的实际性能取决于单词错误率不包括的因素:
- 麦克风质量。基准使用专业录音设备。笔记本麦克风或耳机会产生不同的结果,有时会产生戏剧性不同的结果。
- 背景噪音。基准通常在安静的工作室中测量。真实的语音输入发生在键盘点击的办公室、汽车、咖啡馆里。
- 口音和语音特征。基准通常针对狭窄范围的英语语音进行训练,通常来自北美或英国。有不同口音的说话者或说语言的人和那些模型没有训练的人会看到比公布基准更高的错误率。
- 说话方式。基准使用用正式语音读出的文本。会话语音、意识流、技术术语和快速说话都会产生不同于朗读预先准备的脚本的人的错误率。
- 您使用的特定单词。在金融术语中训练的引擎在医学术语中表现会更差,反之亦然。
为什么单词错误率在实际使用中复合
这是营销掩盖的部分。如果引擎的错误率为 2%,这意味着 100 个单词中有 2 个是错误的。但大多数语音输入发生在句子或段落中,而不是 100 字的运行。一个 50 字句子的 2% 错误率大约会有一个错误——这意味着大约 63% 的句子级别准确度。一个 100 字的段落平均会有两个错误。小的百分比迅速堆积。
准确度实际上何时重要
准确度是实时且可在基准上测量的。它在实践中的重要性比营销表明的要狭窄。
- 术语重的工作。在医学术语中训练的引擎在医学转录上会比普通引擎更准确。
- 嘈杂环境。为过滤背景噪音设计的引擎在有噪音的地方会表现得更好。
- 不寻常的语言。专门针对您的语言和口音训练的引擎将比针对不同种类训练的引擎表现更好。
对于一般英语语言的语音输入在相当安静的设置中,2% 和 3% 单词错误率发布的基准之间的差异是如此之小,以至于麦克风质量和清晰说话比引擎选择重要得多。
在哪里找到引擎的实际单词错误率
大多数发布单词错误率的公司会包括指向解释他们如何测量的论文或文档的链接。阅读方法论,而不是数字:如果他们在脚本英语和母语使用者上测量,而您正在用口音和医学笔记的会话方式进行语音输入,他们的基准和您的现实之间的差距可能是巨大的。