本地设备语音识别是指将语音转换为文本的引擎直接在您的计算机或手机上运行,而不是将语音发送到远程服务器。语音保留在您的机器上,生成的文字也保留在您的机器上。没有上传,没有到达数据中心,无论网络是否连接,转录都能完全相同的方式工作。
与云端语音识别的区别
大多数企业和消费者语音转文本服务的工作原理是将语音上传到服务器,在那里进行转录,然后返回文本。本地设备语音识别完全反转了这一点:网络不参与转录过程本身,但本地设备工具可能会在网络上联系以进行更新、帐户检查或记录其功能。
核心权衡在于能力与位置之间:
- 本地设备仅处理一台机器,所以它离线工作,但通常仅限于该引擎内置的语言和功能。更新需要下载新模型。运行转录的机器必须有足够的能力来运行引擎。
- 云端可以立即更新,支持数百种语言,并应用最新改进,而无需用户做任何事情。权衡是将语音上传到第三方基础设施,并且每次转录都需要网络连接。
两者都不是普遍更好的;它们是不同的选择。
为什么引擎的物理位置很重要
本地设备语音识别是唯一提供语音本身绝对隐私的语音转文本方法——不是通过政策或加密的隐私,而是通过架构的隐私。语音从未被发送到任何地方。
这对以下情况很重要:
- 敏感对话。医疗、法律或财务讨论完全保留在一台机器上。
- 受限环境。无法访问互联网的机器,根据设计或政策——SCIF、飞机、锁定的公司笔记本。
- 监管限制。语音在法律上不能上传给第三方的行业或司法管辖区,即使是加密的。
对于一般使用,实际差异更简单:本地设备可以在没有互联网的情况下工作,云端则不能。
准确度问题
准确度——引擎转录单词的频率——常常被视为与本地设备或云端同义,但事实并非如此。云端引擎可以非常准确;本地设备引擎可以非常准确;本地设备引擎可以平庸,云端引擎也可以平庸。位置与转录工作情况无关。单词错误率是衡量准确度的一种方法,但它在基准条件下测量,这些条件通常与实际使用不同。
位置确实改变的是更新速度和支持的语言广度。云端服务可以瞬间更新所有人的引擎;本地设备引擎需要分发新模型权重,这速度较慢但不依赖于服务器继续运行。
语音输入的应用
本地设备语音识别今天最常见的地方是语音输入应用中。这同样适用于语音邮件转录、实时字幕和任何其他将语音转换为文本的应用。