単語エラー率は一般的に WER として書かれ、音声認識精度を測定する1つの方法です。トランスクリプト内で実際に言われた内容と一致しない単語のパーセンテージです。WER が 2% の場合は 100 語のうち 98 語が正しく書き起こされました。WER が 5% の場合は 100 語のうち 95 語です。低いほど良いです。
それが全部です。1つの特定のテストでのエラーの数。1つの特定の条件のセット下で実行されます。精度に関するマーケティング上の主張はほぼ常に WER を引用しており、WER はほぼ常に実際の使用状況とほぼ同じ条件下で測定されています。
単語エラー率が実際にどのように測定されるか
WER は、静かな部屋でアウトスピーカーによってアウトスピーカーされたテキストを記録し、音声テキスト変換エンジンで実行し、違う単語のパーセンテージをカウントすることによって計算されます。標準的なテストでは、プロフェッショナルな録音、プロフェッショナルマイク、事前に読み上げるために書かれたテキストを使用します。ほぼ常に、いくつかの標準的な英語品種の1つです。
これはなぜそれが有用であるかです。それは再現可能で、エンジン全体で比較可能です。別のエンジンが同じベンチマークで実行され、パーセンテージは、これらの正確な条件下での音声認識品質のリンゴ対リンゴの測定値です。本地設備音声認識とクラウドサービスの両方がこの方法で測定されています。
それはまた、それが実際には誤解を招く理由です。
公開された WER が測定しないもの
音声認識エンジンの実際のパフォーマンスの使用は、WER に含まれていない要因に依存しています。
- マイクロフォンの品質。ベンチマークは、プロフェッショナル記録機器を使用しています。ラップトップマイクまたはヘッドセットは、時には劇的に異なる結果を生成します。
- バックグラウンドノイズ。ベンチマークは通常、静かなスタジオで測定されます。実際の音声入力はキーボードがクリックしているオフィスで、車の中で、カフェで起こります。
- アクセントと音声の特性。ベンチマークは通常、限定された範囲の英語音声に基づいてトレーニングされています。通常は北米またはイギリスからです。異なるアクセントを持つ、またはモデルがトレーニングされていない言語を話す場合、公開されたベンチマークより高いエラー率が表示されます。
- 音声スタイル。ベンチマークは、公式な音声で読み上げたテキストを使用します。会話型の音声、意識の流れ、技術用語、迅速なペース都市、異なるエラー率が出ます。
- 使用する特定の単語。ファイナンス用語の認識に基づいてトレーニングされたエンジンは、医療専門用語では精度が低くなります。
WER が実際の使用状況でどのように複合するか
これはマーケティングが無視する部分です。エンジンが 2% のエラー率を持っている場合、それは 100 個の単語のうち 2 個が違うことを意味します。ただし、ほとんどの音声入力は 100 語の実行ではなく、文または段落で起こります。2% のエラー率を持つ 50 語の文は、大体 1 つのエラーを持つことになります。つまり、文レベルの精度は約 63% です。100 語の段落は平均 2 つのエラーを持つことになります。小さなパーセンテージはすぐに積み上がります。
精度が実際に重要な場合
精度はベンチマークでは実在し、測定可能です。実際に重要な場所は、マーケティングが示唆するより狭いです。
- 専門用語の多い作業。医療用語でトレーニングされたエンジンは、医療音声書き起こしの場合、一般的なエンジンより正確に処理します。
- 騒々しい環境。バックグラウンドノイズをフィルタリングするように設計されたエンジンは、ノイズがある場所でより効果的です。
- 珍しい言語。あなたの言語とアクセント用に特別にトレーニングされたエンジンは、異なる言語でトレーニングされたものより効果的です。
一般的な英語の音声入力では、2% WER と 3% WER の公開されたベンチマークの違いは非常に小さいため、マイクロフォンの品質と明確に音声を認識することが、エンジン選択よりもはるかに重要です。
エンジンの実際の WER を見つける場所
ほとんどの会社が WER を公開する場合、それらの測定方法を説明する論文またはドキュメントへのリンクが含まれています。数字ではなく、方法論を読んでください。スクリプト化された英語をネイティブスピーカーで測定した場合、あなたはアクセント付きの会話型医療メモを音声入力する場合、ベンチマークとあなたの現実の間のギャップはおそらく大きいです。