本文へ移動

おんせいにんしき

音声認識

ASR = Automatic Speech Recognition

話し言葉を解析してテキストに変換する技術です。音響モデルと言語モデルを組み合わせる手法から、現在は深層学習を用いたエンドツーエンドのモデルが主流となり、高い精度を実現しています。

詳しい説明

音声認識とは、入力された音声信号を解析し、テキストデータに変換する技術です。音響モデルと言語モデルを組み合わせる手法が伝統的ですが、現在はエンドツーエンドの学習が主流です。

ディープラーニングの導入により、周囲のノイズに強く、方言や早口に対しても高い精度で文字起こしができるようになりました。スマートフォンの音声アシスタントなど、身近なサービスに組み込まれています。

G検定では、AIの社会実装例として頻出します。音声合成との違いを意識し、どのような仕組みで人間と同じように音を聞き取っているのかを整理しておくと良いでしょう。

試験で問われること

G検定

  • 音声をテキストに変換する技術である点が定義です。
  • ディープラーニングの導入で精度が向上したことが重要です。
  • 音声合成とは逆のプロセスであることを明確にする必要があります。