本文へ移動

おんせいごうせい

音声合成

TTS = Text-to-Speech

テキスト情報から人工的に人間の声を生成する技術です。かつての規則的な合成からディープラーニングを用いた波形生成技術へと発展し、現在は人間と聞き分けられない自然な音声を生成します。

詳しい説明

音声合成とは、テキストなどの入力情報から、人間の声を人工的に生成する技術です。かつては録音された音声の断片をつなぎ合わせる手法が主流でしたが、現在は自然さが劇的に向上しています。

近年ではディープラーニングを用いた波形生成技術が発展し、人間と区別がつかないほどの高品質な音声合成が可能となりました。アクセントや感情の表現も、学習データに基づいて調整できます。

G検定では、生成AIの活用例として問われます。音声認識と対になる技術として整理し、どのような入力からどのような出力が得られるかを混同しないように注意してください。

試験で問われること

G検定

  • テキストから音声を生成する技術である点が定義です。
  • 音声認識(音声をテキストに変換)との違いが問われます。
  • 近年の高品質化には深層学習が大きく寄与している点がポイントです。