音声合成って何?
音声認識が音を文字にするなら、音声合成(TTS)はその逆。文字を渡すと、自然な声を返してくれます。スマホのナビ、オーディオブック、AIカスタマーサポートの声の多くは、このTTSが「話して」います。どうやって声を作るのか
昔のやり方:ブロックを組み合わせる初期のシステムは録音した音節や単語をブロックのように並べました。使えるけれどぎこちなく、どう聞いても機械的です。
今のやり方:端から端まで生成
今のニューラルネットワークは、つなぎ合わせずに文字から直接音の波形を作ります。モデルが文字を理解し、音の高さ・リズム・間を予測して、連続した音声を合成します。
「自然さ」はどう生まれる?
韻律(プロソディ)人は抑揚をつけて話します。良いTTSは句読点と意味から、どこで止まり、どこを強調するかを決めます。
音声クローン
録音を渡せば、その人の声を真似できます。これが「音声クローン」で、ディープフェイク音声の源でもあります。
感情表現
一本調子ではなく、喜び・驚き・真剣さを込めて読めるモデルが増えています。
使われる場面
音声コンテンツ記事や電子書籍をそのまま「読み上げ」ます。
アクセシビリティ
視覚障害のある人に画面の文字を音で届けます。
音声アシスタント
あなたに返す声は、TTSが作っています。
リスクは?
声のクローンで「誰かが話した」ことを偽るのが容易になり、詐欺にも使われています。そこで合成音声に「透かし」を入れたり、使う際に明示を求めたりするプラットフォームが増えています。まとめ:音声合成とは、機械を「字が読める」から「話せる」へ進化させる技術です。
コメント