音声認識って何?
スマホに「明日の天気は?」と話しかけると、画面に文字が並びます。これが音声認識(ASR)です。やることは明快——空気中の音波を、検索や処理ができる文字の列に変えること。どうやって音を文字にするのか
まず細かく切る音声が入ると、数十ミリ秒単位の「小さな枠」に切り分けます。それぞれに周波数やエネルギーなどの音響特徴があります。
音響モデルが発音を推測
その枠から「この人はどんな音を発したか」をモデルが推測し、音素の列を出力します。
言語モデルが直す
音だけでは足りません。同音異義語が多いからです。言語モデルが文脈から「明日」か「来年」かを判断し、最も自然な文字を出します。
変わった場面
音声アシスタントSiriやAlexaが指示を理解できるのはASRのおかげ。
自動字幕
動画・会議・配信の字幕は、多くがリアルタイムで作られます。
書き起こし
取材や会議の議事録を、手で再生して打つ必要がなくなります。
アクセシビリティ
耳の不自由な人が「話を目で読む」助けになります。
残る課題
方言、雑音、複数人が同時に話す場面、専門用語——これらは誤認識のもとです。それでもデータと計算力の向上で、認識精度は普通の人のレベルに近づき、超える場面も出てきました。まとめ:音声認識とは、機械が「話し声」を「読める文字」に変える技術です。
コメント