语音识别是什么?
你对手机说「明天天气怎么样」,屏幕上就跳出文字——这就是语音识别(ASR)。它的任务很直白:把空气中的声波,变成一行行可以检索、可以处理的文字。它是怎么把声音变文字的?
先切成小片声音进来后,系统会把它切成几十毫秒一帧的「小片段」,每个片段都有一堆声学特征,比如频率、能量。
声学模型「猜」发音
一个模型负责从这些片段里猜「这个人大概发了什么音」,输出一串音素。
语言模型「纠错」
光有音不够,同音字太多。语言模型会根据上下文判断:到底是「明天」还是「明年」,再输出最可能的文字。
它已经改变了哪些场景?
语音助手Siri、小爱同学能听懂你的指令,靠的就是它。
自动字幕
视频、会议、直播的字幕,很多都由 ASR 实时生成。
录音转写
采访、会议纪要,不用再手动回放逐字敲。
无障碍
帮听障人士「看见」别人说的话。
它还有什么挑战?
口音、方言、噪声、多人同时说话、专业术语——这些都会让识别出错。好在随着数据和算力的提升,识别率已经逼近甚至超过普通人的水平。一句话记住:语音识别,就是让机器把「你说的话」变成「能读的文字」。
评论