语音合成是什么?
语音识别是把声音变文字,语音合成(TTS)正好反过来:给它一段文字,它吐出一段自然的人声。你手机里的导航播报、有声书、AI 客服,很多都是 TTS 在「开口」。它是怎么造出声音的?
老办法:拼积木早期系统把录好的音节、词语当「积木」拼起来。能用,但生硬,一听就是机器。
新办法:端到端生成
现在的神经网络直接从文字生成声波,不再拼接。模型先理解文字,再预测该用什么音调、节奏、停顿,最后合成连续的语音。
「自然」是怎么做到的?
韵律人在说话时会有抑扬顿挫。好的 TTS 能根据标点和语义,判断哪里该停顿、哪里该重读。
音色克隆
给一段录音,模型就能模仿这个人的声音——这是「语音克隆」技术,也是深伪(deepfake)声音的来源之一。
情绪表达
越来越多的模型能带着开心、惊讶、严肃的语气朗读,而不是一路平铺直叙。
它用在哪?
有声内容把文章、电子书直接「念」给你听。
无障碍
帮视障人士把屏幕文字读出来。
语音助手
助手回复你时用的声音,就是 TTS 生成的。
它有什么风险?
声音克隆让「伪造某人说话」变得容易,可能被用于诈骗。所以越来越多的平台在给合成语音打上「水印」,或要求使用时声明来源。一句话记住:语音合成,就是让机器从「识字」进阶到「会说话」。
评论