扩散模型是什么?
你大概见过 AI 画图:输入一句话,几秒后就出一张图。这背后最常见的引擎,就是扩散模型。它的思路有点反直觉——不是「直接画」,而是「先弄脏,再一点点擦干净」。它是怎么工作的?
正向:加噪训练时,拿一张真实的照片,一步步往上加随机噪点,直到它完全变成一团「雪花」。
反向:去噪
再训练模型反过来做:从这团「雪花」出发,一步步去掉噪点,还原出清晰的照片。模型学的,就是「怎么擦」。
生成:从噪声开始
等模型学会了去噪,给它一团纯噪声,它就能「擦」出一张全新的图。再配上文字提示,它就会朝你描述的方向去「擦」。
为什么它这么火?
质量高相比早期的生成模型,扩散模型出的图细节更丰富、更稳定,不容易崩。
可控
文字、参考图、局部修改都能引导它,指哪打哪。
开源生态
Stable Diffusion 这类模型开源后,催生了海量插件和玩法。
它有哪些局限?
生成一张图要反复迭代很多步,比别的模型慢、也更耗算力。此外,它学自海量网图,版权和偏见问题也一直有争议。一句话记住:扩散模型,就是从一团噪声里,一步步「擦」出一张图。
评论