拡散モデルって何?
AIに文章を入れると、数秒で画像が出てくるのを見たことがあるでしょう。その裏でよく動いているのが拡散モデルです。考え方は少し逆説的で、「直接描く」のではなく「まず汚して、少しずつきれいにする」やり方です。どう動くのか
順方向:ノイズを足す学習時、本物の写真にランダムなノイズを少しずつ足し、最後は完全な「砂嵐」にします。
逆方向:ノイズを取る
次に、逆の方向をモデルに学ばせます。その砂嵐から少しずつノイズを取り除き、はっきりした写真に戻す——モデルが学ぶのは「拭き取り方」です。
生成:ノイズから始める
ノイズ除去を覚えたら、真っ白なノイズを渡せば、そこから「拭いて」新しい画像を作れます。文章の指示を添えれば、その方向へ拭いていきます。
なぜここまで流行るのか
高品質初期の生成モデルに比べ、ディテールが豊かで安定し、崩れにくい。
制御しやすい
文章、参照画像、部分修正のどれでも導ける——指した方へ進みます。
オープンな生態系
Stable Diffusionのようなモデルが公開され、膨大なプラグインと遊び方が生まれました。
限界は?
1枚の画像に何度も反復するため、他の方式より遅く、計算も重い。また、ネットの膨大な画像から学ぶため、著作権や偏りの問題も議論が続いています。まとめ:拡散モデルとは、ノイズの塊から一歩ずつ画像を「拭き出す」技術です。
コメント