テキストから動画生成って何?
テキストから画像生成が「一文で一枚の絵」なら、テキストから動画生成は「一文で一本の映像」。「雪原を走る柴犬、枝の間から日が差し込む」と書けば、その説明に合った短い動画が生成されます。画像生成より難しい点は?
「時間」という次元が増える画像は1フレームだけ合っていれば良い。動画は全フレームでつながりが必要。動きは自然に、光は安定して、映像が破綻しないことが求められます。
物理が理にかなうこと
水の流れ、人の歩き方、髪の揺れ——現実と合わなければ一瞬で嘘に見えます。
計算コストが桁違い
数十フレームのつながった映像生成は、1枚の画像よりはるかに高くつきます。
仕組みは?
主流はやはり拡散モデル。文字を理解し、ノイズから連続フレームを、前後の一貫性を保ちながら生成します。物理の常識をAIに少し持たせる「世界モデル」の考え方を取り入れるモデルもあり、それで映像がより本物らしくなります。何を変えつつあるか
広告の短編、映画のコンセプト映像、教材アニメ、SNSのクリエイティブ動画——かつてはチームと予算が必要だったものが、今は一人と一文で始められます。テキストから動画生成は、「動画を作る」ハードルを「ひとこと投稿する」レベルまで下げつつあります。まとめ:テキストから動画生成は、テキストから画像生成に「時間」を加え、静止した絵を動かし、つながりのある映像にする技術です。
コメント