Sora是OpenAI推出的视频生成AI模型,核心功能是“文字转视频”。你输入一段文字描述,它就能生成对应的视频画面。初代Sora于2024年2月首次亮相,2025年9月30日(北京时间10月1日),OpenAI正式发布了Sora 2,官方将其定义为视频生成领域的“GPT-3.5时刻”。Sora基于扩散模型和Transformer架构,从类似静态噪声的画面开始,通过多步骤逐步去噪,最终生成清晰的视频。它不仅能理解用户提示词的字面意思,还能理解这些事物在物理世界中的存在方式和运动规律。 Sora
主要功能和亮点 Sora的核心功能涵盖多个方面。文本生成视频是最基础的能力,输入自然语言描述即可生成最长20秒(部分版本可达60秒)的1080p视频。图片生成视频允许用户上传一张图片作为起始帧,让静态画面动起来。视频编辑功能可以修改现有视频的内容和风格。视频延展支持将已有视频继续延长。 Sora 2引入了几个重大升级。同步音讯生成是其中之一——模型在生成视频的同时生成对白、音效和背景音乐,唇形与对话同步,无需后期单独配音。角色客串功能允许用户将特定角色插入视频中。角色一致性是另一个亮点——用户可以从一段短片创建可重用的角色ID,让同一个角色在多段视频中保持相同的面孔、声音和服装。Sora还支持故事板(Storyboard)功能,用户可以按时间轴逐帧设定画面内容,精准控制视频的叙事节奏。输出格式方面,一次生成可同时输出16:9横屏和9:16竖屏两种1080p素材,无需二次裁剪。部分最新版本甚至支持长达3分钟的4K 60帧视频生成。
评论