一类把文字或图片生成视频的多模态模型。
跟点外卖备注“少辣多葱”差不多,你把画面要求写清,它就能端上一段会动的成片。
常用于广告、分镜预演和内容创作,但画面稳定度与真实感还得再验。
Multimodal AI它属于多模态生成,把文字或图片变成视频。
Deepfake视频生成能力越强,伪造真人画面的风险越高。
Diffusion很多视频生成模型沿用了扩散式生成路线。