Hugging Face Blog·· 2023-05-08AI 评分42
Hugging Face 解读文本到视频模型:从 GAN 到扩散模型的发展与挑战
A Dive into Text-to-Video Models
AI 导读
Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则转向扩散模型。文章还分析了算力成本高、高质量数据集稀缺、视频描述模糊等核心挑战。
来源:Hugging Face Blog · huggingface.co