跳到正文
原文
Hugging Face Blog·· 2023-05-08AI 评分42

Hugging Face 解读文本到视频模型:从 GAN 到扩散模型的发展与挑战

A Dive into Text-to-Video Models

AI 导读

Hugging Face 发文梳理文本到视频模型的发展脉络,指出该任务比文本到图像更难,需保证帧间时空一致性。早期模型基于 GAN 和 VAE,随后 Phenaki、Make-A-Video、NUWA、VideoGPT、CogVideo 等转向 Transformer 架构,当前主流则转向扩散模型。文章还分析了算力成本高、高质量数据集稀缺、视频描述模糊等核心挑战。

来源:Hugging Face Blog · huggingface.co