2024 年 AI 视频生成项目盘点
由人工智能(AI)大模型驱动的视频生成,正在引发影视行业的关注。抛去被机器替代的危机感,AI 视频生成也有令人可喜的一面:不仅可以作为影视专业人士的得力助手,还可以降低非专业人士的日常视频创作门槛,慢则几分钟,快则几十秒,一帧帧栩栩如生的电影级画面便显现在我们眼前。
在 2024 年,「AI 视频生成」领域涌现出了众多优秀的研究成果,大大丰富了图像内容创作的生态。这些成果来自头部科技大厂、高校院所实验室和个人开发者,部分研究也已开源。以下专注于分享那些「研究类」AI 视频生成项目中的 12 个代表性成果。
1. Google DeepMind:利用运动轨迹控制视频生成
运动控制对于生成具有表现力和吸引力的视频内容至关重要;然而,现有的大多数视频生成模型主要依靠文本提示进行控制,难以捕捉动态动作和时间组合的细微差别。
为此,来自 Google DeepMind 的研究团队及其合作者训练了一种以时空稀疏或密集运动轨迹为条件的视频生成模型。与之前的运动调节工作不同的是,这种灵活的表示方法可以编码任意数量的轨迹、特定对象或全局场景运动以及时空稀疏运动;由于其灵活性,他们将这种调节方法称为运动提示(motion prompt)。虽然用户可以直接指定稀疏轨迹,但他们也展示了如何将高级用户请求转化为详细的半密集运动提示,他们将这一过程称为运动提示扩展。
他们通过各种应用展示了这一方法的多功能性,包括相机和物体运动控制、与图像'互动'、运动传输和图像编辑。
另外,这项研究还展示了一些涌现行为,如逼真的物理现象,这表明运动提示具有探测视频模型和与未来生成世界模型交互的潜力。
论文链接:https://arxiv.org/abs/2412.02700 项目地址:https://motion-prompting.github.io/
2. Adobe 团队推出空间感知视频生成器 Track4Gen
虽然基础视频生成器可以生成视觉丰富的视频,但在外观漂移问题上仍表现较差,例如物体会逐渐退化或在帧间发生不一致的变化,从而破坏视觉连贯性。来自 Adobe Research 的研究团队及其合作者认为,这是因为在特征级别的空间跟踪方面没有明确的监督。
在这项工作中,他们推出了一种空间感知视频生成器——Track4Gen,其将视频扩散损失与跨帧点跟踪相结合,提供了对扩散特征的增强空间监督。Track4Gen 通过对现有视频生成架构进行最小限度的修改,将视频生成和点跟踪任务合并到一个网络中。Track4Gen 以 Stable Video Diffusion 为骨干,证明了统一视频生成和点跟踪是可能的,而视频生成和点跟踪通常是作为单独的任务来处理的。
广泛的评估表明,Track4Gen 可以有效地减少外观漂移,从而生成时间上稳定、视觉上连贯的视频。
论文链接:https://arxiv.org/abs/2412.06016 项目地址:https://hyeonho99.github.io/track4gen/
3. 港科大推出 AniDoc:让动画创作更简单
2D 动画的制作遵循行业标准的工作流程,包括四个基本阶段:角色设计、关键帧动画、中间处理和上色。为降低上述流程中的人工成本,来自香港科技大学的研究团队及其合作者提出了 AniDoc。
AniDoc 以视频扩散模型为基础,是一款视频线条艺术着色工具,可根据参考角色规范自动将素描序列转换为彩色动画。这一模型利用对应匹配作为明确的指导,对参考角色和每一帧艺术线条之间的变化(如姿势)具有很强的鲁棒性。
此外,这一模型甚至可以自动完成中间处理过程,用户只需提供角色图像以及开始和结束草图,就能轻松制作出时间一致的动画。
论文链接:https://arxiv.org/abs/2412.14173 项目地址:https://yihao-meng.github.io/AniDoc_demo/
4. GameGen-X:交互式开放世界游戏视频生成
来自香港科技大学、中国科学技术大学和香港中文大学的研究团队推出了 GameGen-X,它是首个专为生成式和交互式控制开放世界游戏视频而设计的扩散 Transformer 模型。

