AI 视频生成工具进化:从 Midjourney 到 Runway
核心概念与联系
故事引入:从'拍照片'到'拍电影'的烦恼
假设你是一个导演,想拍一部'小猫追蝴蝶'的动画:
- 第一步(拍照片):用 Midjourney 生成'小猫坐在草地上'的照片。AI 像魔法画家,按你的描述画出一张图。
- 第二步(拍视频):你需要让小猫动起来——从坐着→站起来→追蝴蝶。这时候问题来了:AI 生成的第二帧可能'小猫突然消失',第三帧'蝴蝶飞到火星',画面完全不连贯!
这就是 AI 生成视频的核心难点:从单张图(静态)到连续帧(动态)的跨越。Midjourney 能画好'照片',但要让照片'动起来',需要解决三个问题:
- 如何让每一帧'长得像前一帧'(帧间连贯)?
- 如何让物体'合理移动'(运动建模)?
- 如何让整个视频'讲一个故事'(时间维度叙事)?
核心概念解释
核心概念一:单帧生成(Midjourney 的拿手好戏)
单帧生成就像'AI 魔法画家',根据你的描述(提示词)画一张图。比如你说'一只戴红帽子的兔子在吃胡萝卜',AI 会先'理解'这句话(用语言模型编码),然后用扩散模型'逐步去噪'生成图像。
核心概念二:时间维度建模(视频生成的关键)
时间维度建模是让 AI'记住前一帧'。比如你要生成'兔子跳起来'的视频:第一帧是'兔子在地上',第二帧应该是'兔子半空中',第三帧是'兔子落地'。AI 需要知道'第二帧的兔子位置应该比第一帧高',这就像你玩'跳房子'游戏时,每一步的位置必须连贯。
核心概念三:运动向量估计(让物体'动得合理')
运动向量是 AI 给画面中每个物体'画轨迹'。比如蝴蝶从左飞到右,AI 需要计算'第一帧蝴蝶在(x1,y1),第二帧在(x2,y2),第三帧在(x3,y3)'。这就像你用尺子画直线,确保蝴蝶的位置变化是平滑的,而不是'闪现'。
核心概念之间的关系
三个概念就像'拍电影的三兄弟':
- 单帧生成(大哥):负责'画好每一帧的画面'。
- 时间维度建模(二哥):负责'记住前一帧的内容'。
- 运动向量估计(三弟):负责'规划物体的移动路径'。
三兄弟必须合作:大哥画好每一帧,二哥确保前后帧'长得像',三弟规划物体'动得合理',才能拍出流畅的视频。
核心算法原理 & 具体操作步骤
从图像到视频:技术跨越的底层逻辑
Midjourney 基于静态扩散模型(如 Stable Diffusion),只能生成单张图;而 Runway、SVD(Stable Video Diffusion)等工具则升级为视频扩散模型,核心差异在于'时间维度的引入'。
1. 静态扩散模型(Midjourney 的核心)
扩散模型的工作原理可以简化为'两步游戏':
- 前向扩散:给原图添加噪声,直到变成纯噪声。
- 逆向扩散:用 AI 模型从噪声中'擦除'噪声,逐步恢复原图。
数学上,前向扩散过程是逐步添加高斯噪声:
x_t = sqrt(alpha_t) * x_0 + sqrt(1-alpha_t) * epsilon, epsilon ~ N(0, I)
其中,x_0 是原图,x_t 是加噪 t 步后的图,alpha_t 是噪声比例参数。

