跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

Stable Diffusion 生成 AI 数字人视频教程

Stable Diffusion 结合 SadTalker 插件可实现数字人视频生成。流程包括语音合成、照片生成及视频合成。照片需真实且正面,推荐使用 realisticVisionV20 模型。SadTalker 支持在线安装或离线部署,配置时需调整姿势、分辨率及修脸选项。常见问题包括模型下载失败、依赖缺失及路径错误,可通过脚本或手动安装解决。

星河入梦发布于 2025/2/7更新于 2026/9/1171 浏览
Stable Diffusion 生成 AI 数字人视频教程

基本方法

准备一张照片和一段语音,合成照片和语音,同时让照片中的人物动起来,特别是头、眼睛和嘴。

语音合成

语音合成的方法很多,也比较成熟。可以选择自己方便的工具,直接录音也可以,只要能生成一个语音文件即可。

输入文字,选择播音员,填写验证码,点击转换按钮。

语音合成界面

生成速度较快,可以在左侧试听和下载。

语音试听下载

照片生成

此方法需要使用比较真实的照片,如果太二次元,视频人脸效果会比较差。可以使用真实照片,也可以使用 Stable Diffusion 生成,或使用图生图改造,尽量保持真实。

照片尽量正面,侧脸生成的视频可能出现头和身体拼接不佳的情况,证件照最佳。

演示生成一张真实照片。

(1)生成工具使用 Stable Diffusion WebUI,模型选择 realisticVisionV20,生成的图片看起来比较真实。

SD 生成设置

提示词:best quality, front photo of a young man, chinese, portrait,black t-shirt, short hair, (looking at viewer), Sense of technology, in an office, computers, screen, books, upper body,

反向提示词:easy_negative, (worst quality:2), (low quality:2), (normal quality:2), lowres, normal quality, skin spots, acnes, skin blemishes, age spot, (ugly:1.331), (duplicate:1.331), (morbid:1.21), (mutilated:1.21), (tranny:1.331), mutated hands, (poorly drawn hands:1.5), blurry, (bad anatomy:1.21), (bad proportions:1.331), extra limbs, (disfigured:1.331), (missing arms:1.331), (extra legs:1.331), (fused fingers:1.61051), (too many fingers:1.61051), (unclear eyes:1.331), lowers, bad hands, missing fingers, extra digit,bad hands, missing fingers, (((extra arms and legs))),

(2)采样器选择 DPM++ 2M SDE Karras,选择别的也没问题,只要生成一张人物照片即可。

采样步数根据采样器选择,这里是 40,建议 20-40,以实际出图效果为准。

尺寸选择竖版,放到手机里比较合适。

生成次数:建议先把提示词写好了,然后一次多生成几张,从中选择最好的,节省时间。

SD 参数设置

(3)选择一张看起来不错的图片,下载备用。

生成结果

视频合成

这是最关键的一步,使用 Stable Diffusion WebUI 中的 SadTalker 插件。

默认大家已安装好 Stable Diffusion WebUI,如果未安装,建议在云端服务器部署,方便不贵,选择 A5000 规格即可。安装教程网上较多,此处不再赘述。

关于 SadTalker 插件的安装方法介绍两种。

安装方法一

适合访问 Github 或外网顺畅的用户,因为需要自动下载很多东西。

在 SD WebUI 中通过扩展插件页面安装。

插件安装

该插件需要下载的文件很多,有的文件还比较大,请耐心等待。如果不确定是否出问题,可查看控制台输出内容是否有错误。

安装完成后,重启 Stable Diffusion,需整个重启,不要只重启 WebUI。

安装方法二

适合访问外网不太方便的用户,将插件需要的文件提前下载好上传到指定目录。

  • 主程序: 放到 stable-diffusion-webui/extensions/SadTalker

  • 视频模型: 放到 stable-diffusion-webui/extensions/SadTalker/checkpoints

  • 修脸模型: 放到 stable-diffusion-webui/extensions/SadTalker/gfpgan/weights 和 stable-diffusion-webui/models/GFPGAN

(1)首先把文件下载到本地或云环境,这里以 Linux 为例,放到 /root 目录中。

文件目录

(2)解压文件到 stable diffusion webui 的扩展目录,并拷贝几个文件到 SD 模型目录:

tar -xvf /root/SadTalker.tar -C /root/stable-diffusion-webui/extensions
cp -r /root/stable-diffusion-webui/extensions/SadTalker/gfpgan/weights/* /root/stable-diffusion-webui/models/GFPGAN/

看到下方的结果,就基本上差不多了。

扩展目录下有该文件夹:

扩展目录

SD models 目录下有这几个文件:

模型目录

部署完毕,记得重启。

使用方法

在 SD WebUI 的 Tab 菜单中找到 SadTalker,按以下顺序进行设置。

SadTalker 设置

  1. 上传人物照片。
  2. 上传语音文件。
  3. 选择视频人物的姿势:即人说话时头部的动作,可使用不同的数字尝试。
  4. 分辨率:512 的视频分辨率比 256 大。
  5. 图片处理方法:crop 是从图片截取头部做视频,resize 适合大头照或证件照,full 就是全身照做视频,extcorp 和 extfull 未做细致研究,可自行对比。
  6. Still Model:让头部不要动作太大,以致偏离身体,负面效果是头不怎么动了。
  7. GFPGAN:修脸,说话时嘴和眼的动作可能让脸有些变形,选上它让脸部好看一些。

最后点击'生成',根据硬件的运行速度和勾选设置,可能需要几分钟的时间,耐心等待。

生成的视频示例(视频太占地,截图展示):

视频示例

可能遇到的问题

(1) 启动的时候报错:SadTalker will not support download…

启动报错

这个错误表示模型下载不下来,需要手动下载。

这里有两个方法:

  • 执行下面的命令触发下载,注意 cd 之后的路径替换成你自己的 SadTalker 安装路径:
cd stable-diffusion-webui/extensions/SadTalker
chmod 755 scripts/download_models.sh
scripts/download_models.sh
  • 下载所有的模板,然后手工上传到相关目录,上面安装方法二中已经介绍过,可使用打包好的文件包。

(2) 合成视频时报错:No module named 'xxx'

模块报错

使用 pip install xxx 就可以了,注意如果使用了 python 虚拟环境,需要先激活它。

source /root/stable-diffusion-webui/venv/bin/activate
pip install librosa

(3) 合成视频时报错:No such file or directory: '/tmp/gradio/xxx',创建目录就可以了:

mkdir -p /tmp/gradio

(4) 如果提示找不到 ffmpeg,请先下载安装。


以上就是本文的主要内容,使用这种方法就可以制作自己的 AI 专属数字人,想要什么样的风格都可以,想做多少个都可以,有兴趣的快去试试吧。

目录

  1. 基本方法
  2. 语音合成
  3. 照片生成
  4. 视频合成
  5. 安装方法一
  6. 安装方法二
  7. 使用方法
  8. 可能遇到的问题

更多推荐文章

查看全部
  • 自然语言处理在医疗领域的应用与实战
  • Midjourney 使用指南
  • VMware 虚拟机安装 macOS 无法联网的解决方法
  • 黑词分析前端组件设计:双面板交互与进度监控
  • 个人从零预训练 1B LLM 实践与总结
  • 哈希表、Set 与 Map 基础算法总结
  • 环形链表检测、数组交集与随机链表复制
  • SRC 漏洞挖掘实战经验与技巧总结
  • uv 精准指定 Python 版本实战指南
  • RetinaFace+CurricularFace 人脸识别技术解析与快速部署
  • Navicat Premium 17 安装指南
  • 从 “吹爆” 到 “冷静”:AIGC + 低代码为何难破企业级开发的硬骨头?
  • 基于 Python 的跨境电商数据采集实战与代理 IP 应用
  • 使用 Trae IDE 结合 Figma MCP 将设计稿转化为前端代码
  • PentAGI Docker 环境部署指南
  • Planning with Files 插件:让 AI 代理拥有持久化工作记忆
  • Stable Diffusion 2 深度模型实战与 AI 立体画生成
  • 次模函数(Submodular Function)核心概念与机器学习应用
  • 基于 FastGPT 构建私有化 AI 知识库问答系统
  • Whisper 语音识别 GPU 加速实战指南

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online