跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

即梦数字人视频生成 API 集成实战

本项目基于火山引擎即梦 CV API,利用 Streamlit 构建了一个数字人视频生成工具。支持图片与音频上传、主体检测、Mask 裁剪及 Prompt 控制,能自动轮询任务状态并输出 MP4 视频。重点解决了本地文件需公网可访问的配置问题,提供 Cloudflared 等方案。适用于快速验证数字人能力、内部技术演示或作为二次开发的基础工程。

栈溢出发布于 2026/4/10更新于 2026/10/792 浏览

即梦数字人视频生成(Streamlit Demo)

这是一个基于火山引擎即梦(Jimeng)CV API 的数字人视频生成示例项目。

它支持通过'图片 + 音频'驱动数字人视频生成,集成了主体检测、Mask 选择、Prompt 控制、任务轮询与结果下载等功能。适合用于内部测试、技术验证或作为二次开发的基座。

核心功能

  • AK / SK 在线填写:支持在页面直接输入 Access Key / Secret Key,无需硬编码,方便多账号切换。Key 申请地址见官方文档。
  • 图片上传:支持 JPG/PNG,自动保存并生成可访问 URL。
  • 音频上传:支持 MP3/WAV,作为驱动音频。
  • 主体检测:调用目标检测接口,识别多个主体并返回 Mask。
  • Mask 处理:支持裁剪预览,可选择特定主体或使用原图模式。
  • Prompt 控制:文本控制表情、风格及稳定性。
  • 视频生成:提交任务后自动轮询状态,完成后在线播放并下载 MP4。

运行环境

  • Python >= 3.9(推荐 3.10)
  • Linux / macOS / Windows
  • 关键要求:需要一个可公网访问的静态文件服务来托管上传的图片与音频。火山引擎接口要求资源 URL 必须能被公网直接访问。

依赖安装

建议创建虚拟环境隔离依赖:

# Linux / macOS
python -m venv venv
source venv/bin/activate

# Windows
venv\Scripts\activate

安装所需库:

pip install streamlit requests pillow numpy

或者使用 requirements.txt:

streamlit>=1.30
requests>=2.28
Pillow>=9.5
numpy>=1.23

目录结构

.
├── app.py          # Streamlit 主程序
├── res/            # 生成的视频结果保存目录
├── requirements.txt # 依赖列表
└── README.md       # 说明文档

确保 res 目录存在:

mkdir -p res

静态文件服务配置(重要)

由于本地上传的文件需要生成公网 URL 供 API 调用,你需要启动一个 HTTP 服务暴露这些文件。

本地测试方案:

设置上传目录和公开基础 URL:

UPLOAD_DIR = "/home/yourname/data/uploads"
PUBLIC_BASE_URL = "http://你的 IP:8000"

启动服务:

cd /home/yourname/data/uploads
python -m http.server 8000

生产环境建议:

推荐使用 Nginx、Caddy 或 Cloudflared 隧道。以 Cloudflared 为例:

  1. 下载并安装 cloudflared。
  2. 启动本地 HTTP 服务。
  3. 新开终端运行隧道命令:
    cloudflared tunnel --url http://localhost:8000
    
    你将获得一个类似 https://random-name.trycloudflare.com 的临时域名,即可用于生成公网可访问的资源链接。

启动项目

streamlit run app.py

浏览器访问 http://localhost:8501 即可进入界面。

使用流程

  1. 打开页面,填入 Access Key / Secret Key。
  2. 上传人物图片与驱动音频。
  3. (可选)输入 Prompt 描述。
  4. 点击「开始检测」,系统会自动识别主体。
  5. 选择目标主体(或跳过 Mask 直接使用原图)。
  6. 等待生成完成,在线预览并下载视频。

注意事项

  • 建议使用清晰正脸的人物图像。
  • 音频时长建议控制在 60 秒以内。
  • 若接口报错,优先检查 AK/SK 有效性以及图片/音频 URL 是否可被公网访问。

扩展方向

  • Docker 一键部署
  • 环境变量管理密钥
  • 增加多任务队列与并发控制
  • 历史任务记录管理

参考资源

  • 项目源码:https://github.com/min-star/omnihuman-api.git
  • 官方文档:https://jimeng.jianying.com/ai-tool/generate?type=digitalHuman

目录

  1. 即梦数字人视频生成(Streamlit Demo)
  2. 核心功能
  3. 运行环境
  4. 依赖安装
  5. Linux / macOS
  6. Windows
  7. 目录结构
  8. 静态文件服务配置(重要)
  9. 启动项目
  10. 使用流程
  11. 注意事项
  12. 扩展方向
  13. 参考资源

更多推荐文章

查看全部
  • CCF-GESP 2025 年 12 月四级 C++ 真题:优先购买
  • Llama.cpp 跨平台部署本地大模型实战指南
  • 企业微信外部群机器人主动推送消息实现指南
  • Linux 文件 I/O 全景指南:从 open 到重定向详解
  • 路径类动态规划入门:最小路径和、迷雾森林与过河卒详解
  • 多模态 AI 如何让 LLM 看见并理解世界
  • 数据结构基础:顺序表与链表详解
  • 自然语言处理在客户服务领域的实战应用
  • 基于 OpenClaw 与优云智算的 AI 自动化创作及公众号发布流程
  • GPT-4o 发布引发热议,多模态能力与业界反应分析
  • 使用 Trae IDE 与 Figma MCP 实现设计稿转代码
  • C++ 图论最短路径算法详解
  • 企业级 AI Gateway 技术架构方案 | 极客日志
  • Python 驱动的 Web 与 App 端自动化测试实践
  • IntelliJ IDEA 快速搭建 Spring Boot 项目指南
  • CppSharp 完全指南:5 步实现 C++ 到.NET 的自动化绑定
  • 三年销售助理转行软件测试工程师的求职经历与心得
  • C++11右值引用与移动语义:从深拷贝到资源转移的实战理解
  • Z-Image-GGUF 开源模型:本地化 AI 绘画部署与使用指南
  • 自然语言处理在教育领域的实战应用

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online