跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

基于 Stable Diffusion 从脑电信号重建高清视频研究

新加坡国立大学与香港中文大学合作推出 MinD-Video 项目,利用功能磁共振成像(fMRI)技术与 Stable Diffusion 模型,实现了从人类大脑活动中重建高清视频。该方法通过无监督学习与对比语言 - 图像预训练空间提取语义特征,并结合增强版 Stable Diffusion 进行微调,解决了 fMRI 时间分辨率低导致视频重建困难的问题。相比以往仅能重建静态图像的研究,该工作能在场景连续变化中呈现高质量连续帧,推动了人工智能与神经科学的交叉发展。

禅心发布于 2025/2/7更新于 2026/9/1166 浏览
基于 Stable Diffusion 从脑电信号重建高清视频研究

现在,AI 可以把人类脑中的信息,用高清视频展示出来了!

例如你坐在副驾所欣赏到的沿途美景信息,AI 分分钟给重建了出来:

MinD-Video 重建效果示例

看到过的水中的鱼儿、草原上的马儿,也不在话下:

MinD-Video 重建效果示例

MinD-Video 重建效果示例

这就是由新加坡国立大学和香港中文大学共同完成的最新研究,团队将项目取名为MinD-Video。

MinD-Video 项目示意图

这波操作,宛如科幻电影《超体》中 Lucy 读取反派大佬记忆一般:

MinD-Video 概念图

引得网友直呼:

推动人工智能和神经科学的前沿。

MinD-Video 评价

值得一提的是,大火的 Stable Diffusion 也在这次研究中立了不小的功劳。

MinD-Video 技术架构

怎么做到的?

从大脑活动中重建人类视觉任务,尤其是功能磁共振成像技术(fMRI)这种非侵入式方法,一直是受到学界较多的关注。

因为类似这样的研究,有利于理解我们的认知过程。

但以往的研究都主要聚焦在重建静态图像,而以高清视频形式来展现的工作还是较为有限。

MinD-Video 对比图

之所以会如此,是因为与重建一张静态图片不同,我们视觉所看到的场景、动作和物体的变化是连续、多样化的。

而 fMRI 这项技术的本质是测量血氧水平依赖(BOLD)信号,并且在每隔几秒钟的时间里捕捉大脑活动的快照。

相比之下,一个典型的视频每秒大约包含 30 帧画面,如果要用 fMRI 去重建一个 2 秒的视频,就需要呈现起码 60 帧。

因此,这项任务的难点就在于解码 fMRI 并以远高于 fMRI 时间分辨率的 FPS 恢复视频。

为了弥合图像和视频大脑解码之间差距,研究团队便提出了 MinD-Video 的方法。

整体来看,这个方法主要包含两大模块,它们分别做训练,然后再在一起做微调。

MinD-Video 双模块结构

这个模型从大脑信号中逐步学习,在第一个模块多个阶段的过程,可以获得对语义空间的更深入理解。

具体而言,便是先利用大规模无监督学习与 mask brain modeling(MBM)来学习一般的视觉 fMRI 特征。

然后,团队使用标注数据集的多模态提取语义相关特征,在对比语言 - 图像预训练(CLIP)空间中使用对比学习训练 fMRI 编码器。

在第二个模块中,团队通过与增强版 Stable Diffusion 模型的共同训练来微调学习到的特征,这个模型是专门为 fMRI 技术下的视频生成量身定制的。

如此方法之下,团队也与此前的诸多研究做了对比,可以明显地看到 MinD-Video 方法所生成的图片、视频质量要远优于其它方法。

MinD-Video 质量对比

而且在场景连续变化的过程中,也能够呈现高清、有意义的连续帧。

MinD-Video 连续帧

研究团队

这项研究的共同一作,其中一位是来自新加坡国立大学的博士生 Zijiao Chen,目前在该校的神经精神疾病多模式神经成像实验室(MNNDL_Lab)。

另一位一作则是来自香港中文大学的 Jiaxin Qing,就读专业是信息工程系。

除此之外,通讯作者是新加坡国立大学副教授 Juan Helen ZHOU。

据了解,这次的新研究是他们团队在此前一项名为 MinD-Vis 的功能磁共振成像图像重建工作的延伸。

MinD-Vis 已经被 CVPR 2023 所接收。

MinD-Vis 论文

目录

  1. 怎么做到的?
  2. 研究团队

更多推荐文章

查看全部
  • 前端团队协作最佳实践指南
  • Stable Diffusion 秋叶 ComfyUI 整合包部署指南
  • 七零后中年人转行 Python:职业转型经验与学习路径指南
  • Vue3 + Spring Boot 文件下载异常错误友好提示处理
  • Windows 安装 OpenClaw 并配置 Qwen 及 Ollama 本地模型接入飞书机器人
  • 借助 DeepSeek 与云算力快速搭建个人网页
  • Redis 核心通用命令详解与 C++ redis-plus-plus 实战
  • 浏览器远程桌面 Web RDP 完整实现指南
  • CTF 网络安全竞赛入门指南:方向、平台与工具详解
  • 基于FPGA的高速多通道数据采集系统搭建
  • 网络安全学习资源与常用安全论坛汇总
  • AI生成产品视频一键搞定!2026电商爆款视频秘籍
  • Java 方法封装与递归思想详解
  • 利用云端 AI 模型快速生成个人响应式网页
  • 2026 全球开源大模型 TOP10 榜单及主流模型深度解析
  • GitHub Copilot 学生认证指南及 Python 自动化实现
  • 颠覆级里程碑:Whisper Large-V3-Turbo重构语音交互技术范式
  • 基于 LLaMA-Factory 与 Stable Diffusion 的跨模态创作工作流
  • Java 核心面试指南:线程池、JVM 内存与垃圾回收详解
  • 2026 主流 AI 大模型全方位横评与选型指南

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online