跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

视觉 - 骨架双模态框架用于帕金森病步态的泛化评估

该研究提出一种视觉 - 骨架双模态深度学习框架,用于帕金森病步态严重程度的泛化评估。方法结合关键点视觉 Transformer 提取局部细节与 ST-GCN 提取全局骨架特征,通过时间融合编码器整合信息。实验表明双模态融合优于单一模态,且在跨视角数据上具有显著泛化优势,为家庭环境下的无约束远程监测提供了可行方案。

信号故障发布于 2026/4/12更新于 2026/7/2446 浏览
视觉 - 骨架双模态框架用于帕金森病步态的泛化评估

视觉 - 骨架双模态框架:通过视频实现帕金森病步态的泛化评估

论文链接:https://doi.org/10.1016/j.media.2025.103727 代码链接:https://github.com/FJNU-LWP/PD-gait-VSDF

研究背景介绍

帕金森病评估与帕金森病评分量表(MDS-UPDRS)

步态评估在衡量帕金森病(PD)患者的病情严重程度中起着至关重要的作用。通过仔细观察和分析步态表现,医生可以深入了解帕金森病的进展,从而制定更精确的诊断和治疗方案。目前在临床实践中,被广泛接受的 PD 步态评估标准是基于 MDS-UPDRS(统一帕金森病评分量表)第三部分的内容。在评估过程中,患者必须遵守 MDS-UPDRS 中规定的测试协议,以准确捕捉其步态特征。这要求经过专业培训的评估人员仔细观察关键的步态指标,并对步态表现进行全面评估。然而,这种方法极其耗时,且需要大量的医疗资源。尽管评估人员具备专业培训和丰富经验,但主观性差异仍可能影响评分,引入了显著的主观性因素。因此,临床上迫切需要一种客观且精确的 PD 患者步态评估方法。近年来,许多研究探索了基于可穿戴传感器的各种自动化技术来量化 PD 患者的步态运动。然而,这些方法依赖于直接接触患者身体的传感器,不可避免地会影响 PD 患者的自然运动,这阻碍了它们在临床实践中的广泛采用。

帕金森病步态评估

随着计算机视觉技术的进步,基于视频的非接触式 PD 步态评估方法应运而生,克服了基于传感器方法的局限性。视频技术为 PD 评估提供了一种非接触、可扩展且无创的方法。近期的研究利用视频技术,辅以深度学习和人体姿态估计算法,来准确量化人体运动,证明了非接触式视频分析技术能够有效、快速地评估 PD 患者的步态。然而,目前大多数基于视频的方法仅仅依赖于在视频中通过人体姿态估计获取的骨架信息,而忽略了 PD 步态的视觉特征。而且,它们仅应用于单一录制视角的 PD 步态评估,展现出有限的泛化能力。此外,大多数现有的基于视频的方法依赖于光流或姿态估计等中层特征,这可能会在提取过程中丢弃原始 RGB 图像中的某些视觉信息。但是,直接使用视频中的全部 RGB 信息又会引入不必要的背景细节,并显著增加不必要的计算量。事实上,临床评估人员主要关注的是各个特定身体部位的状态。不仅如此,由于 PD 步态评估是一个综合的过程,除了局部视觉细节,如何有效地利用更宏观的骨架运动特征也值得进一步考量。


研究内容

总体方法流程

视觉 - 骨架双模态框架总体工作流程如下图所示。首先,通过人体姿态估计技术从步态视频中提取关键点的视觉信息和骨架信息。对于关键点视觉,模型将带有坐标信息的特征块输入到关键点视觉 Transformer(KVT)中以提取视觉特征。随后,模型将提取到的骨架运动特征与 KVT 提取的关键点视觉特征进行融合,并输入到时间融合编码器(Temporal Fusion Encoder)中,以进一步提取步态的时间动态特征。最后,最终的评估分数由一个多层感知器(MLP)头部输出。

文章配图

关键点视觉 Transformer (KVT)

为了捕捉局部身体部位在行走时的视觉细节,作者设计了一种全新的 Transformer 模型来提取人体关键点的视觉特征(如下图所示)。

文章配图

图像块嵌入 (Patches embedding)

模型并非将整张图片输入,而是围绕关键点提取短时间序列的帧序列图像块(如下图)。对于视频,获取关键点局部视频块后,使用 3D 卷积来提取反映短期变化的特征,从而生成关键点 Tokens (KT)。

文章配图

文章配图

文章配图

文章配图

位置与连接嵌入 (Positions and connections embedding)

考虑到关键点不仅具有绝对的坐标位置,关键点之间还存在物理结构上的连通性。该模型通过可学习的线性投影直接嵌入关键点坐标,并与拼接得到:

文章配图

文章配图

文章配图

随后,引入了基于关键点邻接矩阵的邻接嵌入(Adjacency Embedding, AE)来表示身体各部位之间的连接信息:

文章配图

文章配图

最后,将 AE 加入到特征中,并在序列头部添加一个 CLS Token:

文章配图

关键点自注意力 (Keypoints Self-Attention, KSA)

如下图所示,输入数据首先通过线性投影转换为 Queries (Q), Keys (K), Values (V):

文章配图

在 Transformer 的自注意力计算阶段,模型将上述的邻接嵌入(AE)融入其中,使得注意力权重的计算不仅基于特征相似度,还能充分考虑到人体关键点之间的物理连接性:

文章配图

文章配图

骨架特征提取 (Skeleton features extraction)

在获取了人类关键点的视觉特征后,模型采用经典的时空图卷积网络(ST-GCN)来提取 PD 步态的全局骨架特征。该部分将空间连接与时间维度相结合,能够从宏观角度提取人体行走的运动规律:

文章配图

时间融合编码器 (Temporal Fusion Encoder)

对于同一时间段内提取到的'局部关键点视觉特征'与'全局骨架运动特征',模型首先通过拼接(Concatenation)的方式进行特征融合。

文章配图

为了提取整个视频的全局时间动态特性,融合后的特征序列被输入到时间融合编码器中,该编码器还加入了时间嵌入(Temporal Embeddings, TE):

文章配图

最后,评估分数由 MLP 头部计算输出:

文章配图


实验结果

在作者的研究中,由于单独特征在不同评分等级上的表现存在差异,因此作者在实验部分首先进行了骨架运动与关键点视觉的消融实验。作者列举了所提框架中两个分支之间相互比较,该实验结果如下表:

文章配图

由该结果可以看出,在双模态方法中,关键点视觉在非 0 评分的量化中表现比骨架运动更好。这表明关键点视觉能够更好地捕捉步态中细微特征的变化。此外,还可以看出双模态特征融合能有效提升对视频中 PD 步态的整体评估准确性。

文章配图

此外,作者还比较了目前几种帕金森步态严重程度评估的方法。表明了本文提出的方法以视频方式在一个更多参与者的数据集中实现了更为准确的帕金森步态评估,并在更一般的录制条件下(Ours-2 跨视角)展现出了极其显著的泛化优势。


结论

该研究开创性地提出了一种用于评估 MDS-UPDRS 步态严重程度的视觉 - 骨架双模态深度学习框架。通过引入独特的关键点视觉 Transformer 以及时间融合编码器,该模型不仅有效弥补了传统骨架方法在微小视觉特征上的丢失,还显著提高了多类别评分的准确性。更重要的是,该模型在更一般化的跨视角监控数据上表现出了极高的鲁棒性,这为未来在家庭和社区环境中实现无约束的帕金森病远程监测与评估提供了极其可行的技术方案。

目录

  1. 研究背景介绍
  2. 帕金森病评估与帕金森病评分量表(MDS-UPDRS)
  3. 帕金森病步态评估
  4. 研究内容
  5. 总体方法流程
  6. 关键点视觉 Transformer (KVT)
  7. 图像块嵌入 (Patches embedding)
  8. 位置与连接嵌入 (Positions and connections embedding)
  9. 关键点自注意力 (Keypoints Self-Attention, KSA)
  10. 骨架特征提取 (Skeleton features extraction)
  11. 时间融合编码器 (Temporal Fusion Encoder)
  12. 实验结果
  13. 结论
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Windows 环境下编译 Torchvision C++ 版本指南
  • WebAssembly 技术全景解析:重塑 Web 与原生边界
  • 动态规划 01 背包问题详解与空间优化实战
  • TinyLlama 与 LiteLlama:轻量级模型实现高性能推理与应用
  • 基于 ASP.NET Core 和 Python 的 PDF 转 Word 工具开发与部署实践
  • 基于 YOLO12 的无人机航拍目标检测系统实战
  • Python 办公自动化:使用 Pandas 库操作 Excel
  • 机器人标准 DH(SDH)与改进 DH(MDH)
  • Python 一键拆分 PDF:按章节建文件夹并导出单页(支持书签与正文识别)
  • 我国网络安全人才市场现状与需求分析
  • GEO 多平台 AI 监控系统实战:支持 ChatGPT、豆包等
  • Linux 核心 IO 模型深析:非阻塞 IO 与多路转接实现
  • 使用 mstsc.js 在浏览器中实现远程桌面
  • Element UI Table 设置 max-height 后右侧滚动条空白占位处理
  • Python 调用高德地图 MCP 服务查询天气实战
  • Python 开发环境搭建与基础入门指南
  • Pencil.dev:AI 驱动设计画布与代码生成工具实战指南
  • Cursor Chat Browser:管理 AI 聊天历史的 Web 应用
  • Python 爬虫实战:爬取今日头条图文标题
  • LLM Agent 反思工作流进阶:Self-Refine、CRITIC 与 Reflexion 技术解析

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online