开云体育官方网站-(Kaiyun Sports)

公司新闻
NEWS

新闻中心

基于Transformer的人体姿态估计算法研究

浏览次数:

  

基于Transformer的人体姿态估计算法研究(图1)

  近年来,基于深度学习的方法在解决2D人体姿态估计任务方面取得了卓越的进步。然而,目前的主流方法仍存在以下问题,(1)基于静态卷积神经网络的模型对于所有的输入图像均使用一组固定的参数滤波器,难以捕获输入数据中不同尺寸和动态变化的肢体特征。(2)基于Transformer的姿态估计方法均是将统一采样的Token序列作为输入。这样固定的特征采样方式难以表示非刚性的人体且存在着一定的特征冗余,这很大程度上限制了处理如肢体变形和外观模糊等问题。(3)基于Transformer的姿态估计方法具有巨大的参数量和计算复杂度,对于其在移动设备上的部署有很大的挑战性。

  为了解决上述问题,本文主要研究基于Transformer的2D人体姿态估计算法,其目标主要是从RGB(Red)Green(Blue)图片中分类和定位出人体关键点的空间位置。本文结合卷积神经网络,ConvolutionalNeuralNetworks(CNN)与Transformer的优势,充分利用卷积在局部特征提取方面的卓越性能,同时发挥Transformer在全局特征建模上的强大能力,以实现更为全面和精准的特征学习。本文的主要研究内容如下,

  (1)为了捕获输入数据中不同尺寸和动态变化的肢体特征,本文提出基于动态卷积的人体姿态关键点定位网络。将动态卷积结合到本文提出的动态关键点定位模块中,通过注意力机制不断调整卷积核的参数,以获取输入图像中特定关键点的局部上下文,有效地增强了关键点定位的准确性和鲁棒性。此外,本文引入人体骨架特征来编码人体重要的先验知识。这种向量化表示的骨架特征,不仅包含了肢体关节间的级联关系,还融入了方向信息,从而丰富了获取到的特定关键点的语义特征。

  (2)为了解决基于Transformer方法中固定的特征采样方式导致的特征冗余问题,本文进一步设计了基于稀疏Token化Transformer的姿态估计网络,KeypointFormer。通过采样基于关键点的特征块提取与关键点相关的Token序列作为Transformer的输入,在减少Token数量的同时捕获关键点之间的远距离依赖关系。在基于关键点的特征嵌入中,每个关键点都显式地嵌入为一个Token,以便在Transformer编码器中学习关键点之间的依赖关系人体姿态估计算法。

  (3)为了解决基于Transformer方法在移动设备上的部署问题,本文还设计了更加轻开云体育官网量化的版本,KeypointFormer-S。具体来说,在MSCOCO验证集上达到了72.9AP,参数为5.82M,计算量为5.88G,相比于KeypointFormer减少了370%的参数和44%的计算成本,具有一定的落地应用可能性。

电话:

0557-8103355

邮箱:

56987742032@qq.com

地址:

安徽省宿州市砀山县周寨镇

Copyright © 2026 开云体育股份发展有限公司 版权所有    备案号:皖ICP备2025075536号