开云体育官方网站-(Kaiyun Sports)

公司新闻
NEWS

新闻中心

基于主要次要特征的人体姿态估计方法与流程

浏览次数:

  

基于主要次要特征的人体姿态估计方法与流程(图1)

  1、人体姿态估计是动作识别、行人重识别和人机交互等计算机视觉任务的重要基础。然而,由于拍摄视角的变化、复杂的人体姿势以及来自拥挤场景或者人体自身的遮挡等因素,它仍然面临着许多挑战。遮挡问题对人体姿态估计的性能造成重大的影响,它通常通过影响深度特征的提取而混淆网络,使其产生错误的人体姿态估计结果。

  2、多人姿态估计的方法根据算法流程可以归纳为两类,即自顶向下和自底向上。自底向上的姿态估计算法先检测关键点再分组,大多数的方法侧重于关键点的识别和分组。最近的自底向上的一些工作通过人的中心点密集地回归人体姿势,这些方法存在人体中心遮挡问题以及长距离和密集回归的问题。自顶向下的方法先使用yolo、faster r-cnn等方法先检测人体边界框然后再进行姿态估计,现有的许多方法侧重设计更加精细的人体姿态估计网络。但是由于遮挡场景和拥挤场景的存在,自顶向下的算法在这些场景中会存在性能的下降。crowdpose关注到人员密集场景的问题,提出全局关联来处理拥挤场景,并且提出了一个大型拥挤姿态估计基准数据集。oasnet提出特征擦除和重建网络,先擦除目标无关的混淆特征再重建出被擦除的特征,并且使用孪生网络架构学习未被遮挡的特征。然而,由于孪生网络的存在,训练过程中需要训练多个网络。为了获取更精细的人体特征表示,kim等人提出一种局部和全局推理的特征提取方式,从两种更精确的定位遮挡下的人体关键点。zhang等人提出决策级信息融合,通过聚合不同视角的决策级信息,生成更加全面的估计结果。

  3、与卷积神经网络相比,图网络在处理人体姿势建模问题时有着天然的优势:它们能更有效地捕捉关节之间的依赖关系,因此一些工作使用图卷积网络来解决遮挡问题。opec-net使用图卷积神经网络从自上而下的模型中细化候选姿势。jin等人提出种自下而上的方法,使用可微分图卷积进行联合关联获得最终的姿势。rsgnet预测所有的关键点,然后对这些关键点进行关系建模,之后再引入骨架图知识推理目标人体姿态。pinet提出姿势级别的推断网络,从可见人体部位直接推断出多个粗略的姿势,再将这些姿势融合生成最终的姿态结果。总之,基于图卷积的方法能利用人体结构关系推理遮挡关键点,但是中间需要生成多个姿态估计的结果,才能获得最终的姿态。

  1、有鉴于此,本发明提出一种基于主要次要特征的人体姿态估计方法,该方法引入了一种主次特征划分机制,对于主要、次要特征引入了基于自注意力机制的特征增强模块,对次要特征进行动态激活从而获得完整的目标特征,能够提高人体姿态估计的准确率。

  4、步骤1,构建人体姿态估计模型;所述人体姿态估计模型包括特征提取主干网络、可调节空间注意力模块mam、基于自注意力机制的特征增强模块fem、上下文适应模块cam、预测层;所述特征提取主干网络为高分辨率网络hrnet;所述可调节空间注意力模块mam使用特征提取主干网络提取的高层特征学习空间权重图,自适应地学习划分主要特征和次要特征;特征增强模块fem基于自注意力机制,通过计算主要特征和次要特征之间的相关性,将置信度高的主要特征作为指导,对置信度低的特征进行增强,获取完整的人体姿态特征表示;所述上下文适应模块cam对来自特征提取主干网络的特征,使用多分支的并行空洞卷积来提取不同感受野的上下文信息;所述预测层通过卷积预测关键点热图;

  6、步骤201,使用在imagenet上预训练的模型对特征提取主干网络进行初始化,对可调节空间注意力模块mam、特征增强模块fem、上下文适应模块cam、预测层进行随机初始化;

  7、步骤202,在训练数据集中,将每个人体的标注框扩展到固定的长宽比,并从图像中裁剪出来,将裁剪后的区域图像调整为固定大小;

  8、步骤203,采用数据增强策略,使用缩放因子[0.65,1.35]、水平翻转、随机旋转 [−45◦,45◦]以及半身增强对每个人样本进行随机增强,旋转角度正数角度为顺时针,负数角度为逆时针;

  9、步骤204,设置初始学习率和最大训练迭代次数,使用adam优化器进行训练,得到训练好的人体姿态估计模型;

  10、步骤3人体姿态估计示意图,使用训练好的人体姿态估计模型进行人体姿态估计,得到人体关键点热图。

  11、进一步地,步骤1中,可调节空间注意力模块mam对于特征提取主干网络提取的高层特征,使用1×1卷积和sigmoid激活函数,学习特征权重图,将特征权重图中大于设定阈值的部分保留原值,小于阈值的部分设置为0,获得特征空间权重图,对应主要特征;最后,将上下文适应模块输出的特征与特征空间权重图进行点乘,获取主要特征和次要特征。

  12、进一步地,特征增强模块fem使用矩阵和分别对进行线性映射,获取键向量和值向量,并使用矩阵对进行线性映射,获取查询向量,,为三个1×1卷积层;

  13、将、、展开至维度,根据自注意力机制,通过矩阵乘法计算和之间的相开云体育官方入口关性,获取相关性权重图:

  15、其中,,是特征向量的维度,上标t表示矩阵转置;表示归一化激活函数,表示和的每个像素之间有多少信息相关,对于相关性权重图中的每一个权重,,反映了中每一个特征向量与中所有特征向量之间的相关性,这些相关性反映了特征像素与像素之间的依赖程度,权重越大,相关程度越高,反之越低;

  16、根据查找中的相关性较强的信息,进而填充中的信息,得到原特征与填充的特征的特征和:

  18、将特征和送入前馈模块进行计算,所述前馈模块由多层感知机和层归一化组成,前馈模块的输入特征和输出特征之间具有一个残差连接,以保留主要特征;得到的输出特征为:

  21、特征增强模块fem提取的特征输入给预测层,预测层输出预测的关键点热图,即模型的最终输出。

  22、进一步地,上下文适应模块cam由3路并行的空洞卷积和1路池化层组成,每一路空洞卷积的膨胀率不同,用于生成不同感受野的特征;对经过池化层的特征进行特征上采样,之后将3路空洞卷积和1路池化层的输出特征进行通道维度的聚合,并通过3×3卷积变换通道维度,获取上下文适应的特征。

  26、将固定大小的图像数据输入到训练好的人体姿态估计模型中,进行姿态估计,输出人体关键点的检测热图。

  28、1、本发明引入了一种主-次特征划分机制,通过可调节空间注意力模块(modulated attention module,mam)自适应地学习特征权重图,响应强烈的高得分区域和响应稀疏的低得分区域对应主要特征(primary feature)和次要特征(secondaryfeature)。对于主要、次要特征引入了基于自注意力机制的特征增强模块(featureenhanced module,fem),建立主要和次要特征之间的相关性,以此对次要特征进行动态激活,从而获得完整的目标特征,进而学习目标完整的特征表示。

  29、2、本发明引入了上下文适应模块(context adaption module,cam)并行地使用多种膨胀率的卷积来捕获多种感受野的上下文信息,进而适应人体结构和环境变化。

电话:

0557-8103355

邮箱:

56987742032@qq.com

地址:

安徽省宿州市砀山县周寨镇

Copyright © 2026 开云体育股份发展有限公司 版权所有    备案号:皖ICP备2025075536号