
本发明公开了基于关系建模的人体姿态估计方法,包括以下步骤:步骤一:给定一段包含N帧的视频,即RPSTN采用连续的T帧作为输入,给定由P生成的初始姿态,本发明相比于已有方法,本文提出的RPSTN对遮挡问题具有一定的鲁棒性,一方面JRE模块可以通过学习到的姿态结构信息,即关节点之间的关系,在空间上推理被遮挡关节点的位置,另一方面,JRPSP模块可以将未遮挡帧中的姿态信息传递到被遮挡帧中以帮助定位姿态,且避免了在生成关节点热图的过程中,已有方法都是单个关节点逐点定位,而忽略了关节点之间的联系,人体是一
(19)中华人民共和国国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 113807321 A (43)申请公布日 2021.12.17 (21)申请号 4.6 (22)申请日 2021.10.18 (71)申请人 北京邮电大学 地址 100089 北京市海淀区西土城路10号 (72)发明人 党永浩尹建芹张志成唐进 张少杰 (74)专利代理机构 北京市浩东律师事务所 11499 代理人 孙莉 (51)Int.Cl. G06K 9/00 (2006.01) G06K 9/62 (2006.01) G06N 3/04 (2006.01) G06N 3/08 (2006.01) 权利要求书3页 说明书7页 (54)发明名称 基于关系建模的人体姿态估计方法 (57)摘要 本发明公开了基于关系建模的人体姿态估 计方法,包括以下步骤:步骤一:给定一段包含N 帧的视频,即 RPSTN采 用连续的T帧作为输入,给定由P生成的初始姿 态,本发明相比于已有方法,本文提出的RPSTN对 遮挡问题具有一定的鲁棒性,一方面JRE模块可 以通过学习到的姿态结构信息,即关节点之间的 关系,在空间上推理被遮挡关节点的位置,另一 方面,JRPSP模块可以将未遮挡帧中的姿态信息 传递到被遮挡帧中以帮助定位姿态,且避免了在 生成关节点热图的过程中,已有方法都是单个关 节点逐点定位,而忽略了关节点之间的联系,人 A 体是一个有机的整体,在运动过程中各个关节点 1 2 是相互关联的,已有方法逐点定位的方式会破坏 3 7 0 人体的结构信息的问题。 8 3 1 1 N C CN 113807321 A 权利要求书 1/3页 1.基于关系建模的人体姿态估计方法,其特征在于:包括以下步骤: 步骤一:给定一段包含N帧的视频,即 RPSTN采用连续的T帧作为输入,给定由P生成的初始姿态,关节关系提取器(JRE)通过 对关节之间的关系建模联合地生成所有关节点热图,然后将包含位姿结构信息的关节热图 与位姿F生成的表观特征相结合,传递给关节关系引导的位姿语义传播器(JRPSP),从而获 取姿态的高级语义特征,这些高级语义特征从当前帧传递到下一帧,以指导模型估计下一 帧的姿态,考虑到视频的时间语义一致性,连续两帧之间的语义信息是相似的(即外观、场 景信息基本不变,只有动作姿态发生微小变化),因此,使用全局匹配机制在当前帧中搜索 与JRPSP提取的语义特征相似的区域; 步骤二:对于第一帧,使用预训练的姿态初始化器生成一系列热图表示的初始姿态,然 后JRE模块以P生成的初始热图作为输入,学习任意两个初始关节热图之间的关系,初始热 图由JRE模块进行微调,并通过批处理规范化层,将其转换为精确的热图,受JRE模块提取的 关系信息的鼓励,RPSTN可以联合生成所有关节的热图,而不开云体育控股科技有限公司是单独检测每个关节,整个过 程形式化如下: M′=BN(R(P(I))),t=1 t t 式中,M′,t=1表示第一帧中的关节点热图,BN(·)表示批归一化层,R(·),P(·)分别 t 代表JRE模块和姿态初始化器; 步骤三:历史姿态语义学习:由于视频的时间语义一致性,第t帧整个姿态的语义特征 可以指导模型定位第(t+1)帧中的关节点,因此,应该考虑历史帧中有效的姿态语义特征, 以帮助在后续框架中定位关节,姿态的语义特征不仅包括位姿的空间信息,还包括位姿的 外观特征,沿通道维度将特征图f 和关节热图M′合并,并且采用1×1×C的卷积(C表示通道 t t 的数量)来学习整体姿态的语义特征,即 其中, 是通过Conv 生成的第t帧的特征;Conv 表示1×1×C的卷积; 表示连接操 a a 作; 步骤四:姿态语义传递和全局匹配:考虑到视频的时序语义一致性,上一帧的位姿知识 可以在下一帧中重用,以帮助定位关节,为了对姿态的时间动态信息进行建模,采用全局匹 配机制在当前帧中搜索与前一帧语义相似的区域,对于全局匹配,以前一帧姿态的语义特 征为模板,以当前帧的特征为目标,然后将模板作为动态卷积核与目标进行卷积,模板会逐 帧更新以保持语义的一致性,为了定位(t+1)帧的人体关节点,RPSTN以第t帧JRPSP的输出 作为模板,在新特征图f 上搜索相似的区域; t+1 步骤五:当前帧的关系建模:JRE模块负责对框架中各关节之间的关系进行建模,JRE以 关节的初始热图为输入,通过学习关节之间的关系,联合地生成所有关节热图,然后利用批 处理归一化层获取节点的精确位置, 步骤六:损失函数:采用一般的均方误差损失来训练提出的模型,损失函数定义为: 2 2 CN 113807321 A 权利要求书 2/3页 式中,M′是模型输出的关节热图, 是由关节点真实坐标生成的二维高斯分布热图。 t 2.根据权利要求1所述的基于关系建模的人体姿态估计方法,其特征在于:所述步骤一 中,为了更好的建模关节点之间的关系并提取姿态特征,RPSTN采用姿态初始化器P来提取 首帧中的初始姿态,并采用预训练的特征提取器F来提取T帧的姿态表观特征。 3.根据权利要求1所述的基于关系建模的人体姿态估计方法,其特征在于:所述步骤二 中,JRE模块是为了对姿态的结构信息进行建模并对关节进行定位,提出的一个轻量级的关 节关系提取模块,JRE的输入M表示K个初始关节热图,大小为H×W,H和W分别为热图的 高度和宽度,应用一个标记为Conv 的1×1卷积层来聚合所有身体关节的特征, a G=Reshape(Trans(Conv (M))) g 经过Conv 后的每一个特征图表示所有关节点之间的关系。 a 4.根据权利要求3所述的基于关系建模的人体姿态估计方法,其特征在于:所述步骤二 中,经过上述方法可以得到关于关节关系的不同特征组合,在某种程度上,G的特征表示了 整个人体姿态的结构信息,因此,G中包含的特征可以看作是人体姿态的全局特征。 5.根据权利要求3所述的基于关系建模的人体姿态估计方法,其特征在于:所述JRE模 块中,两个向量之间的相关性可以用点积表示,为了建模任意两关节点间的关系,每一个2D 的特征图被展成向量的形式,M被展成大小为H×W×K的 被转置成 (大小为H× W×K), 中的每一行和 中的每一列都表示一个关节点,通过计算 与 的点积得 到相关矩阵,相关矩阵中的每个元素表示任意两个关节之间的关系,然后利用Softmax将相 关矩阵转换为相关权值W , r 其中W 是K×K大小的关系权重,W 中的每一个元素表示每个关节点的注意力, r r 表示关节点之间的关系矩阵。 6.根据权利要求3所述的基于关系建模的人体姿态估计方法,其特征在于:所述JRE模 块中,为了突出整个姿态中相关性高的重要关节,将关系权值W 应用于全局姿态特征G, r 姿态特征G中的重要区域在关节间关系的鼓励下被激活,也就是说,G中包含的结构信 息是由关系权值W 激活的,之后,根据不同的姿态结构信息,利用卷积Conv提取所有关节的 r o 全局姿态特征,利用W 和Conv 分别激活身体部位的局部结构信息和学习全局位姿结构信 r o 息,最后,利用残差连接将每个关节的原始信息引入到Conv 提取的全局位姿特征中,通过 o Conv 提取的特征包含了关节间的关系,因此,将原始关节信息与Conv 提取的特征相结合, o o 即可激活密切相关的关节,综上所述,JRE模块的表达式如下: Z=Conv (W ·Conv (M))+M。 o r g 7.根据权利要求1所述的基于关系建模的人体姿态估计方法,其特征在于:所述步骤二 中,后续帧的建模主要包括三个方面,分别为历史姿态语义学习、姿态语义传播和全局匹 配,当前帧的关系建模,此处采用第(t+1)帧来清晰地描述所提出的RPSTN的处理过程。 3 3 CN 113807321 A 权利要求书 3/3页 8.根据权利要求1所述的基于关系建模的人体姿态估计方法,其特征在于:所述步骤三 中,在经过Conv之后,所有关节点与其对应的表观特征融合,即网络学到了每个关节点是 a 什么样子,也就是说, 既包含姿态的表观信息,也包含关节点的位置信息及关节点之间 的关系,因此 可以看做是姿态的语义特征。 9.根据权利要求1所述的基于关系建模的人体姿态估计方法,其特征在于:所述步骤四 中,在实践中,JRPSP负责从第t帧提取整个姿态由关节点间关系引导的语义特征,并将这些 特征转移到第t+1帧,JRPSP将姿态语义特征 作为输入, 中的每一个特征图包含了 姿态的语义信息,因此,通过JRPSP提取到的特征可以看做是整个姿态的高级语义特征。 10.根据权利要求1所述的基于关系建模的人体姿态估计方法,其特征在于:所述步骤 四中,使用1×1×K卷积(其中K为关节数)聚合相邻两帧的位姿特征来粗略地定位关节,这 样,模型就可以大致定位当前框架中节点的位置, 其中, 表示第t+1帧的初始关节热图,Conv 和S(·)分别表示1×1×K的卷积和 d JRPSP模块, 表示卷积操作。 4 4 CN 113807321 A 说明书 1/7页 基于关系建模的人体姿态估计方法 技术领域 [0001] 本发明属于人体姿态估计技术领域,具体涉及基于关系建模的人体姿态估计方 法。 背景技术 [0002] 关系实际上就是关系模式在某一时刻的状态或内容。也就是说,关系模式是型,关 系是它的值。关系模式是静态的、稳定的,而关系是动态的、随时间不断变化的,因为关系操 作在不断地更新着数据库中的数据。但在实际当中,常常把关系模式和关系统称为关系,读 者可以从上下文中加以区别。 [0003] 姿态估计问题就是确定某一三维目标物体的方位指向问题。姿态估计在机器人视 觉、动作跟踪和单照相机定标等很多领域都有应用。在不同领域用于姿态估计的传感器是 不一样的。 [0004] 基于视频的人体姿态估计是计算机视觉领域一项重要又具有挑战性的任务。虽然 目前基于深度学习的人体姿态估计取得了很大进步,但大多数方法存在一个共同问题,即 在生成关节点热图的过程中,已有方法都是单个关节点逐点定位,而忽略了关节点之间的 联系,人体是一个有机的整体,在运动过程中各个关节点是相互关联的,已有方法逐点定位 的方式会破坏人体的结构信息。 发明内容 [0005] 本发明要解决的技术问题是克服现有的缺陷,提供基于关系建模的人体姿态估计 方法,以解决上述背景技术中提出的在生成关节点热图的过程中,已有方法都是单个关节 点逐点定位,而忽略了关节点之间的联系,人体是一个有机的整体,在运动过程中各个关节 点是相互关联的,已有方法逐点定位的方式会破坏人体的结构信息的问题。 [0006] 为实现上述目的,本发明提供如下技术方案:基于关系建模的人体姿态估计方法, 包括以下步骤: [0007] 步骤一:给定一段包含N帧的视频,即 [0008] [0009] RPSTN采用连续的T帧作为输入,给定由P生成的初始姿态,关节关系提取器(JRE) 通过对关节之间的关系建模联合地生成所有关节点热图,然后将包含位姿结构信息的关节 热图与位姿F生成的表观特征相结合,传递给关节关系引导的位姿语义传播器(JRPSP),从 而获取姿态的高级语义特征,这些高级语义特征从当前帧传递到下一帧,以指导模型估计 下一帧的姿态,考虑到视频的时间语义一致性,连续两帧之间的语义信息是相似的(即外 观、场景信息基本不变,只有动作姿态发生微小变化),因此,使用全局匹配机制在当前帧中 搜索与JRPSP提取的语义特征相似的区域; [0010] 步骤二:对于第一帧,使用预训练的姿态初始化器生成一系列热图表示的初始姿 态,然后JRE模块以P生成的初始热图作为输入,学习任意两个初始关节热图之间的关系,初 5 5 CN 113807321 A 说明书 2/7页 始热图由JRE模块进行微调,并通过批处理规范化层,将其转换为精确的热图,受JRE模块提 取的关系信息的鼓励,RPSTN可以联合生成所有关节的热图,而不是单独检测每个关节,整 个过程形式化如下: [0011] M′=BN(R(P(I))),t=1 t t [0012] 式中,M′,t=1表示第一帧中的关节点热图,BN(·)表示批归一化层,R(·),P t (·)分别代表JRE模块和姿态初始化器; [0013] 步骤三:历史姿态语义学习:由于视频的时间语义一致性,第t帧整个姿态的语义 特征可以指导模型定位第(t+1)帧中的关节点,因此,应该考虑历史帧中有效的姿态语义特 征,以帮助在后续框架中定位关节,姿态的语义特征不仅包括位姿的空间信息,还包括姿态 的外观特征,沿通道维度将特征图f和关节热图M′合并,并且采用1×1×C的卷积(C表示通 t t 道的数量)来学习整体姿态的语义特征,即 [0014] [0015] 其中, 是通过Conv 生成的第t帧的特征;Conv 表示1×1×C的卷积; 表示连 a a 接操作; [0016] 步骤四:姿态语义传递和全局匹配:考虑到视频的时序语义一致性,上一帧的姿态 知识可以在下一帧中重用,以帮助定位关节,为了对姿态的时间动态信息进行建模,采用全 局匹配机制在当前帧中搜索与前一帧语义相似的区域,对于全局匹配,以前一帧姿态的语 义特征为模板,以当前帧的特征为目标,然后将模板作为动态卷积核与目标进行卷积,模板 会逐帧更新以保持语义的一致性,为了定位(t+1)帧的人体关节点,RPSTN以第t帧JRPSP的 输出作为模板,在新特征图f 上搜索相似的区域; t+1 [0017] 步骤五:当前帧的关系建模:JRE模块负责对框架中各关节之间的关系进行建模, JRE以关节的初始热图为输入,通过学习关节之间的关系,联合地生成所有关节热图,然后 利用批处理归一化层获取节点的精确位置, [0018] [0019] 步骤六:损失函数:采用一般的均方误差损失来训练提出的模型,损失函数定义 为: [0020] [0021] 式中,M′是模型输出的关节热图, 是由关节点真实坐标生成的二维高斯分布 t 热图。 [0022] 优选的,所述步骤一中,为了更好的建模关节点之间的关系并提取姿态特征, RPSTN采用姿态初始化器P来提取首帧中的初始姿态,并采用预训练的特征提取器F来提取T 帧的姿态表观特征。 [0023] 优选的,所述步骤二中,JRE模块是为了对姿态的结构信息进行建模并对关节进行 定位,提出的一个轻量级的关节关系提取模块,JRE的输入M表示K个初始关节热图,大小为 H×W,H和W分别为热图的高度和宽度,应用一个标记为Conv 的1×1卷积层来聚合所有 a 身体关节的特征, 6 6 CN 113807321 A 说明书 3/7页 [0024] G=Reshape(Trans(Conv (M))) g [0025] 经过Conv 厚的每一个特征图表示所有关节点之间的关系。 a [0026] 优选的,所述步骤二中,经过上述方法可以得到关于关节关系的不同特征组合,在 某种程度上,G的特征表示了整个人体姿态的结构信息,因此,G中包含的特征可以看作是人 体姿态的全局特征。 [0027] 优选的,所述JRE模块中,两个向量之间的相关性可以用点积表示,为了建模任意 两关节点间的关系,每一个2D的特征图被展成向量的形式,M被展成大小为H×W×K的 被转置成 (大小为H×W×K), 中的每一行和 中的每一列都表示一个关 节点,通过计算 与 的点积得到相关矩阵,相关矩阵中的每个元素表示任意两个关节 之间的关系,然后利用Softmax将相关矩阵转换为相关权值W , r [0028] [0029] 其中W 是K×K大小的关系权重,W 中的每一个元素表示每个关节点的注意力, r r 表示关节点之间的关系矩阵。 [0030] 优选的,所述JRE模块中,为了突出整个姿态中相关性高的重要关节,将关系权值 W 应用于全局姿态特征G, r [0031] [0032] 姿态特征G中的重要区域在关节间关系的鼓励下被激活,也就是说,G中包含的结 构信息是由关系权值W 激活的,之后,根据不同的姿态结构信息,利用卷积Conv提取所有关 r o 节的全局姿态特征,利用W 和Conv分别激活身体部位的局部结构信息和学习全局位姿结构 r o 信息,最后,利用残差连接将每个关节的原始信息引入到Conv 提取的全局位姿特征中,通 o 过Conv 提取的特征包含了关节间的关系,因此,将原始关节信息与Conv 提取的特征相结 o o 合,即可激活密切相关的关节,综上所述,JRE模块的表达式如下: [0033] Z=Conv (W ·Conv (M))+M。 o r g [0034] 优选的,所述步骤二中,后续帧的建模主要包括三个方面,分别为历史姿态语义学 习、姿态语义传播和全局匹配,当前帧的关系建模,此处采用第(t+1)帧来清晰地描述所提 出的RPSTN的处理过程。 [0035] 优选的,所述步骤三中,在经过Conv 之后,所有关节点与其对应的表观特征融合, a 即网络学到了每个关节点是什么样子,也就是说, 既包含姿态的表观信息,也包含关节 点的位置信息及关节点之间的关系,因此 可以看做是姿态的语义特征。 [0036] 优选的,所述步骤四中,在实践中,JRPSP负责从第t帧提取整个姿态由关节点间关 系引导的语义特征,并将这些特征转移到第t+1帧,JRPSP将姿态语义特征 作为输入, 中的每一个特征图包含了姿态的语义信息,因此,通过JRPSP提取到的特征可以看做是 整个姿态的高级语义特征。 [0037] 优选的,所述步骤四中,使用1×1×K卷积(其中K为关节数)聚合相邻两帧的位姿 特征来粗略地定位关节,这样,模型就可以大致定位当前框架中节点的位置, 7 7 CN 113807321 A 说明书 4/7页 [0038] [0039] 其中, 表示第t+1帧的初始关节热图,Conv 和S(·)分别表示1×1×K的卷积 d 和JRPSP模块, 表示卷积操作。 [0040] 与现有技术相比,本发明提供了基于关系建模的人体姿态估计方法,具备以下有 益效果: [0041] 1、本发明相比于已有方法人体姿态估计算法,本文提出的RPSTN对遮挡问题具有一定的鲁棒性,一方 面JRE模块可以通过学习到的姿态结构信息,即关节点之间的关系,在空间上推理被遮挡关 节点的位置,另一方面,JRPSP模块可以将未遮挡帧中的姿态信息传递到被遮挡帧中以帮助 定位姿态,且避免了在生成关节点热图的过程中,已有方法都是单个关节点逐点定位,而忽 略了关节点之间的联系,人体是一个有机的整体,在运动过程中各个关节点是相互关联的, 已有方法逐点定位的方式会破坏人体的结构信息的问题; [0042] 2、本发明通过一个关节点关系提取器(JRE)和一个关节点关系引导的姿态语义传 播器(JRPSP),所提出的RPSTN利用空间上的关系建模和时间上的知识重用来联合地定位关 节,提高了基于视频的人体姿势估计模型的性能,此外,在遮挡的情况下,这两个模块可以 利用可见关节的信息来推断遮挡的关节; [0043] 3、本发明通过设置的JRE模块,提出的JRE模块可以通过建模任意两关节点间的关 系,联合地生成所有关节点热图,从而能够建模人体姿态的结构特征,并且JRE模块可以根 据姿态的结构信息推理出被遮挡关节的位置,从而提高模型对遮挡问题的鲁棒性; [0044] 4、本发明通过采用JRE模块,JRE模块采用初始化热图作为输入,并通过计算任意 两初始关节点热图的相似性来建模任意两关节点的关系,通过这样的方式,姿态的结构性 被保留下来并用于联合地定位所有关节点,与传统人体姿态估计方法不同,可以通过建模 任意两关节点的空间关系联合地生成所有关节点热图; [0045] 5、本发明通过提出的RPSTN重复利用了历史姿态的语义特征来建模视频的时序信 息,通过这种方式,视频的时序语义能一致性被有效地学习到。 具体实施方式 [0046] 下面将对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施 例仅仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通 技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范 围。 [0047] 本发明提供一种技术方案:基于关系建模的人体姿态估计方法,包括以下步骤: [0048] 步骤一:给定一段包含N帧的视频,即 [0049] [0050] RPSTN采用连续的T帧作为输入,给定由P生成的初始姿态,关节关系提取器(JRE) 通过对关节之间的关系建模联合地生成所有关节点热图,然后将包含位姿结构信息的关节 热图与位姿F生成的表观特征相结合,传递给关节关系引导的位姿语义传播器(JRPSP),从 而获取姿态的高级语义特征,这些高级语义特征从当前帧传递到下一帧,以指导模型估计 8 8 CN 113807321 A 说明书 5/7页 下一帧的姿态,考虑到视频的时间语义一致性,连续两帧之间的语义信息是相似的(即外 观、场景信息基本不变,只有动作姿态发生微小变化),因此,使用全局匹配机制在当前帧中 搜索与JRPSP提取的语义特征相似的区域; [0051] 步骤二:对于第一帧,使用预训练的姿态初始化器生成一系列热图表示的初始姿 态,然后JRE模块以P生成的初始热图作为输入,学习任意两个初始关节热图之间的关系,初 始热图由JRE模块进行微调,并通过批处理规范化层,将其转换为精确的热图,受JRE模块提 取的关系信息的鼓励,RPSTN可以联合生成所有关节的热图,而不是单独检测每个关节,整 个过程形式化如下: [0052] M′=BN(R(P(I))),t=1 t t [0053] 式中,M′,t=1表示第一帧中的关节点热图,BN(·)表示批归一化层,R(·),P t (·)分别代表JRE模块和姿态初始化器; [0054] 步骤三:历史姿态语义学习:由于视频的时间语义一致性,第t帧整个姿态的语义 特征可以指导模型定位第(t+1)帧中的关节点,因此,应该考虑历史帧中有效的姿态语义特 征,以帮助在后续框架中定位关节,姿态的语义特征不仅包括位姿的空间信息,还包括位姿 的外观特征,沿通道维度将特征图f和关节热图M′合并,并且采用1×1×C的卷积(C表示通 t t 道的数量)来学习整体姿态的语义特征,即 [0055] [0056] 其中, 是通过Conv 生成的第t帧的特征;Conv 表示1×1×C的卷积; 表示连 a a 接操作; [0057] 步骤四:姿态语义传递和全局匹配:考虑到视频的时序语义一致性,上一帧的位姿 知识可以在下一帧中重用,以帮助定位关节,为了对姿态的时间动态信息进行建模,采用全 局匹配机制在当前帧中搜索与前一帧语义相似的区域,对于全局匹配,以前一帧姿态的语 义特征为模板,以当前帧的特征为目标,然后将模板作为动态卷积核与目标进行卷积,模板 会逐帧更新以保持语义的一致性,为了定位(t+1)帧的人体关节点,RPSTN以第t帧JRPSP的 输出作为模板,在新特征图f 上搜索相似的区域; t+1 [0058] 步骤五:当前帧的关系建模:JRE模块负责对框架中各关节之间的关系进行建模, JRE以关节的初始热图为输入,通过学习关节之间的关系,联合地生成所有关节热图,然后 利用批处理归一化层获取节点的精确位置, [0059] [0060] 步骤六:损失函数:采用一般的均方误差损失来训练提出的模型,损失函数定义 为: [0061] [0062] 式中,M′是模型输出的关节热图, 是由关节点真实坐标生成的二维高斯分布 t 热图。 [0063] 本发明中,优选的,步骤一中,为了更好的建模关节点之间的关系并提取姿态特 征,RPSTN采用姿态初始化器P来提取首帧中的初始姿态,并采用预训练的特征提取器F来提 9 9 CN 113807321 A 说明书 6/7页 取T帧的姿态表观特征。 [0064] 本发明中,优选的,步骤二中,JRE模块是为了对姿态的结构信息进行建模并对关 节进行定位,提出的一个轻量级的关节关系提取模块,JRE的输入M表示K个初始关节热图, 大小为H×W,H和W分别为热图的高度和宽度,应用一个标记为Conv 的1×1卷积层来聚 a 合所有身体关节的特征, [0065] G=Reshape(Trans(Conv (M))) g [0066] 经过Conv 厚的每一个特征图表示所有关节点之间的关系。 a [0067] 本发明中,优选的,步骤二中,经过上述方法可以得到关于关节关系的不同特征组 合,在某种程度上,G的特征表示了整个人体姿态的结构信息,因此,G中包含的特征可以看 作是人体姿态的全局特征。 [0068] 本发明中,优选的,JRE模块中,两个向量之间的相关性可以用点积表示,为了建模 任意两关节点间的关系,每一个2D的特征图被展成向量的形式,M被展成大小为H×W×K 的 被转置成 (大小为H×W×K), 中的每一行和 中的每一列都表示一个 关节点,通过计算 与 的点积得到相关矩阵,相关矩阵中的每个元素表示任意两个关 节之间的关系,然后利用Softmax将相关矩阵转换为相关权值W , r [0069] [0070] 其中W 是K×K大小的关系权重,W 中的每一个元素表示每个关节点的注意力, r r 表示关节点之间的关系矩阵。 [0071] 本发明中,优选的,JRE模块中,为了突出整个姿态中相关性高的重要关节,将关系 权值W 应用于全局姿态特征G, r [0072] [0073] 姿态特征G中的重要区域在关节间关系的鼓励下被激活,也就是说,G中包含的结 构信息是由关系权值W 激活的,之后,根据不同的姿态结构信息,利用卷积Conv提取所有关 r o 节的全局姿态特征,利用W 和Conv分别激活身体部位的局部结构信息和学习全局位姿结构 r o 信息,最后,利用残差连接将每个关节的原始信息引入到Conv 提取的全局位姿特征中,通 o 过Conv 提取的特征包含了关节间的关系,因此,将原始关节信息与Conv 提取的特征相结 o o 合,即可激活密切相关的关节,综上所述,JRE模块的表达式如下: [0074] Z=Conv (W ·Conv (M))+M。 o r g [0075] 本发明中,优选的,步骤二中,后续帧的建模主要包括三个方面,分别为历史姿态 语义学习、姿态语义传播和全局匹配,当前帧的关系建模,此处采用第(t+1)帧来清晰地描 述所提出的RPSTN的处理过程。 [0076] 本发明中,优选的,步骤三中,在经过Conv 之后,所有关节点与其对应的表观特征 a 融合,即网络学到了每个关节点是什么样子,也就是说, 既包含姿态的表观信息,也包 含关节点的位置信息及关节点之间的关系,因此 可以看做是姿态的语义特征。 [0077] 本发明中,优选的,步骤四中,在实践中,JRPSP负责从第t帧提取整个姿态由关节 点间关系引导的语义特征,并将这些特征转移到第t+1帧,JRPSP将姿态语义特征 作为 10 10 CN 113807321 A 说明书 7/7页 输入, 中的每一个特征图包含了姿态的语义信息,因此,通过JRPSP提取到的特征可以 看做是整个姿态的高级语义特征。 [0078] 本发明中,优选的,步骤四中,使用1×1×K卷积(其中K为关节数)聚合相邻两帧的 位姿特征来粗略地定位关节,这样,模型就可以大致定位当前框架中节点的位置, [0079] [0080] 其中, 表示第t+1帧的初始关节热图,Conv 和S(·)分别表示1×1×K的卷积 d 和JRPSP模块, 表示卷积操作。 [0081] 尽管已经示出和描述了本发明的实施例,对于本领域的普通技术人员而言,可以 理解在不脱离本发明的原理和精神的情况下可以对这些实施例进行多种变化、修改、替换 和变型,本发明的范围由所附权利要求及其等同物限定。 11 11
2、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问加。
3、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
4、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
化学课件-2025版《回归教材•化学》课件11讲之.第二单元 空气和氧气(人教版).pdf
化学课件-2025版《回归教材•化学》课件11讲之.第五单元 化学反应的定量关系(人教版).pdf
欧盟包装和包装废弃物法规 (PPWR) (EU) 2024_1268 中文版(完整解读 + 包装回收目标).docx
原创力文档创建于2008年,本站为文档C2C交易模式,即用户上传的文档直接分享给其他用户(可下载、阅读),本站只是中间服务平台,本站所有文档下载所得的收益归上传人所有。原创力文档是网络服务平台方,若您的权利被侵害,请发链接和相关诉求至 电线) ,上传者