开云体育官方网站-(Kaiyun Sports)

公司新闻
NEWS

新闻中心

基于相机距离的人手三维姿态估计模型建立方法及其应用pdf

浏览次数:

  

基于相机距离的人手三维姿态估计模型建立方法及其应用pdf(图1)

  本发明公开了一种基于相机距离的人手三维姿态估计模型建立方法及其应用,属于计算机视觉领域,包括:建立待训练模型;模型中,2D卷积网络以包含人手图像的单目RGB图像为输入,用于估计各关节点二维坐标;第一生成网络用于根据2D卷积网络输出的估计结果估计人手各关节点在手势坐标系下的三维坐标;相机距离学习网络用于根据2D卷积网络和第一生成网络输出估计结果计算相机距离,并按照相机距离手势坐标系下的关节点三维坐标进行平移;第二生成网络用于根据平移后的关节点三维坐标估计相机坐标系下的关节点三维坐标,完成人手三维姿

  (19)国家知识产权局 (12)发明专利 (10)授权公告号 CN 113191243 B (45)授权公告日 2022.05.20 (21)申请号 8.8 G06V 10/774 (2022.01) G06V 20/64 (2022.01) (22)申请日 2021.04.25 G06K 9/62 (2022.01) (65)同一申请的已公布的文献号 G06N 3/04 (2006.01) 申请公布号 CN 113191243 A 审查员 唐银凤 (43)申请公布日 2021.07.30 (73)专利权人 华中科技大学 地址 430074 湖北省武汉市洪山区珞喻路 1037号 (72)发明人 桑农崔园李默然高常鑫 高源 (74)专利代理机构 华中科技大学专利中心 42201 专利代理师 夏倩李智 (51)Int.Cl. G06V 40/20 (2022.01) 权利要求书2页 说明书10页 附图6页 (54)发明名称 基于相机距离的人手三维姿态估计模型建 立方法及其应用 (57)摘要 本发明公开了一种基于相机距离的人手三 维姿态估计模型建立方法及其应用,属于计算机 视觉领域,包括:建立待训练模型;模型中,2D卷 积网络以包含人手图像的单目RGB图像为输入, 用于估计各关节点二维坐标;第一生成网络用于 根据2D卷积网络输出的估计结果估计人手各关 节点在手势坐标系下的三维坐标;相机距离学习 网络用于根据2D卷积网络和第一生成网络输出 估计结果计算相机距离,并按照相机距离手势坐 标系下的关节点三维坐标进行平移;第二生成网 络用于根据平移后的关节点三维坐标估计相机 B 坐标系下的关节点三维坐标,完成人手三维姿态 3 的估计;构建训练集并对待训练模型进行训练, 4 2 1 得到人手三维姿态估计模型。本发明能够提高人 9 1 3 手三维姿态估计的准确度。 1 1 N C CN 113191243 B 权利要求书 1/2 页 1.一种基于相机距离的人手三维姿态估计模型建立方法,其特征在于,包括: 建立包含2D卷积网络、第一生成网络、相机距离学习网络和第二生成网络的待训练模 型;所述2D卷积网络以包含人手图像的单目RGB图像为输入,用于估计人手各关节点的二维 坐标;所述第一生成网络以所述2D卷积网络输出的估计结果为输入,用于估计人手各关节 点在手势坐标系下的三维坐标;所述相机距离学习网络以所述2D卷积网络和所述第一生成 网络输出估计结果为输入,用于根据输入信息计算相机距离,并按照所述相机距离对所述 第一生成网络输出的各关节点在手势坐标系下的三维坐标进行三维平移;所述第二生成网 络以所述相机距离学习网络输出的平移后的三维坐标为输入,用于估计人手各关节点在相 机坐标系下的三维坐标,完成人手三维姿态的估计; 构建由包含人手的RGB图像构成的训练集;所述训练集中,每张单目RGB图像已标注了 标注人手各关节点的二维坐标和在相机坐标系下的三维坐标,且人手各关节点在手势坐标 系下的三维坐标已知;利用所述训练集对所述待训练模型进行训练,在训练结束后,得到所 述人手三维姿态估计模型。 2.如权利要求1所述的基于相机距离的人手三维姿态估计模型建立方法,其特征在于, 所述2D卷积网络为对沙漏模型进行修改后的模型; 所述修改包括:将各下采样部分中的池化模块替换为依次连接的核尺寸为3步长为2的 卷积层、BN层和ReLU激活函数层;将每一个阶段的分支部分替换为输入输出通道相同、卷积 核尺寸为3、步长为1的主干双卷积层堆叠的残差模块;将各上采样部分中的最近邻上采样 模块替换为核尺寸为2、步长为2的反卷积层。 3.如权利要求1所述的基于相机距离的人手三维姿态估计模型建立方法,其特征在于, 所述第一生成网络和/或所述第二生成网络为图卷积神经网络。 4.如权利要求1所述的基于相机距离的人手三维姿态估计模型建立方法,其特征在于, 所述2D卷积网络为沙漏模型。 5.如权利要求1~4任一项所述的基于相机距离的人手三维姿态估计模型建立方法,其 特征在于,对所述待训练模型进行训练,包括: 将所述2D卷积网络作为第一阶段模型,以所述训练集中的单目RGB图像为训练数据集 合,以所述训练集中人手各关节点的二维坐标为监督信息集合,对所述第一阶段模型进行 训练,得到训练好的第一阶段模型; 将所述第一生成网络、所述相机距离学习网络和所述第二生成网络连接而成的模型作 为第二阶段模型,以所述训练集中人手各关节点的二维坐标为训练数据集合,以所述训练 集中人手各关节点在手势坐标系下的三维坐标和在相机坐标系下的三维坐标为监督信息 集合,对所述第二阶段模型进行训练,得到训练好的第二阶段模型; 连接所述训练好的第一阶段模型和所述训练好的第二阶段模型,以所述训练集中的单 目RGB图像为训练数据集合,以所述训练集中人手各关节点的二维坐标、在手势坐标系下的 三维坐标和在相机坐标系下的三维坐标为监督信息集合,对连接所得的模型进行训练微 调。 6.如权利要求5所述的基于相机距离的人手三维姿态估计模型建立方法,其特征在于, 对所述第一阶段模型进行训练时,所采用的损失函数为: 2 2 CN 113191243 B 权利要求书 2/2 页 其中,P表示标注的人手各关节点的二维坐标, 表示所述第一阶段模型估计的人手各 关节点的二维坐标,   表示1范数; 1 对所述第二阶段模型进行训练时,所采用的损失函数为: 其中,Jrel表示人手各关节点在手势坐标系下的三维坐标; 表示所述第一生成网络 n 估计的人手各关节点在手势坐标系下的三维坐标;J 表示标注的人手各关节点在相机坐标 系下的三维坐标; 表示第二生成网络估计的人手各关节点在相机坐标系下的三维坐标;   表示2范数; 2 对连接所得的模型进行训练微调时,所采用的损失函数为: L=λ L +λ L ; 2D 2D 3D 3D 其中,λ 和λ 表示权重系数。 2D 3D 7.如权利要求1~4任一项所述的基于相机距离的人手三维姿态估计模型建立方法,其 特征在于,所述构建由包含人手的RGB图像构成的训练集,包括: 对已标注人手各关节点的二维坐标和在相机坐标系下的三维坐标,且包含人手的单目 RGB图像进行预处理,得到所述训练集; 所述预处理包括: 将人手各关节点在相机坐标系下的三维坐标减去掌心关节点的坐标,得到人手各关节 点在手势坐标系下的三维坐标; 识别出单目RGB图像中的人手部分,以中指指根为中心点,分别计算可以包含手掌的最 小长和宽,并分别扩大为原来的η倍;按照扩大后的长和宽裁剪得到包含人手的单目RGB图 像; 将裁剪得到所有单目RGB图像缩放到同一尺寸下; 将人手各关节点在相机坐标系下的三维坐标进行尺度归一化; 其中,η1。 8.如权利要求7所述的基于相机距离的人手三维姿态估计模型建立方法,其特征在于, 所述预处理还包括:对裁剪并缩放后的单目RGB图像进行数据增强,和/或将左、右手变换为 同一手势。 9.一种人手三维姿态估计方法,其特征在于,包括:将包含人手的单目RGB图像输入至 由权利要求1‑8任一项所述的基于相机距离的人手三维姿态估计模型建立方法所建立的人 手三维姿态估计模型,得到所述单目RGB图像中人手各关节点在相机坐标系下的三维坐标, 完成人手三维姿态估计。 10.一种计算机可读存储介质,其特征在于,包括存储的计算机程序;所述计算机程序 被处理器执行时,控制所述计算机可读存储介质所在设备执行权利要求1‑8任一项所述的 基于相机距离的人手三维姿态估计模型建立方法,和/或权利要求9所述的人手三维姿态估 计方法。 3 3 CN 113191243 B 说明书 1/10 页 基于相机距离的人手三维姿态估计模型建立方法及其应用 技术领域 [0001] 本发明属于计算机视觉领域,更具体地,涉及一种基于相机距离的人手三维姿态 估计模型建立方法及其应用。 背景技术 [0002] 人手三维姿态估计,即根据包含人手的图像估计人手各关节点在相机坐标系下的 三维坐标,属于智能人机交互的一个分支,是当前计算机视觉中一个重要的研究热点。它在 当前社会各行各业有着广泛的应用,例如TCL,三星,康佳等公司在电视上开发人手交互用 手势替代遥控器操控电视;微软的Xobx游戏机可通过Kinect完成对手势的识别,控制游戏 人物角色;一些汽车厂商如宝马,奔驰,大众等也在汽车中加入车载手势交互功能,提高安 全系数;手机厂商如华为,小米等也加入了隔空手势操作的功能,同时手势在VR/AR的领域 也有很多应用。手势交互的应用前景广阔,准确的3D手势姿态估计可以帮助手势交互在越 来越多设备上应用。 [0003] 基于单目RGB图像的3D手势估计是人手在相机镜头中成像成2D图像的逆过程。由 于人手距离相机镜头的距离以及人手实际的尺寸大小很难在RGB图像上体现,故为使能从 RGB图像估计出人手3D姿态,研究者常将手势进行尺度归一化,将手归一化为相同的大小, 并将以相机镜头为原点的相机坐标系下的手转换为以手掌掌心为原点的手势坐标系的手, 不去考虑手势到相机镜头的相机距离。而根据相机的透视成像原理,物体在投影面上成像 有着近大远小的性质,当相同手势在相机镜头前的不同位置时,在投影面上的成像也是不 同的,如图1所示。而使用以掌心为原点的手势(人手三维姿态)作为监督的时候,该监督信 息因为缺失3D手势与2D手势之间的尺度和位置的信息联系,使得经过模型估计的手势准确 度不高,同时手势图像分辨率低,背景杂乱,手势的自遮挡以及和物体的遮挡,以及手的自 由度高,形状与尺度差异较大等问题也降低了基于掌心为原点的手势作为监督信息的方法 的手势估计性能。 [0004] 由此可见,基于单目RGB图像估计人手3D姿态存在准确度较低的问题。 发明内容 [0005] 针对现有技术的缺陷和改进需求,本发明提供了一种基于相机距离的人手三维姿 态估计模型建立方法及其应用,其目的在于,通过将3D人手关节点与2D关节点之间的尺度 关系与透视投影关系融入到模型中,提高人手三维姿态估计的准确度,从而有效解决现有 的人手三维姿态估计方法准确度低的技术问题。 [0006] 为实现上述目的,按照本发明的一个方面,提供了一种基于相机距离的人手三维 姿态估计模型建立方法,包括: [0007] 建立包含2D卷积网络、第一生成网络、相机距离学习网络和第二生成网络的待训 练模型;2D卷积网络以包含人手图像的单目RGB图像为输入,用于估计人手各关节点的二维 坐标;第一生成网络以2D卷积网络输出的估计结果为输入,用于估计人手各关节点在手势 4 4 CN 113191243 B 说明书 2/10 页 坐标系下的三维坐标;相机距离学习网络以2D卷积网络和第一生成网络输出估计结果为输 入,用于根据输入信息计算相机距离,并按照相机距离对第一生成网络输出的各关节点在 手势坐标系下的三维坐标进行三维平移;第二生成网络以相机距离学习网络输出的平移后 的三维坐标为输入,用于估计人手各关节点在相机坐标系下的三维坐标,完成人手三维姿 态的估计; [0008] 构建由包含人手的RGB图像构成的训练集;训练集中,每张单目RGB图像已标注了 标注人手各关节点的二维坐标和在相机坐标系下的三维坐标,且人手各关节点在手势坐标 系下的三维坐标已知;利用训练集对待训练模型进行训练,在训练结束后,得到人手三维姿 态估计模型。 [0009] 本发明所建立的人手三维姿态估计模型,在利用2D卷积网络和第一生成网络根据 单目RGB图像估计得到人手各关节点在手势坐标系下的三维坐标的基础上,进一步引入相 机距离学习网络和第二生成网络,由相机距离学习网络根据二维坐标和手势坐标系下的三 维坐标的估计值计算相机距离,并融入到第二生成网络的输入信息中,由此能够显式地为 模型提供3D人手关节点与2D人手关节点之间的透视投影关系,避免了3D人手关节点与2D人 手关节点间尺度和位置信息的缺失,能够有效提高人手三维姿态估计的准确度。 [0010] 在一些可选的实施例中,2D卷积网络为对沙漏模型进行修改后的模型; [0011] 修改包括:将各下采样部分中的池化模块替换为依次连接的核尺寸为3步长为2的 卷积层、BN层和ReLU激活函数层;将每一个阶段的分支部分替换为输入输出通道相同、卷积 核尺寸为3、步长为1的主干双卷积层堆叠的残差模块;将各上采样部分中的最近邻上采样 模块替换为核尺寸为2、步长为2的反卷积层。 [0012] 传统的沙漏模型中,下采用使用pooling池化操作,上采样使用的是最近邻上采 样,这些操作会导致细节信息的丢失,而且传统的沙漏模型对分支模块没有进行任何操作, 不能充分利用多尺度信息,本发明在传统沙漏模型的基础上,对其中的上采样部分、下采样 部分和分支部分进行上述修改,能够有效避免在下采样和上采样过程中丢失细节信息,并 且能够充分利用多尺度信息,从而进一步提高估计准确度。 [0013] 在一些可选的实施例中,第一生成网络和/或第二生成网络为图卷积神经网络。 [0014] 图卷积神经网络除了可以输入2D/3D坐标信息,还可以输入邻接矩阵,在人手三维 姿态估计中,人手的拓扑结构,及各关节点的相邻关系是固定不变的,本发明以图卷积神经 网络作为第一生成网络和第二生成网络,网络参数较少,且使得模型可以通过输入的邻接 矩阵获得人手关节点的相邻关系,在模型的训练过程中,能够充分利用人手关节点与关节 点之间的生理骨架结构的约束关系,只做相邻关节点的信息交换,避免了无关信息的干扰, 同时隐式地强调了人手的拓扑结构,能够有效提高估计结果。 [0015] 在一些可选的实施例中,2D卷积网络为沙漏模型。 [0016] 沙漏模型(Hourglass)通过网络的编码‑解码,对图像先进行下采样而后进行上采 样的方式,能够将各个尺度的信息结合利用起来,最终输出与输入图尺度相同的图像,本发 明使用沙漏模型作为2D卷积网络,根据输入的单目RGB图像估计人手各关节点的二维坐标, 能够有效融合多个尺度信息,具有较高的估计准确度。 [0017] 进一步地,对待训练模型进行训练,包括: [0018] 将2D卷积网络作为第一阶段模型,以训练集中的单目RGB图像为训练数据集合,以 5 5 CN 113191243 B 说明书 3/10 页 训练集中人手各关节点的二维坐标为监督信息集合,对第一阶段模型进行训练,得到训练 好的第一阶段模型; [0019] 将第一生成网络、相机距离学习网络和第二生成网络连接而成的模型作为第二阶 段模型,以训练集中人手各关节点的二维坐标为训练数据集合,以训练集中人手各关节点 在手势坐标系下的三维坐标和在相机坐标系下的三维坐标为监督信息集合,对第二阶段模 型进行训练,得到训练好的第二阶段模型; [0020] 连接训练好的第一阶段模型和训练好的第二阶段模型,以训练集中的单目RGB图 像为训练数据集合,以训练集中人手各关节点的二维坐标、在手势坐标系下三维坐标和在 相机坐标系下的三维坐标为监督信息集合,对连接所得的模型进行训练微调。 [0021] 本发明将整体模型划分为两个阶段,第一阶段模型完成从单目RGB图像到二维坐 标的估计,第二阶段模型完成从二维坐标到三维坐标的估计以及修正,对两个阶段的模型 先单独进行训练,然后将训练好的两个阶段模型连接为整体模型,进行端到端的训练,对整 体模型参数进行训练,此时第二阶段模型的输入为第一阶段输出的二维坐标,由此能够在 保证模型训练效果的基础上,简化模型训练过程中的参数调整,提高模型的训练效率。 [0022] 进一步地,对第一阶段模型进行训练时,所采用的损失函数为: [0023] [0024] 其中,P表示标注的人手各关节点的二维坐标, 表示第一阶段模型估计的人手各 关节点的二维坐标,   表示1范数; 1 [0025] 对第二阶段模型进行训练时,所采用的损失函数为: [0026] [0027] 其中,Jrel表示人手各关节点在手势坐标系下的三维坐标; 表示第一生成网络 n 估计的人手各关节点在手势坐标系下的三维坐标;J 表示标注的人手各关节点在相机坐标 系下的三维坐标; 表示第二生成网络估计的人手各关节点在相机坐标系下的三维坐标;   表示2范数; 2 [0028] 对连接所得的模型进行训练微调时,所采用的损失函数为: [0029] L=λ L +λ L ; 2D 2D 3D 3D [0030] 其中,λ 和λ 表示权重系数。 2D 3D [0031] 进一步地,构建由包含人手的RGB图像构成的训练集,包括: [0032] 对已标注人手各关节点的二维坐标和在相机坐标系下的三维坐标,且包含人手的 单目RGB图像进行预处理,得到训练集; [0033] 预处理包括: [0034] 将人手各关节点在相机坐标系下的三维坐标减去掌心关节点的坐标,得到人手各 关节点在手势坐标系下的三维坐标; [0035] 识别出单目RGB图像中的人手部分,以中指指根为中心点,分别计算可以包含手掌 的最小长和宽,并分别扩大为原来的η倍;按照扩大后的长和宽裁剪得到包含人手的单目 RGB图像; 6 6 CN 113191243 B 说明书 4/10 页 [0036] 将裁剪得到所有单目RGB图像缩放到同一尺寸下; [0037] 将人手各关节点在相机坐标系下的三维坐标进行尺度归一化; [0038] 其中,η1。 [0039] 一般情况下,单目相机所拍摄的单目RGB图像除了包含人手部分,还会包含其他的 人体部分,本发明识别出单目RGB图像中的人手部分,依次进行裁剪和缩放,能够有效缓解 手势图像分辨率低、背景杂乱的问题,提高了所构建的训练集的质量;人手会因为年龄、性 别、体格等存在手的大小不一致的情况,但人手骨架中指骨(两个相邻指关节的距离)与整 体手势的大小是大约成比例的,本发明通过对关节点在相机坐标系下的三维坐标进行尺度 归一化,能够使不同手势的大小尺度相似,有利于提高模型的训练效果。 [0040] 进一步地,预处理还包括:对裁剪并缩放后的单目RGB图像进行数据增强,和/或将 左、右手变换为同一手势。 [0041] 本发明通过对裁剪和缩放得到的单目RGB图像进行数据增强,能够扩充训练样本 的数量,提高模型的训练效果;人手存在左手和右手的区别,利用同一个模型同时学习两种 手势,模型的性能会受到影响,本发明先将左、右手变换为同一手势,然后再对模型进行训 练,使得模型只需学习一种手势,能够有效提升模型的训练效果。 [0042] 按照本发明的另一个方面,提供了一种人手三维姿态估计方法,包括:将包含人手 的单目RGB图像输入至由本发明提供的基于相机距离的人手三维姿态估计模型建立方法所 建立的人手三维姿态估计模型,得到单目RGB图像中人手各关节点在相机坐标系下的三维 坐标,完成人手三维姿态估计。 [0043] 按照本发明的又一个方面,提供了一种计算机可读存储介质,包括存储的计算机 程序;计算机程序被处理器执行时,控制计算机可读存储介质所在设备执行本发明提供的 基于相机距离的人手三维姿态估计模型建立方法,和/或本发明提供的人手三维姿态估计 方法。 [0044] 总体而言,通过本发明所构思的以上技术方案,能够取得以下有益效果: [0045] (1)本发明在根据2D关节点坐标学习3D关节点坐标的阶段,引入相机距离作为输 入,显式提供3D手势与2D关节点之间的透视投影关系,明确3D手势与2D关节点的尺度(近大 远小)与位置(偏移)的变换关系,解决了不同的2D关节点输入,同样的3D手势监督对网络的 引导不明确的负影响,提升了手势关节点的估计准确度。 [0046] (2)本发明对传统的沙漏模型中的上采样部分、下采样部分和分支部分进行修开云体育控股科技有限公司改, 将修改后的沙漏模型作为估计关节点二维坐标的2D卷积网络,能够有效避免在下采样和上 采样过程中丢失细节信息,并且能够充分利用多尺度信息,从而进一步提高估计准确度。 [0047] (3)本发明中,第一生成网络和第二生成网络利用图卷积网络结构实现,在网络参 数量较小的条件下,能够充分利用人手关节点与关节点之间的生理骨架结构的约束关系, 有效提高估计准确度。 [0048] (4)本发明在根据估计阶段计算得到相机距离的情况下,利用第二生成网络通过 学习的方法估计人手各关节点在相机坐标系下的三维坐标,能够降低计算出来的相机距离 带来的误差的影响,进一步提高人手三维姿态估计的准确度。 [0049] (5)本发明在实际相机距离未知的情况下,可以通过模型自身估计的结果计算出 相机距离,使得估计过程不依赖于已知的相机距离参数,适用范围广泛;对于任意单目RGB 7 7 CN 113191243 B 说明书 5/10 页 摄像头拍摄的包含人手的RGB图像,本发明均可实现人手三维姿态估计,单 目RGB摄像头在 生活中使用广泛,数据获得较为低廉,本发明获得的更准确的3D手势估计性能,可以很好的 和实际设备结合。 附图说明 [0050] 图1为现有的相同手势在相机镜头前的不同位置时,在投影面上的成像示意图; [0051] 图2为本发明实施例提供的基于相机距离的人手三维姿态估计模型建立方法示意 图; [0052] 图3为本发明实施例提供的基于相机距离的人手三维姿态估计模型建立方法示意 图; [0053] 图4为现有的沙漏模型示意图; [0054] 图5为现有的沙漏模型中分支部分、下采样部分和上采样部分的示意图;其中,(a) 为下采样部分示意图,(b)为上采样部分示意图,(c)为分支部分示意图; [0055] 图6为本发明实施例提供的修改的沙漏模型中分支部分、下采样部分和上采样部 分的示意图;其中,(a)为下采样部分示意图,(b)为上采样部分示意图,(c)为分支部分示意 图; [0056] 图7为本发明实施例提供的第二阶段模型的结构示意图。 具体实施方式 [0057] 为了使本发明的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对 本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅仅用以解释本发明,并 不用于限定本发明。此外,下面所描述的本发明各个实施方式中所涉及到的技术特征只要 彼此之间未构成冲突就可以相互组合。 [0058] 在本发明中,本发明及附图中的术语“第一”、“第二”等(如果存在)是用于区别类 似的对象,而不必用于描述特定的顺序或先后次序。 [0059] 针对现有的从RGB图像估计人手三维姿态的方法,估计准确度不高的技术问题,本 发明提供了一种基于相机距离的人手三维姿态估计方法及其应用,其整体思路在于:在利 用模型从RGB图像估计出人手各关节点的二维坐标,以及在手势坐标系下的三维坐标的基 础上,进一步在模型中引入相机距离学习网络和第二生成网络,由相机距离学习模块根据 已有的估计结果计算相机距离并融入模型,从而为模型显式地提供3D手势与3D关节点之间 的透视投影关系,由第二生成网络根据该透视投影关系进一步通过学习的方式得到人手各 关节点在相机坐标系下的三维坐标,提高人手三维姿态的估计准确度。 [0060] 以下为实施例。 [0061] 实施例1: [0062] 一种基于相机距离的人手三维姿态估计模型建立方法,如图2和图3所示,包括: [0063] 建立包含2D卷积网络、第一生成网络、相机距离学习网络和第二生成网络的待训 练模型;2D卷积网络以包含人手图像的单目RGB图像为输入,用于估计人手各关节点的二维 坐标;第一生成网络以2D卷积网络输出的估计结果为输入,用于估计人手各关节点在手势 坐标系下的三维坐标;相机距离学习网络以2D卷积网络和第一生成网络输出估计结果为输 8 8 CN 113191243 B 说明书 6/10 页 入,用于根据输入信息计算相机距离,并按照相机距离对第一生成网络输出的各关节点在 手势坐标系下的三维坐标进行三维平移;第二生成网络以相机距离学习网络输出的平移后 的三维坐标为输入,用于估计人手各关节点在相机坐标系下的三维坐标,完成人手三维姿 态的估计; [0064] 构建由包含人手的RGB图像构成的训练集;训练集中,每张单目RGB图像已标注了 标注人手各关节点的二维坐标和在相机坐标系下的三维坐标,且人手各关节点在手势坐标 系下的三维坐标已知;利用训练集对待训练模型进行训练,在训练结束后,得到人手三维姿 态估计模型。 [0065] 作为一种优选的实施方式,如图3所示,本实施例中,人手三维姿态估计模型中的 2D卷积网络具体是改进的沙漏模型,该模型是对传统的沙漏模型(Hourglass)中的分支部 分、下采样部分和上采样部分进行修改后得到的模型;传统的沙漏模型如图4所示,其通过 网络的编码‑解码,对图像先进行下采样而后进行上采样的方式,下采样部分得到的特征图 会通过分支部分复制到下采样部分,与对应尺度的特征图进行融合,作为下一级上采样层 的输入,由此能够将各个尺度的信息结合利用起来,最终输出与输入图像尺度相同的图像; 传统的沙漏模型中,下采用使用pooling池化操作,上采样使用的是最近邻上采样,如图5中 的(a)和(b)所示,这些操作会导致细节信息的丢失,而且,传统的沙漏模型对分支模块没有 进行任何操作,如图5中的(c)所示,不能充分利用多尺度信息;为了进一步提高估计精度, 本实施例中,对沙漏模型的具体修改如下: [0066] 将各下采样部分中的池化模块替换为依次连接的核尺寸为3步长为2的卷积层、BN 层和ReLU激活函数层,修改后的下采样部分如图6中的(a)所示;将各上采样部分中的最近 邻上采样模块替换为核尺寸为2、步长为2的反卷积层,修改后的上采样部分如图6中的(b) 所示;将每一个阶段的分支部分替换为输入输出通道相同、卷积核尺寸为3、步长为1的主干 双卷积层堆叠的残差模块,修改后的分支部分如图6中的(c)所示; [0067] 基于以上修改,本实施例能够有效避免在下采样和上采样过程中丢失细节信息, 并且能够充分利用多尺度信息,从而进一步提高估计准确度;应当说明的是,此处仅为本发 明优选的实施方式,不应理解为对本发明的唯一限定;由于使用传统的沙漏模型已经可以 达到很好的估计准确度,因此,在本发明其他的一些实施例中,也可知直接使用沙漏模型作 为2D卷积网络;在本发明其他的而一些实施例中,在估计准确度可满足应用需求的情况下, 也可以使用残差网络(Resnet),VGG等其他的2D卷积网络,在此将不作一一列举。 [0068] 人手有21个关节点,具体为每一根手指的指尖(TIP)、远掌心关节(DIP)、近掌心关 节(PIP)和掌根关节(MCP),以及掌心关节;本实施例中,利用修改的沙漏模型针对每一个关 节点分别学习与输入的RGB图像同样尺寸的概率图,概率图中描述了各位置为对应关节点 的概率,之后通过softmax函数规范后,与像素坐标做加权求和,即可得到关节点的二维坐 标,相关公式如下: [0069] [0070] 9 9 CN 113191243 B 说明书 7/10 页 [0071] 其中,Ω为输出的原始概率图的坐标空间,p为对应的像素坐标。 为第k(k=1, 2,……,21)个关节点的原始概率图; 为第k个关节点使用softmax函数规范后的概率 图; 为求和后的第k个2D关节点坐标,基于概率图的性质计算2D关节点,网络的参数梯度 在这里仍然可以进行传播,且关节点的准确度更高。 [0072] 如图3和图7所示,本实施例中,第一生成网络和第二生成网络具体由图卷积神经 网络实现;图卷积神经网络(Graph Convolutional Network,GCN)除了可以输入2D/3D坐标 信息,还可以输入邻接矩阵,在人手三维姿态估计中,人手的拓扑结构,及各关节点的相邻 关系是固定不变的,本实施例以图卷积神经网络作为第一生成网络和第二生成网络,网络 参数较少,且使得模型可以通过输入的邻接矩阵获得人手关节点的相邻关系,在模型的训 练过程中,能够充分利用人手关节点与关节点之间的生理骨架结构的约束关系,只做相邻 关节点的信息交换,避免了无关信息的干扰,同时隐式地强调了人手的拓扑结构,能够有效 提高估计结果;应当说明的是,具体利用图卷积神经网络实现第一生成网络和第二生成网 络,仅为本发明优选的实施方式,不应理解为对本发明唯一的限定,在本发明其他一些实施 例中,也可以使用变分自动编码网络(VAE)、1D卷积网络等模型来实现第一生成网络和第二 生成网络。 [0073] 基于相机的透视投影公式即可推导得到相机距离的计算公式,相机的透视投影公 式具体如下: [0074] [0075] 其中,(f ,f ,m,n)为相机自身参数,f 、f 分别表示相机x、y轴的焦距,m、n分别表 x y x y 示对应x、y轴的偏移量;J =(x ,y ,z )表示第i个关节点在以相机镜头为原点的相机坐标 i i i i 系下的三维坐标,i=1,2,……,21;J =(x ,y ,z )表示中指掌根坐标;J =(x ,y ,z )表示 a a a a r r r r 掌心坐标;P=(u ,v )表示第i个关节点在图像上的二维坐标;上标n表示归一化之后的结 i i 果,上标rel表示在以掌心为原点的手势坐标系下的坐标; [0076] 其中归一化后的相机手势满足中指指根关节点 与掌心关节点 的欧式距离 为1,即: [0077] [0078] 基于以上公式可得: 10 10 CN 113191243 B 说明书 8/10 页 [0079] [0080] 消除 与 即可最终计算得出相机距离 本实施例所计算的 相机距离同时包含x、y、z方向的坐标,将其融合进后续网络的输入后,能够明确3D手势与2D 关节点的尺度与位置的变换关系; [0081] 本实施例中,相机距离学习模块计算相机距离时,即根据上述计算公式完成计算; 由于本实施例中,相机距离具体是根据2D卷积网络输出的二维坐标估计结果和第一生成网 络输出的三维坐标估计结果计算得到,不依赖于实际的相机距离参数,适用范围广泛。 [0082] 由于一般情况下,单目相机所拍摄的单目RGB图像除了包含人手部分,还会包含其 他的人体部分,分辨率低且背景杂乱,因此,直接使用已标注人手关节点二维坐标和三维坐 标的单目RGB图像进行模型训练,会影响模型的训练效果,因此,本实施例中,在构建训练集 时,会对已标注的RGB图像做如下预处理: [0083] 将人手各关节点在相机坐标系下的三维坐标减去掌心关节点的坐标,得到人手各 关节点在手势坐标系下的三维坐标; [0084] 识别出单目RGB图像中的人手部分,以中指指根为中心点,分别计算可以包含手掌 的最小长和宽,并分别扩大为原来的η倍;按照扩大后的长和宽裁剪得到包含人手图像的单 目RGB图像;η1; [0085] 将裁剪得到所有单目RGB图像缩放到同一尺寸下;可选地,本实施例中,缩放后,图 像大小为256*256; [0086] 通过裁剪出人手部分,并缩放到同一尺寸下,能够有效缓解手势图像分辨率低、背 景杂乱的问题,提高所构建的训练集的质量;在裁剪时,按照扩大后的长和宽进行裁剪,而 不是按照最小长和宽裁剪,能够避免边缘细节信息的丢失;可选地,本实施例中,η=1.2。 [0087] 人手会因为年龄、性别、体格等存在手的大小不一致的情况,但人手骨架中指骨 (两个相邻指关节的距离)与整体手势的大小是大约成比例的,因此,本实施例对已标注的 RGB图像的预处理还包括: [0088] 将人手各关节点在相机坐标系下的三维坐标进行尺度归一化,归一化公式如下: [0089] [0090] [0091] J 为以相机镜头为原点的相机坐标系下掌心坐标,称为相机距离,在构建训练集 r n 时,使用已知的相机距离参数;s为手的中指指根关节与掌心的欧式距离;J 为第i个关节点 i 在相机坐标系下的三维坐标归一化之后的结果。 [0092] 除了以上预处理,为了进一步提高模型的训练效果,本实施例中,对已标注的RGB 图像的预处理还包括:对裁剪并缩放后的单目RGB图像进行数据增强,和/或将左、右手变换 11 11 CN 113191243 B 说明书 9/10 页 为同一手势; [0093] 本实施例通过对裁剪和缩放得到的单目RGB图像进行数据增强,能够扩充训练样 本的数量,提高模型的训练效果;人手存在左手和右手的区别,利用同一个模型同时学习两 种手势,模型的性能会受到影响,本实施例先将左、右手变换为同一手势,然后再对模型进 行训练,使得模型只需学习一种手势,能够有效提升模型的训练效果;具体地,本实施例中, 构建训练集时,预先将左手镜像成右手,使得网络只学习左手模式,后续是可以将估计的镜 像的人手还原成原本的左手或者右手模式的。 [0094] 基于所构建的训练集,为了在保证模型估计准确度的情况下,有效提高模型的训 练效率,本实施例中,对模型进行训练时,具体将模型分为两个阶段,先分别训练两个阶段 的模型,然后再把两个阶段模型连接为整体进行训练微调,具体如下: [0095] 如图3所示,将2D卷积网络作为第一阶段模型,以训练集中的单目RGB图像为训练 数据集合,以训练集中人手各关节点的二维坐标为监督信息集合,对第一阶段模型进行训 练,得到训练好的第一阶段模型; [0096] 对第一阶段模型进行训练时,所采用的损失函数为: [0097] [0098] 其中三维姿态估计模型,P表示标注的人手各关节点的二维坐标, 表示第一阶段模型估计的人手各 关节点的二维坐标,   表示1范数; 1 [0099] 如图3所示,将第一生成网络、相机距离学习网络和第二生成网络连接而成的模型 作为第二阶段模型,以训练集中人手各关节点的二维坐标为训练数据集合,以训练集中人 手各关节点在手势坐标系下的三维坐标和在相机坐标系下的三维坐标为监督信息集合,对 第二阶段模型进行训练,得到训练好的第二阶段模型; [0100] 对第二阶段模型进行训练时,所采用的损失函数为: [0101] [0102] 其中,Jrel表示人手各关节点在手势坐标系下的三维坐标; 表示第一生成网络 n 估计的人手各关节点在手势坐标系下的三维坐标;J 表示标注的人手各关节点在相机坐标 系下的三维坐标; 表示第二生成网络估计的人手各关节点在相机坐标系下的三维坐标;   表示2范数; 2 [0103] 上述损失函数中 , 表示第一生成网络的 估计损失 ; 表示第二生成网络的估计损失; [0104] 在第一阶段模型和第二阶段模型均训练完成后,连接训练好的第一阶段模型和训 练好的第二阶段模型,以训练集中的单目RGB图像为训练数据集合,以训练集中人手各关节 点在相机坐标系下的三维坐标为监督信息集合,对连接所得的模型进行训练微调,此时第 二阶段的输入为第一阶段输出的二维坐标; [0105] 对连接所得的模型进行训练微调时,所采用的损失函数为: 12 12 CN 113191243 B 说明书 10/10 页 [0106] L=λ L +λ L ; 2D 2D 3D 3D [0107] 其中,λ 和λ 表示权重系数;可选地,本实施例中,λ =1和λ =500; 2D 3D 2D 3D [0108] 通过上述先分阶段训练,然后进行微调的训练方法,本实施例能够在保证模型训 练效果的基础上,简化模型训练过程中的参数调整,提高模型的训练效率。 [0109] 本实施例估计值计算相机距离,并融入到第二生成网络的输入信息中,由此能够 显式地为模型提供3D人手关节点与2D人手关节点之间的透视投影关系,避免了3D人手关节 点与2D人手关节点间尺度和位置信息的缺失,解决了不同的2D关节点输入,同样的3D手势 监督对网络的引导不明确的负影响,提升了手势关节点的估计准确度,能够有效提高人手 三维姿态估计的准确度。 [0110] 实施例2: [0111] 一种人手三维姿态估计方法,包括:将包含人手的单目RGB图像输入至由上述实施 例1提供的基于相机距离的人手三维姿态估计模型建立方法所建立的人手三维姿态估计模 型,得到单目RGB图像中人手各关节点在相机坐标系下的三维坐标,完成人手三维姿态估 计。 [0112] 实施例3: [0113] 一种计算机可读存储介质,包括存储的计算机程序;计算机程序被处理器执行时, 控制计算机可读存储介质所在设备执行上述实施例1提供的基于相机距离的人手三维姿态 估计模型建立方法,和/或上述实施例2提供的人手三维姿态估计方法。 [0114] 本领域的技术人员容易理解,以上所述仅为本发明的较佳实施例而已,并不用以 限制本发明,凡在本发明的精神和原则之内所作的任何修改、等同替换和改进等,均应包含 在本发明的保护范围之内。 13 13 CN 113191243 B 说明书附图 1/6 页 图1 14 14 CN 113191243 B 说明书附图 2/6 页 图2 图3 15 15 CN 113191243 B 说明书附图 3/6 页 图4 16 16 CN 113191243 B 说明书附图 4/6 页 图5 17 17 CN 113191243 B 说明书附图 5/6 页 18 18 CN 113191243 B 说明书附图 6/6 页 图6 图7 19 19

  2、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问加。

  3、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。

  4、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档

  一种用于水处理净化的CuO-Fe2O3/Mxene复合材料及其制备方法和应用.pdf

  2026财达证券股份有限公司四川分公司招聘1人笔试备考题库及答案解析.docx

  有理数的乘方(4种题型)-2023年新七年级数学(浙教版)(解析版).pdf

  2026财达证券股份有限公司深圳分公司招聘1人笔试参考题库及答案解析.docx

  QZTT 2102-2016 彩钢板机房、一体化(集装箱)机房技术要求(V2.0).pdf

  原创力文档创建于2008年,本站为文档C2C交易模式,即用户上传的文档直接分享给其他用户(可下载、阅读),本站只是中间服务平台,本站所有文档下载所得的收益归上传人所有。原创力文档是网络服务平台方,若您的权利被侵害,请发链接和相关诉求至 电线) ,上传者

电话:

0557-8103355

邮箱:

56987742032@qq.com

地址:

安徽省宿州市砀山县周寨镇

Copyright © 2026 开云体育股份发展有限公司 版权所有    备案号:皖ICP备2025075536号