
导航:X技术最新专利计算;推算;计数设备的制造及其应用技术
本发明针对现有基于RGB图像的人体姿态估计方法存在实时性差、显存占用高的问题,提出一种采用顺序化多阶段全卷积神经网络的2D多人姿态估计方法。通过联合学习、中继监督和分支结构优化模型效率,结合匈牙利算法与改进二分图算法实现关键点精准连接,仅需普通监控摄像头即可实现高速低显存的姿态估计,满足实际场景应用需求。
人体姿态估计开云体育官方入口技术在行为识别、人机交互、游戏、动画等领域有着很广阔的应用前景,是计算机视觉领域中一个既具有研究价值、同时又极具挑战性的热门课题。
给定一幅图像或一段视频,人体姿态估计就是恢复其中人体关键点位置的过程。根据输入图像的类型,人体姿态估计算法可以分为两类:基于深度图的算法、以及直接基于rgb图像的算法。基于深度图的算法,其对图像采集设备要求过高,因此带来了应用易受限的问题。相较于深度图,基于rgb图像的人体姿态估计算法具有更广的应用前景,且在比较复杂的场景下,基于rgb图像的人体姿态估计算法也能达到很好的识别效果,但是,基于rgb图像的人体姿态估计算法的实时性较差,模型显存占用非常大,限制了人体姿态估计技术在实际产品中的使用。
公开号为“cn105913026a”的发明专利公开了一种将单目深度图输入至一经训练好的全卷积深度神经网络中,以检测出其中的人体骨骼关键点位置的方法。该方法采用深度图的算法,其对图像采集设备要求过高,使得在实际产品应用中受到了极大的限制。
针对现有技术的缺点,本发明的目的在于提出一种2d多人姿态估计方法,无需使用过高的图像采集设备,只需使用普通的监控摄像头,且其模型的算法速度快,占用显存低,可大规模地应用到实际场景中。
本发明提供了一种高效的2d多人姿态估计方法,使用rgb人体姿态图像作为输入,其特征在于,包括如下步骤:
s1、对所述人体姿态图像的若干个人体关键点样本进行标注,获得训练集样本;
s2、设计人体姿态估计网络,所述估计网络设计为顺序化的多阶段的全卷积神经网络,经由所述估计网络得到人体关键点检测响应图与人体关键点亲和矢量场响应图;首先使用标注好的训练集图片输入到人体姿态估计网络中,模型会自动学习到所有关键点的位置和方向信息以及各关键点的置信图信息,其中根据学到的特征输出关键点的置信图即为人体关键点检测响应图,位置和方向信息即为人体关键点亲和矢量场响应图。然后输入一张图片,经过训练好的人体姿态估计模型就会输出人体关键点检测响应图和人体关键点亲和矢量场响应图;
s3、将s1中所述的训练集样本输入到s2的所述人体姿态估计网络结构中进行离线训练,并获得人体姿态估计模型;人体姿态估计模型是训练好的模型,训练集样本中关键点的特征信息包括位置方向都已经被学习到模型中,给定一张人体姿态图片,经过人体姿态估计模型检测得到的图片会标出所有关键点的位置和方向信息以及各关键点的相关性,网络根据学习到的特征输出关键点的置信图即为人体关键点检测响应图,位置和方向信息即为人体关键点亲和矢量场响应图。简言之,人体关键点检测响应图与人体关键点亲和矢量场响应图是人体姿态估计模型从训练集样本中学到的特征。s4、使用匈牙利算法和二分图算法处理s2得到的人体关键点检测响应图与人体关键点亲和矢量场响应图,以得到每个人的所述人体关键点的正确连接。
进一步地,所述人体关键点至少包括:鼻子、左右眼、左右耳、颈部、左右肩、左右手肘、左右手腕、左右臀部、左右膝盖、左右脚踝。
(1)采用视觉几何组vgg-19的前10层对所述训练集样本进行初始化微调,得到人体关键点检测响应图与人体关键点亲和矢量场响应图;用于初始化网络前面的权重参数,作为后续模型训练的预训练模型。此处的人体关键点检测响应图与人体关键点亲和矢量场响应图是模型训练到第10层将图片可视化学习到的特征。
(2)利用联合学习的方式学习人体关键点检测响应图与人体关键点亲和矢量场响应图;首先使用标注好的训练集图片输入到人体姿态估计网络中,模型会自动学习到所有关键点的位置和方向信息以及各关键点的置信图信息,其中根据学到的特征输出关键点的置信图即为人体关键点检测响应图,位置和方向信息即为人体关键点亲和矢量场响应图。
(3)利用多阶段训练的方式不断优化所述人体关键点的位置与所述人体关键点亲和矢量场;
进一步地,所述两个分支,包括第一分支、第二分支,所述第一分支使用的损失函数为所述第二分支使用的损失函数为其中,是真实的标注值,t表示第t阶段,j表示关键点数,c表示肢体个数,p表示某一位置,w非0即1,当图像中的p处没有标注时,则w(p)=0,避免惩罚被模型预测为正的正样本。
进一步地,对所述二分图算法进行改进,该改进包括:选择最小数量的边来获得人体姿态的生成树骨架;将匹配问题分解为一组二分图匹配的子问题,并独立确定相邻树节点的匹配。
进一步地,在所述选择最小数量的边来获得人体姿态的生成树骨架中,只考虑相邻人体关键点的连接。
进一步地,所述人体姿态图像使用2000张1920*1080,该图片为室内、室外、不同尺度和不同光照场景下的图片。
一种非易失性存储介质,其特征在于,包括一条或多条计算机指令,所述一条或多条计算机指令在执行时实现上述所述的方法。
本发明提供的这种一种2d多人姿态估计方法,采用顺序化的多阶段的全卷积神经网络进行端到端的学习,无需使用过高的图像采集设备,只需使用普通的监控摄像头,不需使用高要求的图像采集设备,且其模型的算法速度快,实时性高,效率高,占用显存低,可大规模地应用到实际场景中。
下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然2d人体姿态估计,所描述的实施例是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
本发明的目的在于提出一种高效的2d多人姿态估计方法,使用rgb人体姿态图像作为输入,包括如下步骤:
s1、对所述人体姿态图像的若干个人体关键点样本进行标注,获得训练集样本;
所述人体关键点至少包括如下18个关键点:鼻子、左右眼、左右耳、颈部、左右肩、左右手肘、左右手腕、左右臀部、左右膝盖、左右脚踝。
s2、设计人体姿态估计网络,所述估计网络设计为顺序化的多阶段的全卷积神经网络,经由所述估计网络得到人体关键点检测响应图与人体关键点亲和矢量场响应图;首先使用标注好的训练集图片输入到人体姿态估计模型中,模型会自动学习到所有关键点的位置和方向信息以及各关键点的关联信息,网络根据学到的特征输出的关键点的置信图即为人体关键点检测响应图,位置和方向信息即为人体关键点亲和矢量场响应图。然后输入一张图片,经过训练好的人体姿态估计模型就会输出人体关键点检测响应图和人体关键点亲和矢量场响应图。
(1)采用视觉几何组vgg-19的前10层对所述训练集样本进行初始化微调,得到人体关键点检测响应图与人体关键点亲和矢量场响应图;用于初始化网络前面的权重参数,作为后续模型训练的预训练模型。此处的人体关键点检测响应图与人体关键点亲和场响应图是模型训练到第10层将图片可视化学习到的特征。
(2)利用联合学习的方式学习人体关键点检测响应图与人体关键点亲和矢量场响应图;首先使用标注好的训练集图片输入到人体姿态估计网络中,网络会自动学习到所有关键点的位置和方向信息以及各关键点的关联信息,其中根据学到的特征输出关键点的置信图即为人体关键点检测响应图,位置和方向信息即为人体关键点亲和矢量场响应图。
(3)利用多阶段训练的方式不断优化所述人体关键点的位置与所述人体关键点亲和矢量场;
进一步地,所述两个分支,包括第一分支、第二分支,所述第一分支使用的损失函数为所述第二分支使用的损失函数为其中,是真实的标注值。t表示第t阶段,j表示关键点数,c表示肢体个数,p表示某一位置,w非0即1,当图像中的p处没有标注时,则w(p)=0,避免惩罚被模型预测为正的正样本。
s3、将s1中所述的训练集样本输入到s2的所述人体姿态估计网络结构中进行离线训练,并获得人体姿态估计模型;人体姿态估计模型是训练好的模型,训练集样本中关键点的特征信息包括位置方向都已经被学习到模型中,给定一张人体姿态图片,经过人体姿态估计模型检测得到的图片会标出所有关键点的位置和方向信息以及各关键点的关联信息,其中关键点的置信图即为人体关键点检测响应图,位置和方向信息即为人体关键点亲和矢量场响应图。简言之,人体关键点检测响应图与人体关键点亲和矢量场响应图是人体姿态估计模型根据从训练集样本中学到的特征输出的。
s4、使用匈牙利算法和二分图算法处理s2得到的人体关键点检测响应图与人体关键点亲和矢量场响应图,以得到每个人的所述人体关键点的正确连接。
对所述二分图算法进行改进,该改进包括:选择最小数量的边来获得人体姿态的生成树骨架;将匹配问题分解为一组二分图匹配的子问题,并独立确定相邻树节点的匹配。在所述选择最小数量的边来获得人体姿态的生成树骨架中,只考虑相邻人体关键点的连接。在所述匹配问题中,每次只考虑一个肢体的连接。
上述实施例中使用2000张1920*1080的图片(包括室内室外、不同尺度和不同光照的场景)进行测试。测试环境如下:
测试代码采用的深度学习框架:caffe。caffe全称为convolutionalarchitectureforfastfeatureembedding,是一种快速特征嵌入的卷积结构,是一种常用的深度学习框架,主要应用在视频、图像处理方面的应用上。通过测试本发明说出的实施例方案结果表明,基于自主设计的行人姿态估计网络整体上获得了97%的准确率,单张图片处理速度为50ms,单路的显存占用1.7g左右,实时性高,满足了实际场景的需求。
一种非易失性存储介质,其特征在于,包括一条或多条计算机指令,所述一条或多条计算机指令在执行时实现上述所述的方法。
与现有技术相比,本发明至少具有下述的有益效果或优点:2d多人姿态估计方法,采用顺序化的多阶段的全卷积神经网络进行端到端的学习,还设计了联合学习、中继监督与分支的方式一起学习人体关键点检测响应图与人体关键点亲和矢量场响应图,无需使用过高的图像采集设备,只需使用普通的监控摄像头,不需使用高要求的图像采集设备,且其模型的算法速度快,实时性高,效率高,占用显存低,可大规模地应用到实际场景中。
以上例举仅仅是对本发明的举例说明,并不构成对本发明的保护范围的限制,凡是与本发明相同或相似的设计均属于本发明的保护范围之内。