开云体育官方网站-(Kaiyun Sports)

公司新闻
NEWS

新闻中心

一种基于预训练生成模型的三维姿态估计方法技术

浏览次数:

  

一种基于预训练生成模型的三维姿态估计方法技术(图1)

  当前位置:首页专利查询清华大学深圳国际研究生院专利正文

  一种基于预训练生成模型的三维姿态估计方法,包括:S1、预训练动作生成模型处理阶段:通过动作生成模型的3D编码层,从输入的三维动作捕捉数据中提取3D动作数据的特征;通过动作生成模型的2D编码层,从由3D动作数据投影得到的二维图像或视频中提取2D动作数据的特征;通过信息共享层融合提取的3D和2D特征,以增强模型对动作的理解;S2、3D姿态估计模型处理阶段:通过3D姿态估计模型的2D解码层三维姿态估计模型,对接收到的2D动作数据的特征进行解码,恢复出二维骨架信息;结合2D解码层的输出和信息共享层融合的特征,通过3D姿态估计模型的3D解码层进一步解码得到三维姿态。本发明专利技术能够显著提高对复杂动作的预测准确性和对真实人体运动规律的拟合度。

  本专利技术涉及计算机视觉技术,特别是涉及一种基Kaiyun Sports于预训练生成模型的三维姿态估计方法。

  1、3d姿态估计是计算机视觉中的一项关键技术,广泛应用于自动驾驶、机器人、虚拟现实(vr)、增强现实(ar)以及人体动作分析等领域。通过3d姿态估计,系统可以从二维图像或视频中推断出物体或人体在三维空间中的姿态信息。这项技术的核心在于从二维数据中提取并重建三维结构。

  2、目前的3d姿态估计方法主要可以分为以下几类:1)基于深度学习的方法:这些方法依赖于大规模的标注数据集和深度神经网络,通过从图像中提取特征来估计3d姿态。这类方法具有较高的精度和适应性,但也存在对数据依赖性强、计算资源需求高的问题。2)基于多视角的方法:该方法通过从多个视角拍摄物体或人体,然后结合多视角数据进行3d重建。这类方法在获取精确姿态方面表现良好,但在实际应用中往往受限于场景复杂性和摄像机配置的要求。3)基于传感器融合的方法:这类方法结合了rgb摄像头、深度摄像头(如kinect)、惯性测量单元(imu)等多种传感器数据,从而增强3d姿态估计的精度和鲁棒性。然而,传感器的增加也带

  2.如权利要求1所述的基于预训练生成模型的三维姿态估计方法,其特征在于,采用扩散模型作为生成框架,对融合提取的特征进行去噪处理,以预测准确的三维姿态。

  3.如权利要求2所述的基于预训练生成模型的三维姿态估计方法,其特征在于,采用扩散模型作为生成框架,对融合提取的特征进行去噪处理,以预测准确的三维姿态,具体包括:

  4.如权利要求2或3所述的基于预训练生成模型的三维姿态估计方法,其特征在于,步骤S1中包括:将3D动作捕捉数据投影到2D,生成多个视角的2D动作数据;对所述3D动作数据和由其投影

  2.如权利要求1所述的基于预训练生成模型的三维姿态估计方法,其特征在于,采用扩散模型作为生成框架,对融合提取的特征进行去噪处理,以预测准确的三维姿态。

  3.如权利要求2所述的基于预训练生成模型的三维姿态估计方法,其特征在于,采用扩散模型作为生成框架,对融合提取的特征进行去噪处理,以预测准确的三维姿态,具体包括:

  4.如权利要求2或3所述的基于预训练生成模型的三维姿态估计方法,其特征在于,步骤s1中包括:将3d动作捕捉数据投影到2d,生成多个视角的2d动作数据;对所述3d动作数据和由其投影得到的2d动作数据施加噪声,生成3d噪声和2d噪声;通过3d编码层和2d编码层处理相应的3d噪声和2d噪声,以提取中间特征;利用信息共享层整合由3d编码层和2d编码层提取的中间特征,形成融合特征;

  5.如权利要求1至4任一项所述的基于预训练生成模型的三维姿态估计方法,其特征在于,所述3d编码层、所述2d编码层、所述信息共享层、所述3d解码层和所述2d解码层均是基于transformer架构的层。...

电话:

0557-8103355

邮箱:

56987742032@qq.com

地址:

安徽省宿州市砀山县周寨镇

Copyright © 2026 开云体育股份发展有限公司 版权所有    备案号:皖ICP备2025075536号