图像处理_H3D Dataset(伯克利大学人体3D数据库)
H3D Dataset(伯克利大学人体3D数据库)
数据摘要:
H3D (Humans in 3D) is a dataset of annotated people. The annotations include:
?The joints and other keypoints (eyes, ears, nose, shoulders, elbows, wrists, hips, knees and ankles)
?The 3D pose inferred from the keypoints.
?Visibility boolean for each keypoint
?Region annotations (upper clothes, lower clothes, dress, socks, shoes, hands, gloves, neck, face, hair, hat, sunglasses, bag, occluder)
?Body type (male, female or child)
中文关键词:
人体,三维,标注,关键点,姿态,遮挡,
英文关键词:
Humans,3D,annotated,keypoints,pose,occluder,
数据格式:
IMAGE
数据用途:
Address the classic problems of detection and segmentation using a part based detector.
数据详细介绍:
H3D
H3D (Humans in 3D) is a dataset of annotated people. The annotations include:
The joints and other keypoints (eyes, ears, nose, shoulders, elbows, wrists, hips, knees and ankles)
The 3D pose inferred from the keypoints.
Visibility boolean for each keypoint
Region annotations (upper clothes, lower clothes, dress, socks, shoes, hands, gloves, neck, face, hair, hat, sunglasses, bag, occluder) Body type (male, female or child)
The download includes the dataset as well as a set of Matlab tools and examples of its use. It requires the image processing toolbox.
Human Annotation Tool
The annotation tool used to create H3D, as well as video instructions are available here. You may want to use it to browse H3D, make corrections, as well as create your own dataset.
License
The images used in HAT are taken from Flickr under the Creative Commons Attribution license. It allows for redistribution and derivative work for non-commercial or commercial purposes as long as the authors are attributed accordingly. Please see the license for more detail.
The Matlab toolbox is available with a non-commercial license. Please see the license file in the download directory for more.
Paper
The project/paper describing H3D is available here.
If you use H3D please use the following BibTex reference:
@InProceedings{PoseletsICCV09,
author = "Lubomir Bourdev and Jitendra Malik",
title = "Poselets: Body Part Detectors Trained Using 3D Human Pose Annotations",
booktitle = "International Conference on Computer Vision",
month = "sep",
year = "2009",
url = "/~lbourdev/poselets"
}
数据预览:
点此下载完整数据集。
香港理工大学的高光谱人脸数据库(PolyU-HSFD)_图像处理_科研数据集
香港理工大学的高光谱人脸数据库(PolyU-HSFD)(The Hong Kong Polytechnic University Hyperspectral Face Database (PolyU-HSFD))数据介绍:The Biometric Research Centre (UGC/CRC) at The Hong Kong Polytechnic University has developed a Hyperspectral Face database to advance research and to provide researchers working in the area of face recognition with an opportunity to compare the effectiveness of face recognition algorithms. The indoor hyperspectral face acquisition system was built which mainly consists of a CRI’s VariSpec LCTF and a Halogen Light (Illustrated in Fig. 1), and includes a hyperspectral dataset of 300 hyperspectral image cubes from 25 volunteers with age range from 21 to 33 (8 female and 17 male). For each individual, several sessions were collected with an average time space of 5 month. The minimal interval is 3 months and the maximum is 10 months. Each session consists of three hyperspectral cubes-- frontal, right and left views with neutral-expression. The spectral range is from 400nm to 720nm with a step length of 10nm, producing 33 bands in all. Fig. 2 shows an example of the hyperspectral face. Sinc关键词:香港理工大学,高光谱,人脸,UGC/CRC,识别,PolyU,Hyperspectral,Face,UGC/CRC,recognition,数据格式:IMAGE数据详细介绍:The Hong Kong Polytechnic University Hyperspectral Face Database(PolyU-HSFD)The Biometric Research Centre (UGC/CRC)at The Hong Kong Polytechnic University has developed a Hyperspectral Face database to advance research and to provide researchers working in the area of face recognition with an opportunity to compare the effectiveness of face recognition algorithms. The indoor hyperspectral face acquisition system was built which mainly consists of a CRI’s VariSpec LCTF and a Halogen Light (Illustrated in Fig. 1), and includes a hyperspectral dataset of 300 hyperspectral image cubes from 25 volunteers with age range from 21 to 33 (8 female and 17 male). For each individual, several sessions were collected with an average time space of 5 month. The minimal interval is 3 months and the maximum is 10 months. Each session consists of three hyperspectral cubes-- frontal, right and left views with neutral-expression. The spectral range is from 400nm to 720nm with a step length of 10nm, producing 33 bands in all. Fig. 2 shows an example of the hyperspectral face. Since the database was constructed over a long period of time, significant appearance variations of the subjects, e.g. changes of hair style and skin condition, are presented in the data. In data collection, positions of the camera, light and subject are fixed, which allows us to concentrate on the spectral characteristics for face recognition without masking from environmental changes.Fig. 1 The established hyperspectral face imaging systemFig. 2 Illustration of a set of 33 hyperspectral face bandsData description(A) Mat-fileEach Mat file is 3-D datacube with size: 220 (height) *180 (width) *33 (no. ofbands), cropped from the original images, which contains the radiance data from the original source .tif image.Three types of images were acquired: front, right, and left. The Mat-files are stored separately as:Front-Mat file: in the file of SampleImages_F, totally 151 datacubes.Right-Mat file: in the file of SampleImages_R, totally 125 datacubes.Left-Mat file: in the file of SampleImages_L, totally 124 datacubes.(B) Source DataSource data are documented according to the acquisition date. Totally four data sets (I to IV) were acquired at different time (10/17/2007, 11/21/2007-11/23/2007, 12/12/2007, and 3/21/2008). Some subjects may have several sessions at each time. Each session (e.g. Sample 17 from the 3/21/2008 data set) contains 3 sub-files: f-front image, r-right image and l-left image.For a detailed and completed data description, you are advised to read the DATA_TEXT and DATA_TABLE. Also, we manually located the eye coordinates from the front images (151 subjects) for registration and cropping. Here is the format:F_1_1.jpg61 93 118 89F_1_1.jpg: the name of the front face image61: the X-coordinate of the right eye (from the view of the sample face, R_x) 93: the Y-coordinate of the right eye (from the view of the sample face, R_y) 118: the X-coordinate of the left eye (from the view of the sample face, L_x) 89: the Y-coordinate of the left eye (from the view of the sample face, L_y) Related Publication:1. Wei Di, Lei Zhang, David Zhang, and Quan Pan “Studies on Hyperspectral Face Recognition in Visible Spectrum with Feature Band Selection” IEEE Trans. on System, Man and Cybernetics, Part A, vol. 40, issue 6, pp. 1354 –1361, Nov. 2010The Announcement of the CopyrightAll rights of the PolyU-HSFD are reserved. The database is only available for research and noncommercial purposes. Commercial distribution or any act related to commercial use of this database is strictly prohibited. A clear acknowledgement should be made for any public work based on the PolyU-HSFD. A citation to “PolyU-HSFD, .hk/~biometrics/hyper_face.htm” and our related works must be added in the references. A soft copy of any released or public documents that use the PolyU-HSFD must be forwarded to: cslzhang@.hkHere we would like to thank Chen Chao and Yang Hongfang’s kind help for the data acquisition.Downloading Steps:Download ZIP to your local disk. Then, fill in the application forms. Send the application form to cslzhang@.hk. The successful applicants will receive the passwords for unzipping the files downloaded.HSFace databaseApplication FormContact Information:Dr. Lei Zhang, Associate ProfessorBiometric Research CentreThe Hong Kong Polytechnic UniversityHung Hom, Kowloon, Hong KongE-mail: cslzhang@.hk数据预览:点此下载完整数据集。
3D人体姿态数据集TNT15
3D人体姿态数据集TNT15目前,已知的 3D 人体姿态的公开数据集有 Human3.6M、HumanEva、MPII、COCO等,这些数据集由 RBG 图像和人体关节点的空间坐标组成。
根据拍摄人数的不同,数据集可分为单人数据集和多人数据集;根据图像是否连续,数据集可分为单帧图像数据集和连续帧视频数据集。
单人连续帧视频数据集的制作,基本上均依靠动捕设备来捕捉真实人体关节点的空间坐标,同时也有数据集消耗大量人力进行手工标注,以下对几种公开数据集进行简要介绍。
(1)Human3.6M 数据集:简称 H36M 数据集,是目前 3D 人体姿态估计领域中数据集样本数量最多、使用最为广泛的数据集。
H36M 数据集共包含约 360 万张图像,共 11 个演员进行数据集录制,其中只有 S1、S5、S6、S7、S8、S9、S11 这 7 个人带有 3D 人体姿态标签。
H36M 数据集中,分别从 4 个角度对演员进行拍摄录制,视频录制帧数为 50Hz,每位演员表演 17 种日常动作,例如:抽烟、照相、打招呼等。
在3D 人体姿态估计领域的研究中,学者们通常会将S1、S5、S6、S7、S8 这 5 个人的动作样本作为训练集,并将 S9、S11 两人的动作样本作为测试集对算法性能进行评测。
在使用 H36M 数据集时需要注意的是,部分视频的帧数与标注的 3D 人体关节点标签帧数不一致,需要对视频末尾帧数进行剪切后与 3D 人体关节点标签一一对应。
(2)HumanEva 数据集:该数据集由动作捕捉设备制作而成,数据集共录制 4 个演员的 6 种日常动作,例如行走、慢跑、拳击、打招呼等,该数据集共包含 20610 张标注图像,学者们通常会将 S1、S2、S3 这 3 个人的动作作为训练集,共 10041 张图像,剩下的样本则作为测试集,共包含 10569 张图像。
图像处理_H3D Dataset(伯克利大学人体3D数据库)
H3D Dataset(伯克利大学人体3D数据库)数据摘要:H3D (Humans in 3D) is a dataset of annotated people. The annotations include:?The joints and other keypoints (eyes, ears, nose, shoulders, elbows, wrists, hips, knees and ankles)?The 3D pose inferred from the keypoints.?Visibility boolean for each keypoint?Region annotations (upper clothes, lower clothes, dress, socks, shoes, hands, gloves, neck, face, hair, hat, sunglasses, bag, occluder)?Body type (male, female or child)中文关键词:人体,三维,标注,关键点,姿态,遮挡,英文关键词:Humans,3D,annotated,keypoints,pose,occluder,数据格式:IMAGE数据用途:Address the classic problems of detection and segmentation using a part based detector.数据详细介绍:H3DH3D (Humans in 3D) is a dataset of annotated people. The annotations include:The joints and other keypoints (eyes, ears, nose, shoulders, elbows, wrists, hips, knees and ankles)The 3D pose inferred from the keypoints.Visibility boolean for each keypointRegion annotations (upper clothes, lower clothes, dress, socks, shoes, hands, gloves, neck, face, hair, hat, sunglasses, bag, occluder) Body type (male, female or child)The download includes the dataset as well as a set of Matlab tools and examples of its use. It requires the image processing toolbox.Human Annotation ToolThe annotation tool used to create H3D, as well as video instructions are available here. You may want to use it to browse H3D, make corrections, as well as create your own dataset.LicenseThe images used in HAT are taken from Flickr under the Creative Commons Attribution license. It allows for redistribution and derivative work for non-commercial or commercial purposes as long as the authors are attributed accordingly. Please see the license for more detail.The Matlab toolbox is available with a non-commercial license. Please see the license file in the download directory for more.PaperThe project/paper describing H3D is available here.If you use H3D please use the following BibTex reference:@InProceedings{PoseletsICCV09,author = "Lubomir Bourdev and Jitendra Malik",title = "Poselets: Body Part Detectors Trained Using 3D Human Pose Annotations",booktitle = "International Conference on Computer Vision",month = "sep",year = "2009",url = "/~lbourdev/poselets"}数据预览:点此下载完整数据集。
基于MITK的医学图像三维可视化方法
计算机图形学课程设计题目名称:基于MITK的医学图像三维可视化方法班级:学号:学生姓名:摘要目前医院中广泛使用的医学成像设备可以得到人体及其内部器官的二维数字断层图像序列或三维体数据并应用于临床,但医生只能凭经验估计病灶的大小、形状等信息,医务工作者迫切希望得到能够提供逼真、实时性强的图形的医学成像设备,医学图像体数据的三维可视化就是在这一背景下提出的。
本文以医学影像处理与分析平台MITK为基础,在VS2008环境中建立MFC应用程序,首先实现了多种格式二维CT图像文件的读取显示、切片浏览和数据保存;再通过MC 算法和光线投影算法得到表面绘制模型和体绘制模型;最后完成对三维图像简单的人机交互式操作。
关键词:MITK 三维可视化面绘制体绘制医学图像基于MITK的医学图像三维可视化方法医学图像三维可视化就是运用计算机图像处理技术,将获得的二维医学图像,如计算机层析造影技术CT、核磁共振技术MRI等产生的图片,在三维空间上重建出立体的三维图像。
通过对图像进行各种操作,如旋转、缩放、移动、剖面显示等,便于医生从多角度、多层次进行观察和分析, 使医生能更直观地看到人体组织内部复杂的结构,从而帮助医生更准确地诊断。
目前可用于医学三维可视化开发的软件有多个,MITK就是其中之一。
MITK(Medical Imaging ToolKit)是由中国科学院自动化研究所开发的一套集成化的医学影像处理与分析 C++类库软件包,它建立在VTK和ITK的基础上,在一个统一的框架上实现了医学影像的分割、配准、三维可视化等算法。
本文使用MITK在VC++6.0 IDE下通过面绘制和体绘制两种不同的技术探讨基于MITK的医学图像三维可视化方法【1】。
医学图像三维重建技术是当前医学图像处理的热点之一。
它在诊断医学、手术规划及模拟仿真、虚拟内窥镜、解剖教学等方面都有重要应用。
因此,对医学图像三维重建的研究,具有重要的理论意义和应用价值。
一种应用于人体三维测量中的图像预处理方法
O S 阈值 方法 在 图像 分 割 中应 用得 十分 普 遍 。 TU 传统的 O S T U阈值方 法 简 洁 , 在 处 理 大 像 素 图像 时 但 处 理速度 很慢 , 而且 其 阂值 单 一 , 处理 后 的图像效 果不 理 想… 。曾经有相 关研 究人 员对 O S T U阂值算 法 作过
相关 的改 进工作 , 以优 化其 处 理 速 度 。本 方 法是 在 人体 关键 三维尺 寸测 量 的图像预 处理 中对 O S T U阈值
与背景有效地分离开来 , 使两部分类间方差取最大值 。 该方 法计算 简 单 , 性 强 。 适应 设 - ,) 图 像 在 ( , ) 的 灰 度 值 , 一 幅 高 厂 Y是 ( zY 处 则 为 像 素 、 宽为 ,像素 的 图像 , 二维矩 阵可描述 为 v 其
设 n 为灰度级为 i 的像素个数 , 则其 出现的概率
为
ni ,^ 、
P 丽 t
L
1 传 统的 O S T U阈值 方 法
O S 即最 大类 问方 差 法 , 一 种重 要 的二 值 化 T U, 是
当用 阈值 t 0≤t T一1 将图像二值化时, ( ≤ ) 令背景 图像 的概率 和为
Absr c : t a t OTS t r s od meh d h s a v r d a g fa p ia in n t e i g e me a in frissr— U h e h l t o a e y wi e r n e o p lc t s i h ma e s g ntt o t i o o e p iiy a n u tv .Th r di o l lct nd it iie e ta t na OTS t r s od meh d h s b e mp o e n o de o e t b ih a g o i U h e h l t o a e n i r v d i r r t sa l o d s fu ain frf au e e ta t n a d t e ft n f3 i ma e p o e swih c lb ain p ae. p rme t h w o nd to o e t r xr ci n h it g o n i g r c s t ai r to lt Ex e i n ss o o i D t a h smeh d h s a g o fe ti u n b d ma e s g n a in a d p st fe e te vr n n . h tt i t o a o d e fc n h ma o y i g e me t t nd a a t o di r n n io me t o f
基于SMPL模型的人体姿态估计
第38卷第3期__________________________计算机仿真_____________________________2021年3月文章编号:1006 -9348(2021 )03 -0292 -06基于S M P L模型的人体姿态估计李健,杨镖镖,张皓若(陕西科技大学电子信息与人工智能学院,陕西西安710021)摘要:针对目前人体形变模型中姿态估计算法容易出现误差、信息缺失等问题,提出一种利用深度相机获取的人体三维信息 来优化模型的方法。
通过深度相机I C i n e c t获取的三维骨架信息,与S M P L模型进行配准,修正原始的模型姿态,得到一个接近人体真实姿态的模型。
实验结果表明,融合人体三维信息后,模型的准确性得到一定程度上的提高。
关键词:形变模型;姿态估计;深度相机;三维骨架中图分类号:TP391 文献标识码:BH u m a n Pose Estimation Based on S M P L ModelLI Jian, YANG Biao - biao,ZHANG Hao - ruo(College of Electronic Information and Artificial Intelligence,Shaanxi University of Science and Technology,Xi'an Shanxi710021, China)A B S T R A C T:Aiming at the current pose estimation algorithms in human body deformation models that are prone t oerrors and lack of information,a method for optimizing the model i s proposed,using the three- dimensional information of the human body obtained by the depth camera.The three- dimensional skeleton information obtained by the depth camera Kinect was registered with the S M P L model,and the original model pose was corrected t o obtain a model close to the real pose of the human body.The experimental results show that the accuracy of the model i s improved to a certain extent after fusing the three- dimensional information of the human body.K E Y W O R D S:MoqDnable model;Pose estimation;Depthi引言三维人体建模一直以来都是三维重建研究领域一个比 较富有挑战性且比较重要的部分,其本质在于将现实世界中 的人体以三维数字化的方式在计算机中存储并表示。
基于 PCL 的人体实时 3D 重建技术的研究与实现
量的研 宄工作 。He m- y借助 K i n e c t 相机对室 内 场 景进 行三维重 建。通过 Ki n e c t 获得室 内的三 维模型,但得到的模 型较为粗糙,模型上有很 多 的黑 色斑 点,速度 也只有 2 r - p s左右 ,需要 进 一步提 高算法 的精度与性能 。2 0 1 1年微软英
因子,设定 2 g l =1 ,同时 :
● , ---- --- --- --- ——- --- --一
一 十 c 【 一 +墨 s 十= l … n U = U +c 【 一 d t 2 d t l
一
d2 0
dO
结 论表 明,利用 Ma t l a b处理 一些 自由振动 的 基本 问题 具有较 高的效率,并且结论清晰 ,有
体 重 建 方 法 ,借 助 图 形 显 卡 GP U 硬件 设备,
识别等技术 的需求 日益增大 ,对于 一些沉浸 式 建 ,融合 不同时序 的深度图数据并重建 出目标
家的3 D人物模 型置身于游戏场 景中,玩家会 到实时效果 ,但 不适合 于动 态场景重建。刘鑫
提 出了一种简单 易用 的粗标 定方法和 全 自动的 快速物体重建方法 。针对 Ki n e c t F u s i o n需要大
技术非常重要。 近 年 来 国 内外 大 量 学 者 对 3 D 重 建 做 了大
项 目。K i n e c t F u s i o n技术 允许用户 手持 Ki n e c t 设备在 室内场景 自由移动 ,仅利用来 自 Ki n e c t 的深度 数据 实时 跟踪传 感器 的三维 姿态 和重 物 的几何全局三 维模 型。尽 管这种 方法可 以达 等 人给 出了一 种基于 Ki n e c t 传 感器 的快速 物
深度学习的多视角三维重建技术综述
深度学习的多视角三维重建技术综述目录一、内容概览 (2)1.1 背景与意义 (2)1.2 国内外研究现状 (3)1.3 研究内容与方法 (5)二、基于单目图像的三维重建技术 (6)2.1 基于特征匹配的三维重建 (7)2.1.1 SIFT与SURF算法 (8)2.1.2 PCA与LDA算法 (10)2.2 基于多视图立体视觉的三维重建 (11)2.3 基于深度学习的三维重建 (12)2.3.1 立体卷积网络 (14)2.3.2 多视图几何网络 (15)三、基于双目图像的三维重建技术 (17)3.1 双目立体视觉原理 (19)3.2 基于特征匹配的双目三维重建 (20)3.3 基于深度学习的双目三维重建 (21)3.3.1 双目卷积网络 (22)3.3.2 GANbased双目三维重建 (23)四、基于多视角图像的三维重建技术 (25)4.1 多视角几何关系 (26)4.2 基于特征匹配的多视角三维重建 (27)4.2.1 ORB特征在多视角场景中的应用 (28)4.2.2 ALOHA算法在多视角场景中的应用 (29)4.3 基于深度学习的多视角三维重建 (30)4.3.1 三维卷积网络(3DCNN)在多视角场景中的应用 (32)4.3.2 注意力机制在多视角场景中的应用 (33)五、三维重建技术在深度学习中的应用 (35)5.1 三维形状描述与识别 (36)5.2 三维物体检测与跟踪 (37)5.3 三维场景理解与渲染 (39)六、结论与展望 (40)6.1 研究成果总结 (41)6.2 现有方法的局限性 (42)6.3 未来发展方向与挑战 (44)一、内容概览多视角数据采集与处理:分析多视角三维重建的关键技术,如相机标定、图像配准、点云配准等,以及如何利用深度学习方法提高数据采集和处理的效率。
深度学习模型与算法:详细介绍深度学习在多视角三维重建中的应用,包括卷积神经网络(CNN)、循环神经网络(RNN)、生成对抗网络(GAN)等,以及这些模型在多视角三维重建任务中的优势和局限性。
BJUT_3D三维人脸数据库及其处理技术
计算机研究与发展ISSN 100021239ΠCN 1121777ΠTPJournal of Computer Research and Development 46(6):100921018,2009 收稿日期:2008-06-25;修回日期:2008-11-25 通讯作者:孙艳丰(yf sun @ ) 基金项目:国家自然科学基金项目(60533030,60825203);北京市自然科学基金项目(4061001);国家科技支撑计划基金项目(2007BA H13B01)BJUT 23D 三维人脸数据库及其处理技术尹宝才 孙艳丰 王成章 盖 赟(北京工业大学计算机学院多媒体与智能软件技术北京市重点实验室 北京 100124)(yinbc @ )BJ UT 23D Large Scale 3D F ace Database and Information ProcessingYin Baocai ,Sun Yanfeng ,Wang Chengzhang ,and Ge Yun(B ei j ing M unici pal Key L aboratory of M ultimedia and I ntelli gent S of tw are Technolog y College of Com p uter S cience and Technology ,B ei j ing Universit y of Technolog y ,B ei j ing 100124)Abstract 3D face recognition has become one of t he most active research topics in face recognition due to it s robust ness in t he variation on po se and illumination.3D database is t he basis of t his work.Design and ruction of t he face database mainly include acquisition of prototypical 3D face data ,p reprocessing and standardizing of t he data and t he st ruct ure design.Currently ,BJ U T 23D database is t he largest Chinese 3D face database in t he world.It contains 1200Chinese 3D face images and p rovides bot h t he text ure and shape information of human faces.This data resource plays an important role in 3D face recognition and face model.In t his paper ,t he data description ,data collection schema and t he po st 2p rocessing met hods are provided to help using t he data and f ut ure extension.A 3D face data dense correspondence met hod is int roduced.Dense correspondence means t hat t he key facials point s are caref ully labeled and aligned among different faces ,which can be used for a broad range of face analysis tasks.As an applicatio n ,a pose estimation and face recognition algorit hm acro ss different po ses is p ropo sed.Eexp remental result s show t hat t he propo sed algorit hm has a good performance.K ey w ords 3D face database ;face recognition ;3D face model ;morp hable model ;mesh resampling摘 要 BJ U T 23D 是目前国际上最大的中国人的三维人脸数据库,其中包括经过预处理的1200名中国人的三维人脸数据,这一数据资源对于三维人脸识别与建模方面的研究有重要意义.首先介绍了BJ U T 23D 数据库的数据获取条件、数据形式,并针对数据库建立过程中数据预处理技术进行了讨论.最后作为数据库的直接应用,进行了多姿态人脸识别和人脸姿态估计算法的研究.实验结果证实,该算法具有良好的性能.关键词 三维人脸数据库;人脸识别;三维人脸模型;形变模型;网格重采样中图法分类号 TP391 经过40多年的发展,尤其是近10年的研究,人脸识别的理论和算法均取得了长足的进步,但这些理论和算法主要针对输入是二维人脸图像而开展的.理论和实验研究已经证实,二维图像中人脸姿态或成像时光照条件的变化对算法的识别性能有很大影响.而更实用的人脸识别算法应该是在摄像环境不可控、用户不配合的情况下使用.所以目前算法的缺陷大大限制了人脸识别技术在实际中的广泛应用.如何解决不同姿态、不同光照条件下的人脸识别问题是二维人脸识别研究的瓶颈,也是当前的研究热点.与二维人脸图像数据相比,三维人脸数据中包含人脸的空间信息,这是人脸本身固有的特征信息,对姿态、光照条件的变化具有鲁棒性.因此,近年来利用三维人脸数据进行人脸识别的途径已经引起人们的广泛关注,也出现了一些识别算法[1].与二维图像不同,三维人脸数据有多种不同的形式,如人脸的深度数据、曲面点的三维坐标及其点之间的连接关系、面部轮廓线数据等.针对不同形式人脸数据的识别算法也需要相同形式的数据资源.人脸数据库对人脸识别算法的研究与开发、模型训练、算法性能比较测试是不可缺少的数据资源,尤其在基于统计学习算法占主导地位的人脸识别领域,模型训练所采用的人脸库的规模、覆盖的人脸数据的变化很大程度上影响算法精度和鲁棒性;不同算法性能测试所用到的数据库的规模和属性同样决定了评测的合理性和测试结果的有效性.所以,随着三维人脸识别研究的不断深入,建立各种数据形式的三维人脸数据库,为同行提供模型训练数据资源、算法研究与比较的数据平台,具有重要的意义.经过长期的研究积累,我们研究小组采用Cyberware3030R G BΠPS激光扫描仪获取三维人脸原始数据,通过对齐算法构建了可进行线性计算的三维人脸数据库BJ U T23D[2],该库包含1200个中性表情的中国人的三维人脸样本数据,其中部分数据有多个样本.扫描后的数据是由点的纹理信息、三维坐标信息及其点之间的连接关系构成.该数据库目前可以为诸如人脸跟踪、识别、动画等研究人员提供很好的数据资源.本文先对三维人脸数据的采集环境、条件、数据形式进行了介绍,然后研究了数据库建立过程中的数据获取、数据处理、数据对齐等相关技术.这些技术为数据库的使用及其相关的研究工作会提供一些有益的帮助.1 相关的三维人脸数据库综述目前已经有一些包含三维信息的三维人脸数据库,按着数据库的构造方法可以将它们分为基于多视角几何信息的方法、基于结构光的方法和基于三维扫描仪的方法.CMU的FIA数据库是基于多视角几何信息的三维数据库[3],其中数据是用6个摄像机从3个不同角度获取20s的视频信息,然后用计算机视觉的方法恢复三维信息得到的人脸数据.由于没有对视频人脸进行标定,这类方法是用复杂的人脸跟踪算法重构人脸的形状信息,所以其效果受人脸跟踪效果的影响较大.3D2RAM是基于结构光的方法建立的三维人脸数据库[4],它用一个照相机和放映机获取人的3D坐标信息,建立一个含129人的3D人脸数据库.该库样本的坐标信息精度高,但对于面部的眼睛或阴影部分无法获取其3D信息,导致面部曲面形状不完全.由于三维扫描仪能够获取人脸部较精确的形状和纹理信息,因此成为建立三维人脸数据库非常好的工具.在GavabDB数据库中[5],使用Minolta V I2700数字转换器获取61个有表情变化的从不同视角扫描的人脸数据.由于有些视角具有不可见部分,为获取完整的三维人脸表面信息还需要进行适当的后处理.Cyberware扫描仪通过一次扫描可以获取人不同视角的完整数据,因此获取的数据准确性好,大大简化了后处理工作,用该设备建立的U SF三维人脸数据库[6]有200人的三维人脸数据,由于每个样本的形状和纹理信息维数很高,因此对于人脸数据处理与分析方面的研究,这样规模的数据还远远满足不了需要.2007年, Huang的研究小组利用Cyberware扫描仪建立了一个含有475人的三维人脸数据库[7],样本主要有中性和微笑两种表情,年龄分布在19~25岁之间,这一数据库可以缓解现有数据库规模小的缺陷,也为人脸识别、跟踪、对齐、动画等相关研究工作提供重要基础.2 BJUT23D数据库介绍BJ U T23D的三维人脸数据通过Cyberware 3030R G BΠPS激光扫描仪获取.扫描时,一条红色激光线从扫描仪里面发射出来,照射到头部Π脸部,经过激光线的反射,被仪器接收和计算.扫描时要求被扫描者端坐在旋转平台的一个高度适中的椅子上,并直视前方,以保证头部在扫描仪的中部.扫描期间需保持端坐不动和静止的脸部表情直至扫描结束.该扫描仪通过一次扫描得到人头部的几何信息和彩色纹理信息,并使用柱面坐标记录几何信息.扫描精度为圆周方向(用φ表示,0≤φ≤2π)489个采样点,轴方向(用h表示,0≤h≤300mm)478个采样点,扫描半径(用r表示)在260mm~340mm之间.每一0101计算机研究与发展 2009,46(6)个几何采样点对应一个24位(用R,G,B表示)纹理像素点,并以489×478大小的纹理图像存储.Fig.1 Cyberware laser scanner.图1 Cyberware激光扫描仪1)光照条件用激光扫描仪扫描人脸时可以同时获取人脸的三维几何信息和彩色纹理信息,人脸纹理的好坏直接影响到所创建人脸库的质量及应用价值,并给基于人脸库进行的人脸建模、人脸识别、人脸动画等方面的研究带来很大的影响.为了得到统一的、较为真实的纹理信息,我们的数据采集在同一个扫描间进行,并对光照条件做了一定的限制.扫描间是一个特定、封闭的环境,其四周设置4盏专用的照明灯,由前后左右4个方向指向被扫描对象,并保证扫描对象各个方向具有相同的光照强度.为了模拟正常的环境光,扫描间的4盏灯都是60W的白炽灯,同时设置扫描间的墙壁为通体白色,这样4盏灯相互照射后,从墙壁上返回的光形成了一个统一对环境光的模拟制式.由于镜面反射对模型的生成会产生较大的影响,所以要求光的强度在一定的范围内.所有扫描工作都在扫描间完成,这样既保证对环境光的光照条件近似模拟,也保证所有三维人脸数据的光照条件完全相同.2)饰物由于扫描仪对头发等深色部位的扫描效果比较差,而人脸研究仅对人的面部区域感兴趣,因此要求被扫描者佩戴泳帽并将头发全部包住.该泳帽一般应选择颜色较鲜明的色彩以便和面部区域分离,方便后期处理.此外还要求被扫描者不能化妆、不戴眼镜等任何饰物.3)数据规模及形式BJ U T23D三维人脸数据库共包括1200名中国人的三维人脸数据,其中500人的数据对外公开发布,男女各250人,年龄分布在16岁~49岁之间,所有人脸数据均是中性表情.部分人脸有3个样本,以便于人脸识别研究.三维扫描仪进行一次柱面扫描就是对人的头部表面进行高密度采样,采样信息包括空间几何信息和彩色纹理信息.空间几何信息由两部分组成,既空间三维采样点的坐标信息(用(X,Y,Z)表示,约2×105个点),和由网格描述的这些点之间的连接关系,网格组成的三角面片约有4×105个.彩色纹理信息是采样点柱面投影得到的二维图像,以普通图像格式存储,图像的长和宽由投影参数、扫描设备硬件与操作平台决定,本文得到的纹理分辨率为478×489,如图2(c)所示.为建立几何信息同纹理信息之间的联系,在几何信息中还存储几何采样点在纹理信息文件中对应纹理点的归一化坐标,归一化坐标表明本采样点在纹理信息文件中对应纹理点位置的索引信息,几何信息和纹理信息之间的关系就是通过该索引信息建立起来的.图2是扫描后的三维人脸及其对应的几何、纹理信息.Fig.2 3D prototytical face data.(a)Scanned3D face;(b) Shape data;and(c)Texture image.图2 三维原始人脸数据.(a)三维人脸;(b)几何数据;(c)纹理图像4)人脸数据的命名规则在数据库中,每个三维人脸数据由单一的文件组成,文件按照统一的规则进行命名.文件名有6部分信息,命名规则为性别+I D+年龄+表情+内容+发布情况.具体表示形式如下:x_xxxx_Ax_Ex_Cxxxx_Rx1 2 3 4 5 6每部分的具体含义为:1表示性别区域,由一个字母组成.“M”表示男性,“F”表示女性.2表示I D区域,由4个数字组成.表示该文件在数据库中的I D,当组成文件I D所需数字不足4位时剩余高位用0补齐.3表示年龄区域,由一个字母“A”和一位数字组成.A是年龄的英文Age的首字母.由于研究时1101尹宝才等:BJ U T23D三维人脸数据库及其处理技术关心的是人脸数据所处的年龄段,所以只记录每个人脸数据所属的年龄段,并用1位数字表示.每个年龄段的代表数字如表1所示:T able1 Correspondence of N otation and Age表1 年龄符号对应表Notation Age Range110-19220-29330-39440-494表示表情区域,由一个字母“E”和一位代表表情的字母组成.表情字母表示人脸数据具有的表情.每个表情代表字母的含义如表2所示.目前数据库中所有人脸都是中性表情.T able2 Correspondence of N otation and Expression表2 表情符号对应表Notation ExpressionN NormalH HappyP SurpriseA Angry5表示数据内容区域,由5位字母组成.C是Content的首字母,后面的4位字母“t rim”表示该数据经过预处理.6表示发布标记区域,由两位字母组成.首字母为R,第2个数字表示是否已经发布,其中“0”表示未发布,“1”表示已发布.目前发布的数据是无法直接读取的,用户需要使用我们提供的工具将原始数据转换成可读的文本形式.转换后的文本数据包含3个部分信息:顶点信息、纹理信息、网格信息.①顶点信息:顶点信息由密集采样点组成,三维人脸模型的顶点信息就是由这些采样点构成的.数据的表示形式为Vertex1:X=-87.616997,Y=-12.994000,Z=37.046001, Vertex1表示序号为1的顶点,X,Y,Z分别表示该点的3个坐标值.②纹理信息:纹理信息描述了每个顶点的对应的纹理值.数据表示形式为Text ure1:R=144,G=99,B=85,Text ure1表示顶点1的像素值,R,G,B分别表示点在3个颜色通道的值.③网格信息:网格信息描述顶点之间的连接关系.库中的数据使用三角网格来描述顶点之间的连接关系.数据的表示形式为Triangle1:Fi rst V ertex=36407,Second V ertex=36310,Thi r d V ertex=36392,Triangle1表示第1个三角网格,其后的3部分信息分别表示依附该三角网格的3个顶点的标号.3 建立BJUT23D的信息处理技术扫描后的数据还有许多信息缺失和不平滑的情况,另外肩部和头部的信息对于人脸识别及相关研究是无用的,它们的存在将会增加数据规模,为后续数据库的应用增加计算量,所以需要对扫描后的数据进行预处理.3.1 面部数据的分离和预处理扫描人脸时,由于光照条件的细微变化、人脸表面的不光滑性以及头发等复杂结构的影响,射在人脸表面的光线在返回时运动轨迹发生偏离,会使扫描后得到的三维人脸数据发生变形,出现一些毛刺和空洞等现象.在对耳朵、下巴等部位扫描采样时,捕捉不到的三维信息也会形成空洞,有些地方则因为局部表面不光滑会产生毛刺.对此,我们采用交互的方式,使用插值、平滑等预处理方法弥补三维人脸上的空洞并去掉毛刺.面部数据的分离是将人脸面部区域从整个头部扫描数据中分离出来,去除头发、肩等部位的三维数据.我们使用的方法[8]首先确定分离的边界.由于在三维人脸几何数据上直接进行边界关键点标定和边缘自动检测十分困难,所以借助人脸的纹理图像来进行不规则边界的确定,即在三维人脸对应的二维纹理图像上确定面部发际边界和耳朵部位的边界,然后通过纹理几何的对应关系,找到三维人脸几何数据相应的分割边界.对于耳下的垂直切面和脖子下的水平切面则直接在几何数据上确定,用来去除肩部以下和耳朵后面的数据.确定了人脸的分离边界后,即可将人脸的面部区域从原始扫描数据中分离出来.如图3所示为分离后的三维人脸,图3(a)是分离后的几何形状及其对应的纹理图像,图3(b)是分离后不同角度下的三维人脸面部图像.2101计算机研究与发展 2009,46(6)Fig.3 3D face data.(a )The cutted shape and texture for 3D face and (b )Frontal and side 3D face.图3 三维人脸数据.(a )分离后的三维人脸几何信息和纹理信息;(b )正面、侧面3D 人脸 为保证三维人脸数据的一致性,在数据获取时要求被扫描者保持指定的姿态和位置,既目视前方,头部保持垂直.但实际扫描得到的人脸样本的姿态不可避免地存在一定偏差,因此需要对不同的人脸数据进行坐标矫正,将不同的三维人脸数据统一到同一个坐标系.切割后的三维人脸数据接近一个柱面分布,所以用三维人脸数据的离散点集来拟合一个柱面,用柱面的中心轴作为三维人脸数据的新的垂直坐标轴(Z 轴),过鼻尖点且与新的垂直坐标轴垂直相交的直线作为新的前向坐标轴(Y 轴),新的X 坐标轴则由Y 轴和Z 轴的叉乘运算确定.通过坐标变换可以得到每个三维人脸在新的坐标系下的坐标值,经过坐标变换的所有三维人脸数据均变换到朝向、姿态相同的坐标系下.如图4是三维人脸的坐标矫正示意图,其中Z 是矫正后的垂直轴,Z 0是矫正前的垂直轴,X ,Y ,Z 是矫正后的坐标轴.Fig.4 Recorrected face by a cylinder.图4 人脸柱面矫正3.2 人脸数据的规格化由于人脸的个性化差异,扫描得到的人脸数据有很大差别.首先是构成三维人脸的点数和面数不同,这样的数据使基于形变模型的三维人脸重建无法进行,也不利于人脸的统一表示;其次是点或面的排列与人脸特征无关.因此建库时对预处理过的三维人脸数据进行了规格化,规格化后的数据既可以用统一的向量形式来表示,又保证所有的三维人脸数据特征对齐.规格化[9]的第1步是建立不同三维人脸数据间的稠密对应,既根据人脸面部特征建立不同的三维人脸数据间点到点的一一对应关系.例如,已知一个人脸上的鼻尖点可以根据对应关系找到另外一个人脸上的鼻尖点,如果以某一个人脸作为标准人脸,就可以将人脸数据根据标准人脸的点和面进行有序化.事实上,在三维数据上建立基于特征的点对点的稠密对应非常困难.首先不同人脸的个性差异导致三维人脸的几何差异很大,而且还要考虑纹理特征信息的对应;其次三维人脸数据是稠密点集,数据量很大,因此很难使用一般方法建立这种对应关系.文献[9]考虑到扫描人脸数据是以柱面的形式表示,将三维人脸展开为二维形式,借助在二维图像上光流对应计算的方法建立三维数据的对应.但光流算法的前提假设是两幅图像间光流的变化是连续光滑的,对于比较相像的两幅人脸可以近似地看做视频序列的相邻两帧图像,此时对应计算效果比较好.但对于形状差别较大的人脸数据,光流算法的前提假设不满足,对应计算将产生较大的误差.另外,这种将复杂三维几何进行柱面展开形成二维图像的方法实际上损失了很多三维信息,所以其对应计算的效果不是很好.为此,BJ U T 23D 数据库采用基于网格重采样的对齐方法.网格重采样是通过原始数据建立网格和曲面的常用方法,它摒弃了在二维图像上的处理方法,直接在三维空间进行,能够更多更精确地保留原数据的三维信息.利用重采样可以将不规则的多边形网格转化为规则的网格的特点,该方法将不同网格数和空间点数的原型人脸全部规格化为采样点数、网格数、拓扑完全一致的原形人脸,且重采样后的人脸同一相对位置的点都固定地代表了同一个面部特征,在此基础上能够直接进行不同人脸的点与点的线性组合,从特征的角度更具有线性组合的合3101尹宝才等:BJ U T 23D 三维人脸数据库及其处理技术理性.人脸对齐主要由人脸分片和网格重采样两个计算过程组成.1)人脸分片人脸分片将三维人脸分割成多个面片为网格重采样做准备.目前自动分片算法[10]的研究主要是针对纹理映射领域,虽然能够达到自动,但分片的形状不确定,无法保证所有人脸分出的同一片包含的人脸特征相同或相近.Krishnamurt hy 等人[11]提出的交互的人工分片方法,由用户选取一序列点,然后采用贪心图算法,在网格连线上寻找相邻点的最短路径,这些路径则形成分片的边界.该方法以网格的连接关系为基础进行分片操作,实现比较复杂.本文根据三维人脸数据包含三维几何与纹理两部分数据的特点,基于面部纹理图像手工交互标定特征点,然后以特征点的连线作为分片边界,划分特征区域,最后通过柱面映射找到三维人脸网格上的分割结点和分割线.考虑到重采样后网格要求比较均匀,所以采用面积比较接近的矩形进行分割.如图5所示是三维人脸分割的结果,一个人脸被分为122个面片.Fig.5 Divide the 3D face into patches.图5 三维人脸分片2)三维人脸网格重采样对于初始分片后的三维人脸通过网格重采样进行网格细分.重采样时首先要确定每个面片的4个角点.对于规格的矩形面片,直接使用其4个顶点作为角点;对分割后处于边界的不规格面片,利用最小内角法或长宽比法确定4个角点.为了能够进行均匀重采样,对所有矩形的边长度进行统计,然后进行等形线的均匀初始化,这样不仅使边界边的划分更均匀,还可以减少边界曲线提取的计算量.对等形线初始化后的网格进一步的细分,利用点的合力调整新获得弹性点的位置,从而获得了每一面片的均匀重采样网格.对每个面片重复以上重采样过程,直到重采样的密度与原始三维人脸数据的密度比较接近为止.如图6(c )是对人脸数据进行5次重采样的结果,约由13×104个点,25×104个三角面组成.详细的三维人脸重采样过程参见文献[8].Fig.6 Face mesh resampling.(a )The ioslines initialized ;(b )One time mesh resampling ;and (c )Five times mesh resampling.图6 人脸重采样.(a )初始化网格;(b )1次重采样的结果;(c )5次重采样结果经过上面的重采样处理,所有三维人脸具有相同数量的点和三角面片,且整个网格的拓扑结构完全相同,从而可以建立三维人脸数据间严格的一一对应,这样的对应可以将所有三维人脸表示为统一的表示形式.另外,由于这里的分片是基于特征的分片,因此重采样后点的对应也是基于特征的稠密对应.图7是分别基于网格重采样的方法和光流的方法进行人脸对齐的结果.从图中可以看出,基于网格重采样方法的对齐效果好于光流的算法.Fig.7 The correspondence based on mesh resampling and optical flow.(a )The correspondence based onmesh resampling and (b )The correspondence based on optical flow.图7 基于重采样算法和光流算法的对齐效果比较.(a )基于网格重采样方法的对齐结果;(b )基于光流方法的对齐结果4101计算机研究与发展 2009,46(6)4 BJUT 23D 的应用———多姿态人脸识别算法研究[12] 实用的人脸识别系统应该是在用户不配合的情况下使用,此时人的头部会以多种姿态的形式出现,所以进行人脸识别必须考虑头部姿态的变化,多姿态人脸识别也一直是人脸识别研究的难点.作为三维人脸数据库BJ U T 23D 的直接应用成果,我们小组进行了多姿态人脸识别研究,并借助于三维人脸形变模型[9]实现了对人脸的姿态估计.4.1 算法整体框架根据二维人脸库(gallery )中的人脸图像(每个人只需要一幅二维人脸图像),采用三维人脸形变模型重建其对应的三维人脸.在识别阶段采用该三维人脸模型估计二维测试图像中人脸的旋转角度,并以测试图像中人脸在3个方向上的旋转角度为基准,将人脸库(gallery )中重建的三维人脸旋转到相同视角的同一姿态.最后,采用相同姿态下人脸图像进行人脸对象的分类识别.算法的整体框架如图8所示:Fig.8 The f ramework for multipose face recognition.图8 算法整体框架4.2 三维人脸形变模型形变模型的基础是线性组合理论,即使用一类对象中若干典型样本张成该类对象的一个子空间,用子空间基底的组合近似地表示该类对象的特定实例.使用形变模型进行三维人脸建模分为两个过程:一是建立模型,包括原始人脸数据的获取、人脸数据的对应和建立组合模型;二是针对特定人脸图像进行二维人脸图像与模型的优化匹配,实现三维人脸的重建.建立形变模型使用的三维人脸数据源于BJ U T 23D 数据库,所有数据均经过前述的规格化处理,实现了三维人脸的点到点的对应.第i 个三维人脸数据用形状和纹理向量表示为S i =(X i 1,Y i 1,Z i 1,X i 2,…,X in ,X in ,X in ,)T,T i =(R i 1,G i 1,B i 1,R i 2,…,R in ,G in ,B in )T,1≤i ≤N ,(1)其中N 三维人脸的总数,n 是三维人脸顶点的个数.由于原型人脸数量比较大(N =200),且人脸数据间有一定相关性,因此使用主元分析方法(PCA )对人脸形状和纹理向量进行处理,压缩数据量,消除数据间的相关性,得到形变模型的表示形式:S model =S -+∑m-1i αi s i,T model =T -+∑m-1iβi t i,(2)其中S -,T -是原型三维人脸的平均形状和纹理向量,m 是主元个数,s =(s 1,s 2,…,s m -1),t =(t 1,t 2,…,t m -1)是形状和纹理的主元向量组,α=(α1,α2,…,αm -1),β=(β1,β2,…,βm -1)是模型的组合参数.4.3 模型匹配模型匹配就是将形变模型与输入二维人脸图像进行优化匹配,使模型人脸与输入人脸的匹配误差最小,得到模型的组合参数.本文用图像对应像素点的灰度差的平方和作为两图像的匹配误差,即E I =∑x ,y|I input (x ,y )-I mod el (x ,y )|2,(3)其中I input 是输入的人脸图像,I mod el 是三维模型人脸在某视点观察得到的人脸图像,可通过投影模型和5101尹宝才等:BJ U T 23D 三维人脸数据库及其处理技术。
预加权调制密集图卷积网络三维人体姿态估计
预加权调制密集图卷积网络三维人体姿态估计马金林;崔琦磊;马自萍;闫琦;曹浩杰;武江涛【期刊名称】《计算机科学与探索》【年(卷),期】2024(18)4【摘要】图卷积网络(GCN)日益成为三维人体姿态估计(3D HPE)的主要研究热点之一,使用GCN对人体关节点之间的关系建模的方法使三维人体姿态估计获得了良好的性能。
然而,基于GCN的三维人体姿态估计方法存在过平滑和未区分关节点与相邻关节点重要性的问题。
为解决这些问题,设计了调制密集连接模块(MDC)和预加权图卷积模块,并基于这两个模块提出了预加权调制密集图卷积网络的三维人体姿态估计方法(WMDGCN)。
针对过平滑问题,调制密集连接通过超参数α和β更好地实现特征重用(超参数α表示第l层和之前各层总特征的权重比例,超参数β表示之前各层特征到第l层的传播策略),从而有效地提高特征的表达能力。
针对未区分关节点与相邻关节点重要性的问题,使用预加权图卷积为当前关节点赋予更高的权重,并对当前关节点及其相邻关节点使用不同的权重矩阵,更有效地捕获人体关节点特征。
Human3.6M数据集上的对比实验结果表明,该方法在参数量和性能上均取得了最佳性能,WMDGCN的参数量、MPJPE和P-MPJPE值分别为0.27 MB、37.46 mm和28.85 mm。
【总页数】15页(P963-977)【作者】马金林;崔琦磊;马自萍;闫琦;曹浩杰;武江涛【作者单位】北方民族大学计算机科学与工程学院;图像图形智能信息处理国家民委重点实验室;北方民族大学数学与信息科学学院【正文语种】中文【中图分类】TP391【相关文献】1.加权SVDD算法在人体姿态估计中的研究与应用2.基于改进CNN和加权SVDD算法的人体姿态估计3.基于密集深度插值的3D人体姿态估计方法4.基于比例密集聚合的轻量级人体姿态估计方法5.融入注意力和密集连接的轻量型人体姿态估计因版权原因,仅展示原文概要,查看原文内容请购买。
