单目深度估计文献翻译unsupervised monocular depth estimation with left-right consistency
左右(视差)一致的非监督式单目深度估计
摘要
以学习为基础的方法已经在对单张图片的深度估计上取得了可观的结果。大多数现有的方法是将深度预测作为监督式的回归问题来处理,然而这种方式需要大量相应的真实深度数据用于训练。然而,单单从复杂环境中获取高质量的深度数据就已经很有难度了。我们将在本文中对已有方式进行创新,不再对深度数据进行训练,而是训练更容易获得的双目立体连续镜头。
我们提出了一种新颖的训练目标,即使在缺少真实深度数据的情况下,仍然能够使用卷积神经网络来完成单张图片的深度估计。利用极线几何限制,我们通过训练有图像重构损失函数的网络生成了视差图像。我们曾发现单独进行图像重构会导致深度图像质量很差。为了解决这个问题,我们提出了一个新颖的训练损失函数,可以使左右图像产生的视差趋于一致,以此来提高当前方式的表现和健壮度。我们的方法在KITTI驾驶数据集上展示出艺术般的单目深度估计效果,甚至优于基于真实深度数据的监督式学习的效果。
1. 简介
在计算机视觉领域,对图片进行深度估计已经有了很久的历史。目前的成熟方式依赖于连续动作、X射线下的形状、双目和多视角立体模型。然而,多数的上述技术是基于可获取相关场景的观测数据的假设。其中,数据可能是多角度的,或者观测是在不同的光线环境下进行的。为了突破这个限制,近期涌现出大量在监督式学习下对单目深度识别的讨论。这些方法试图直接在线下通过大量真实深度数据训练的模型来对图像中的每一个像素进行深度估计。这些方法虽然已经取得巨大的成功,但是是建立在可获取大量图像数据集和相应的像素深度的情况下的。
在单张图像里获取不受外表干扰的场景形状是机器感知的基础问题。很多此类的应用,比如在计算机图形学中合成对象的插入、在计算机摄影学中对深度的合成、机器人抓握,会使用深度为线索进行人体姿态估计、机器人辅助手术和电影业中2D向3D的自动转换。从一个或多个摄像机获取准确的深度数据对于自动驾驶来说是极其重要的,通常使用的设备是昂贵的激光摄像机。
在单目深度估计中,通过利用焦点等为线索、依照熟悉目标的大小和在光线、阴影以及遮挡下的外形进行比例缩放等方式,人们已经取得了不错的成果。这种自顶向下和自底向上的线索的结合连接起对全场景的理解和我们对深度准确估计的能力。本文中,我们采取另一种办法,在训练中以图像重构的方式来对待自动深度识别。我们的全连接模型不需要任何深度数据,反而通过训练可以立即生成深度数据。通过学习,它可以预测/有摄像机基线的/矫正立体图像对/的像素级别相关度。现有的一些方法也解决了上述问题,但是仍然存在一些限制。比如非完全可辨别的、训练效果非最优的或者图像生成模型不能扩展到大输出分辨率。在对这些方法的优化中,我们通过新颖的训练目标和加强的网络模型,显著地提高了最终效果。
图1 我们在KITTI 2015上的深度预测结果。从上至下:输入图像,真实视差数据,我们的结果。
我们的方法能够对如街道标志和杆子之类的薄结构进行深度估计。
图1展示了一个我们算法的运行结果。在一个时下的GPU上运行对一个512*256的图像的稠密深度预测,我们的方法速度很快,只需要35毫秒。特别的,我们做出了以下贡献:
1) 一个执行端到端非监督式单目深度估计的网络结构,其中一个新颖的训练损失函数可以保证左右深度的一致。
2) 一个对多种训练损失函数和图像生成模型的评估,显示出我们的方法具有很好的效果。
3) 除了在一个极具挑战性的驾驶数据集上展示出艺术般结果,我们的模型还推广到三个不同的数据集,包括一个已经开源的、由我们自己采集的全新城市户外数据集。
2. 相关工作
目前有大量对于图像的深度估计研究,要么使用不同视角或者瞬时序列获取成对的或多个重叠图片,要么对假定固定位置的摄像机和静态场景改变光线。这些方法很典型的建立在必须有相关场景的多于一个输入图像的条件上。在此,我们集中于只使用一张输入图像的单目深度估计研究,并且不对场景几何学和目标呈现类型做任何假设。
基于学习的立体模型
绝大多数立体估计算法都有用于计算图像中每一像素与其他图像中任何一个像素的相似度的数据项。典型地,立体数据对是被矫正过的,因此视差(如按比例放缩的逆深度)估测问题可被转化为对每个像素的一维搜索问题。最近研究表明,将匹配相似作为一个监督式的学习问题并训练一个预测一致性的功能,将能够获得远优于手动定义的相似度数据,而且将这种双目一致性搜索当做多类别的分类问题来对待,具有在结果质量和速度上双重的优势。相比单纯的学习匹配功能,Mayer等人引入了可以直接计算两个图片中一致区域的全卷积深度网络DispNet。在训练时他们试图通过最小化一个回归训练损失函数来直接预测每个像素位的视差。DispNet和他们之前的端到端深度光学流网络具有相似的结构。
上述方法在训练时依赖大量准确的真实视差数据和立体图像对,这种数据在真实场景中很难获取,所以一般使用合成数据进行训练。尽管合成数据变得越来越贴近真实,但是仍然需要针对每一个新的应用场景由人来创造新内容。
监督式的单张图像深度估计
单视角,或者说单目的深度估计,指的是测试时只有单张图像的问题。Saxena等人提出了基于补丁的模型Make3D,第一次对输入图像过分割为补丁并通过估测局部平面的3D位置和方向来解释每一个补丁。这些对平面参数的预测是由经过激光扫描数据集线下训练过的线性模型获取的,然后使用MRF将其结合起来。这种方法以及其他基于平面的近似估计的弊端在于对薄结构的建模有难度,另外由于这种预测是在局部建立的,因此缺少全局环境来生成更真实的数据。相比于手动调节一元和成对的项,Liu等人使用卷积神经网络来学习它们。在另一种局部方式里,Ladicky等人将语义合并进他们的模型来提高每一个像素的深度估计。Karsch等人试图通过从训练集里复制全部深度图像来获取更多一致的图像级别的预测。这种方式的缺点在于在测试时仍需要全部的训练集。
Eigen等人表示使用由图像和其对应深度数据训练过的two scale深度网络获取稠密的像素深度估计是可行性的。和很多先前的单张图像深度估计方法不同,他们并不依赖于手工获取的特征或者起初的过分割,而是直接在未加工的像素值上学习表现形式。一些建立在这种方法的成功之上的研究,使用诸如条件随机场之类的技术来提高准确度,将损失函数从回归改变到分类,使用更健壮的损失函数函数,在相关的表面常规预测问题中合并强壮场景。与之前提到的立体模型一样,这些方式在训练时依赖大量高质量的、像素对齐的真实深度数据。我们同样进行单张图像的深度估计,但是不需要真实深度数据来训练,而是额外的双目彩色图片。
非监督式深度估计
最近,用于新颖角度合成和深度估计的少量基于深层网络的方法被提出,这些方法不需要训练真实数据。Flynn等人介绍了一个新颖的图像合成网络DeepStereo,通过从附近图像挑选像素来生成新的视角(下的图像)。在训练中,多个摄像机的相对位置被用来预测一个特定的附近图像的表现,然后最合适的深度将基于平面扫描体积对邻居图像色彩进行抽样。在测试时,图像合成是建立在小的重叠补丁上。因为在测试时需要一些附近生成的图像,DeepStereo不适合单目深度估计。
Xie提出的Deep3D网络也解决了新视角合成的问题,他们的目标是在双目对中通过输入的左目图像生成相应的右目图像。通过再一次使用图像重构损失函数,他们的方法获得了每一个像素上可能的视差分布。生成的合成右目图像像素值是左目图像相同扫描行的像素在经过视差可能性加权后的和。这种图像生成方式的缺点在于,潜在视差值数目的增长极大地增加了此种算法的内存消耗,导致难以输出大分辨率图像。在本文中,我们将与Deep3D图像生成模型进行对比,并展示我们的算法生成了更好的结果。
同时进行的、在精神上最贴近我们的模型的是Garg等人的研究。类似Deep3D和我们的方法,他们训练网络并使用图像重构损失函数来进行单目深度估计。然而他们的图像生成模型不是完全可辨别的。为了弥补这点,他们使用泰勒近似来线性化损失函数,这导致了一个更难以优化的目标。类似其他最近的研究,我们的模型通过使用双线性过滤生成图像来解决这个问题,得到了完全可辨识的训练损失函数。
受启发于Mayer的监督式DispNet结构,我们提出了全卷积的深度神经网络。通过转化单目深度估计为图像重构问题,我们可以在没有真实数据的情况下解决视差场。只是最小化光度损失函数可以做到高质量图像重构,但是区别会导致深度数据质量很差。在其他方面,我们的完全可辨别训练损失函数包括了左右目一只检查来提高合成深度图像的质量。这种一致性检查普遍用于很多立体模型的后处理中,但是我们直接将它用在网络里。
3. 方法
本节将描述我们的单张图片深度预测网络。我们引入了一个新颖的深度估计训练损失函数,以内嵌的左右目一致性检查为特点,这个功能可以帮助我们实现在不需要真实深度数据形式的监督的情况下训练图像对。
图2 我们的损失组件输出左右视差图dl和dr。这个损失组件结合了平滑化、重构和左右视差一致检查。
相同的组件将在四组不同尺度的输出中重复执行。
C:卷积。UC:上卷积。S:双线性采样。US:上采样。SC:跳连接。 3.1. 以图像重构的形式进行深度估计
在测试时给定一张图像I,我们的目标是学习到一个功能f来预测每一像素的场景深度,d~=f(I)。大多数现有的基于学习的方法将它以监督式的学习问题来对待,使用彩色输入图像和相应目标深度值来训练。目前来说,获取大量不同场景下的此类真实深度数据是不可行的。即使使用激光扫描仪之类的昂贵硬件,在自然场景中的特征移动和映射也是不精确的。作为替代方案,我们在训练时将深度估计问题转化为图像重构问题。这种想法来自于,对于一对校准的双目摄像机,如果我们可以学习到一个能够从给定图像重构另一张图像的功能,则可以获取关于此图像内场景的3D形状的一些数据。
详细来讲,在训练时我们有两张图像Il和Ir,对应于拍摄在同一时刻的校准过的立体模型对的左目彩色图像和右目彩色图像。我们试图寻找到密集对应场dr,当应用到左目图像时能够重构出右目图像,而不是直接预测深度。我们将重构得到的图像Il(dr)记为I~r。类似的,我们也利用右目图像来估计左目图像,I~l= Ir(dl)。假定图像是经过校准的,d对应于图片视差-在我们的模型中每个像素都将学习得到的一个标量。给定一个摄像机间的基线距离b和摄像机焦距f,我们可以通过预测的视差来简单地恢复深度 =bf/d.
3.2. 深度估计网络
在高层次,我们的网络通过扭曲左目图像以匹配右目图像来获取视差。我们的方法的关键在于,我们可以只用左目输入图像并通过强迫左目到右目和右目到左目的视差保持一致,而同时推测得出两个视差。
图3 反向映射的采样策略。在朴素采样下,CNN生成的视差图与目标一致而非与输入一致。
NoLR修正了这一点,但是却受到人工痕迹干扰。
我们的方法使用左目图像为两个视角生成视差,通过强迫双向一致提高质量。
我们的网络使用双线性采样器生成反向映射的预测图像,从而形成完全可辨识的图像生成模型。如图
单目深度估计 商用案例
单目深度估计 商用案例
单目深度估计(Monocular depth estimation)是一种从单个图像中推断深度信息的技术。由于其具有成本低、设备简单等优势,单目深度估计在许多商用场景中都有广泛的应用。以下是一些单目深度估计的商用案例:
1. 自动驾驶:自动驾驶汽车需要精确的深度信息来理解周围环境并做出决策。单目深度估计可以为自动驾驶系统提供实时、低成本的深度信息,帮助车辆识别障碍物、道路标记和交通信号等。
2. 机器人导航:在工厂、仓库和家庭等环境中,机器人需要精确的深度信息来识别障碍物并进行避障。单目深度估计可以为机器人提供实时的深度感知能力,提高其导航和操作的准确性。
3. 增强现实:增强现实技术可以将虚拟内容与现实世界相结合,为用户提供更加丰富的交互体验。单目深度估计可以为增强现实应用提供精确的深度信息,使得虚拟内容能够更加自然地融入现实场景。
4. 安全监控:在安全监控领域,单目深度估计可以帮助监控系统识别出运动物体的距离和速度,提高监控的准确性和实时性。
5. 虚拟现实和游戏:在虚拟现实和游戏中,单目深度估计可以为用户提供更加真实的沉浸式体验。通过精确的深度信息,游戏和虚拟现实场景中的物体可以呈现出更加逼真的透视效果。
以上案例只是单目深度估计在商用领域的一部分应用,随着技术的不断发展和成本的降低,相信未来会有更多的商业场景会应用到单目深度估计技术。
基于无监督学习的单目深度估计研究
I
摘 要
近年来,随着图形计算设备性能的不断提升,智能驾驶和家庭机器人开始进入人们
的视线。这些技术的实现都需要依赖准确的深度信息,但目前获取深度信息的设备相当
昂贵,为了减少采集深度信息的成本,许多学者开始对深度估计算法进行研究。其中,
单目深度估计算法最贴近实际生活应用,但由于单目视图提供的信息较少,单目深度估
计也成为计算机视觉领域的一道难题。随着深度学习的兴起,卷积神经网络开始被应用
于单目深度估计任务,但由于数据集的缺乏,监督学习算法受到了很大的限制,无监督
学习算法则因此引起了更多的关注。
首先,本文提出了一种基于无监督学习的深度估计框架。该框架包括两个网络部分:
深度估计网络和位姿估计网络。其中,深度估计网络用来预测深度图,位姿预测网络用
来预测相机运动。该框架不仅通过最小化光度误差来对网络进行优化,还针对光度误差
在光照变化情况下失去约束作用的问题,使用匹配点对之间的像素坐标关系来增强模型
的约束能力,提高模型对光照变化的鲁棒性。
然后,针对光度误差在低纹理区域无法对网络训练提供任何贡献的问题,本文提出
使用极线约束来对框架进行约束。极线约束不会受到低纹理区域的影响,可以弥补光度
误差在低纹理区域的失效问题。此外,我们还引入了非相邻帧之间的约束,进一步提高
模型深度估计的准确率。
最后,本文对训练的细节作了详细描述,并和其他方法进行了实验对比。实验结果
证明:上述方法可以有效提高深度预测的准确性,并增强模型对无纹理区域和光照变化
的适应性。
关键词:深度估计;计算机视觉;深度学习
II
Abstract
In recent years, as the performance of graphics computing devices continues to improve,
self-driving and home robots have begun to enter people's attention. The implementation of
基于深度预测的单目SLAM绝对尺度估计
2021年6月 计算机工程与设计 June 2021第 42 卷 第 6 期 COMPUTER ENGINEERING AND DESIGN Vol. 42 No. 6
基于深度预测的单目SLAM绝对尺度估计
张建博,袁 亮+,何 丽,冉 腾,唐鼎新
(新疆大学机械工程学院,新疆乌鲁木齐830047)
摘 要:针对单目同时定位与地图构建(simultan-eous localization and mapping, SLAM)技术存在的尺度不确定性问题,
提出一种结合深度预测网络来估计绝对尺度的单目SLAM算法。利用MonoDepth网络对单目图像进行深度预测,与从单
目图像中提取的ORB特征点进行深度值的数据关联,通过设定深度阈值的方法剔除具有不可靠深度值的特征点,恢复单
目的绝对尺度,根据特征点的真实深度信息,通过光束法平差优化位姿图,校正尺度漂移,减少累积误差&通过室外KIT- TI数据集进行对比实验,其结果表明,该方法能够获得更高的定位精度&
关键词:同时定位与地图构建;深度预测网络;尺度漂移;绝对尺度估计;数据关联中图法分类号:TP242 文献标识号:A 文章编号:1000-7024 (2021) 061749-07doi: 10. 16208/j. issnl000-7024. 2021. 06. 033
Absolute scale estimation of monocular SLAM based on depth prediction
ZHANG Jian-bo, YUAN Liang+ , HE Li & RAN Teng & TANG Ding-xin
(School of Mechanicd Engineering , Xinjiang University & Urumqi 830047 , China)
Abstract: In view of the scale uncertainty of simultaneous localization and mapping (SLAM) technology& an approach based on
单目深度估计技术进展综述
单目深度估计技术进展综述
一、概述
单目深度估计技术是计算机视觉领域中的重要研究方向之一,其目标是通过从单张图像中估计场景中每个像素点的深度信息。深度估计技术在自动驾驶、虚拟现实、机器人导航等领域具有广泛的应用前景。本文将全面、详细、完整地探讨单目深度估计技术的进展。
二、基于传统计算机视觉方法的单目深度估计技术
2.1 结构光法
2.2 缺陷光流法
2.3 聚焦法
三、深度学习在单目深度估计中的应用
3.1 卷积神经网络的应用
1. 使用卷积神经网络进行深度估计的基本原理
2. 基于卷积神经网络的深度估计方法综述
3.2 递归神经网络的应用
1. 递归神经网络在单目深度估计中的优势
2. 基于递归神经网络的深度估计方法研究进展
3.3 生成对抗网络的应用
1. 生成对抗网络在单目深度估计中的作用
2. 基于生成对抗网络的深度估计方法发展现状 3.4 多尺度深度估计方法
1. 多尺度深度估计的原理与优势
2. 多尺度深度估计方法的研究进展
四、单目深度估计技术的评价指标与数据集
4.1 评价指标
1. 视差与深度之间的关系
2. 常用的深度估计评价指标
4.2 数据集
1. NYU Depth V2数据集
2. KITTI Vision Benchmark Suite数据集
3. Make3D数据集
五、应用与展望
5.1 自动驾驶领域中的应用
5.2 虚拟现实领域中的应用
5.3 机器人导航领域中的应用
5.4 单目深度估计技术的未来发展趋势
六、总结
本文从传统计算机视觉方法到深度学习方法,全面分析了单目深度估计技术的进展和应用。通过评价指标与数据集的介绍,读者可以更好地了解该领域的研究情况。最后,我们对单目深度估计技术的未来进行了展望,并指出了该领域需要解决的挑战和发展方向。 参考文献
1. Mayer, N., Ilg, E., Hausser, P., Fischer, P., Cremers, D.,
基于单目深度估计的红外图像彩色化方法
邮局订阅号:82-946120元/年技术创新软件时空
《PLC技术应用200例》您的论文得到两院院士关注
戈曼:硕士基金项目:基金颁发部门:国家自然科学基金委;项目名称:彩色夜视中景物深度及空间透视立体视觉感的研究;编号:(61072090);基金申请人:孙韶媛基于单目深度估计的红外图像彩色化方法InfraredImageColorizationBasedonMonocularDepthEstimation(东华大学)戈曼孙韶媛席林谯帅GEManSUNShao-yuanXILinQIAOShuai摘要:针对夜视红外图像深度信息估计问题,根据红外图像的特点,用地平线检测和最大类间方差法分割得到一幅具有深度信息的图像,然后运用透视学中饱和度、色调对比度与深度的关系,用色彩传递算法对红外图像做彩色化处理,得到一幅视觉上具有立体感的彩色红外图像。关键词:深度估计;彩色夜视;立体感;色彩饱和度;深度图中图分类号:TP391文献标识码:AAbstract:Fortheproblemofestimatingthedepthfromthenightvisioninfraredimage,accordingtothecharacteristicsofinfraredimages,weusemaximumbetween-clustervarianceandthehorizondetectionmethodstogetadepthmapofaninfraredimage.Thenaccordingtherelationshipbetweensaturation,hue,andthedepthinperspective,wetransfercolorstotheinfraredimageandobtainacolorinfraredimagewiththree-dimensionalvisualperception.Keywords:depthestimation;colornightvision;three-dimensional;colorsaturation;depthmap文章编号:1008-0570(2012)10-0413-021引言在彩色夜视技术中,只关注色调的自然正确性是不够的,如何使彩色化后的夜视图像能在视觉效果上体现景物的空间立体感也是重要的研究方向。空间感可以帮助我们辨别景物的前后关系,识别路径及目标位置。实现夜视图像彩色化技术中的视觉立体感需要有图像中景物的深度数据提供距离信息。目前机器视觉领域获得图像深度信息的较成熟的方法主要是利用双目视差以及运动视差的原理,即根据对极几何原理,结合拍摄时相机运动产生的视差信息来估计深度。例如基于双目、三目、多目、环目的三维立体化方法。夜视红外图像从拍摄角度上来讲属于单目图像,不存在视差,无法应用基于视差的深度估计算法。因此,针对夜视图像的特点,需要研究基于单目图像的即从单幅的二维夜视图像中估计景物的深度信息。针对以上问题,本文根据红外图像的特点,用地平线检测和最大类间方差法分割得到一幅具有深度信息的图像,然后利用透视学中色调对比和饱和度变化来区分表达景物的深度,从而使得最终获得的彩色夜视图像在视觉效果上具有空间立体感。2深度图获取针对车载夜视应用领域,对车载红外红外图像中的景物分成行人、天空,道路,路边树木几类处理。夜视成像技术中,红外热成像反映的是景物的温度分布,首先根据先验知识设定阈值将图像中的行人作为第一类从图像中分割出来。然后进行地平线检测,再利用最大类间方差法进行景物分类,进而得到深度图。算法的详细介绍如下。2.1地平线检测图像处理中,一阶微分可以通过梯度法实现。在一幅图像中,边缘梯度值较大,平滑区梯度值较小,对于灰度级为常数的区域梯度值为零。一般采用差分来近似微分。梯度可用公式(1)来计算。(1)图像中地平线为天空和地面的分界线,区域的梯度值较大,为了排除其他位置由于灰度突然变化引起的大梯度值的干扰,采用直方图投票的方法,确定分界线(即地平线)的纵向坐标。设图像大小为M×N,采用统计的直方图为Pu,其中u=1···N,μ∈N点(i,j)的梯度值为(2)可以得到地平线在图像中的纵坐标为:(3)2.2基于最大类间方差法的景物分类最大类间方差法是对图像的像素进行划分,通过划分使得各类之间的距离达到最大来确定其合适的门限。设图像g中灰度值i得像素的数目为ni个,总像素数为(4)各个灰度出现的概率为(5)设灰度t为门限,将图像分为A和B两个区域,其中A区域的灰度为0~t的像素和B区域的灰度为t+1~L-1的像素,则区域A和B的概率分别为(6)(7)区域A和B的平均灰度为(8)(9)413--技术创新《微计算机信息》2012年第28卷第10期
单目深度估计方法综述
单目深度估计方法综述
展开全文
一 相关概念介绍
1. 深度估计
深度估计,就是获取图像中场景里的每个点到相机的距离信息,这种距离信息组成的图我们称之为深度图,英文叫Depth map。
2. 视差
两张图像中相同物体的像素坐标不同,较近的物体的像素坐标差异较大,较远的物体的差异较小。同一个世界坐标系下的点在不同图像中的像素坐标差异,就是视差。不同图像之间的视差,可以换算出物体和拍摄点之间的距离,也就是深度。
二 单目深度估计的研究现状
下图[1]展示了单目深度估计的发展历程,从传统方法发展到深度学习方法,深度学习又分为有监督、半监督和无监督方法。 注:这里也给大家推荐系统介绍单目深度估计原理的精品课程:单目深度估计方法:算法梳理与代码实现
我们将单目深度估计方法分为:基于线索的传统方法、基于机器学习的传统方法、基于有监督的深度学习方法和基于无监督的深度学习方法。
2.1 基于线索的传统方法
人类在观察周围环境时,除了依靠双目获得立体感外,大脑还能根据经验仅从单个视角捕获的各种启发式线索感知深度。常用的单目深度线索有:线性透视[2]、聚焦/散焦[8]、大气散射[7]、阴影[3]、纹理[4]、遮挡[5]和相对高度[6]等。
线性透视线索的例子 大气散射线索的例子
SFS (Shape from shading)方法
根据运动线索求解深度是最常用的一个方法。这里包含两种运动类型:一类是物体自身的运动,一类是摄像机的运动。
基于物体自身运动的深度估计方法是利用运动视差近大远小的原理。利用摄像机的运动进行深度估计,称为运动恢复结构(Structure
From Motion, SFM)[9]。假定场景静止不变,仅存在摄像机的运动,SFM 技术可以从拍摄的图像序列中恢复出摄像机的内外参数和场景的深度信息。
2.2 基于机器学习的传统方法
基于统计模式的深度估计算法由于不受特定的场景条件的限制,并且具有较好的适用性,得到了越来越广泛的研究。该类算法主要通过机器学习的方法,将大量有代表性的训练图像集和对应的深度集输入定义好的模型中进行有监督的学习,训练完成之后,将实际输入图像输入到训练好的模型中进行深度的计算。 基于传统机器学习的单目深度估计方法可分为参数学习方法与非参数学习方法。
最新开源无监督单目深度估计方法,解决复杂室内场景难训练问题,效果性能远超SOTA
最新开源无监督单目深度估计方法,解决复杂室内场景难训练问题,效果性能远超SOTA
加入极市专业CV交流群,与 10000+来自港科大、北大、清华、中科院、CMU、腾讯、百度 等名校名企视觉开发者互动交流!
同时提供每月大咖直播分享、真实项目需求对接、干货资讯汇总,行业技术交流。关注 极市平台 公众号 ,回复 加群,立刻申请入群~
一、摘要
无监督单目深度估计算法已经被证明能够在驾驶场景(如KITTI数据集)中得到精确的结果,然而最近 [5] (ICCV 2019) 指出这类算法在更复杂的场景(如室内NYUv2数据集)中难以训练。比如,GeoNet
[8] (CVPR 2018) 甚至无法得出合理的结果。即使 [5] 和最新的 [6] (CVPR 2020) 针对这一问题提出了更鲁棒的训练框架,结果精度也非常有限。本文从理论和统计结果上分析了这一问题。得出结论:1、在无监督单目深度估计训练过程中,相机运动中的旋转部分是噪音而平移部分是信号。2、在NYUv2等手持相机拍摄的视频中旋转是相机运动的主要成份,而在KITTI等驾驶视频中平移是主要成份。这个结论解释了为什么无监督算法在驾驶场景表现良好而在室内场景难以训练这一现象。根据结论,本文提出了一种数据预处理的方法来解决问题。结果证明在处理后的数据上进行训练,算法性能得到大幅提升。文章以现有的无监督算法SC-SfMLearner [4] (NeurIPS 2019) 作为训练框架,得出远超SOTA [6] (CVPR 2020) 的深度估计结果。比如,在AbsRel
error 上 0.147 vs. 0.189,在Acc (delta<1.25) 上 0.804 vs. 0.701。可视化对比结果如图3。
论文:Unsupervised Depth Learning in Challenging Indoor Video: Weak Rectification to Rescue, Jia-Wang Bian, Huangying
基于深度学习的单目图像深度估计
III 摘 要
图像深度估计是计算机视觉领域中一项重要的研究课题。深度信息是理解一个场景
三维结构关系的重要组成部分,准确的深度信息能够帮助我们更好地进行场景理解。在
真三维显示、语义分割、自动驾驶及三维重建等多个领域都有着广泛的应用。传统方法
多是利用双目或多目图像进行深度估计,最常用的方法是立体匹配技术,利用三角测量
法从图像中估计场景深度信息,但容易受到场景多样性的影响,而且计算量很大。单目
图像的获取对设备数量和环境条件要求较低,通过单目图像进行深度估计更贴近实际情
况,应用场景更广泛。深度学习的迅猛发展,使得基于卷积神经网络的方法在单目图像
深度估计领域取得了一定的成果,成为图像深度估计领域的研究热点。但是单目深度估
计仍面临着许多挑战:复杂场景中的复杂纹理和复杂几何结构会导致大量深度误差,容
易造成局部细节信息丢失、物体边界扭曲及模糊重建等问题,直接影响图像的恢复精度。
针对上述问题,本文主要研究基于深度学习的单目图像深度估计方法。主要工作包括以
下两个方面:
(1)针对室内场景中复杂纹理和复杂几何结构造成的物体边界扭曲、局部细节信
息丢失等问题,提出一种基于多尺度残差金字塔注意力网络模型。首先,提出了一个多
尺度注意力上下文聚合模块,该模块由两部分组成:空间注意力模型和全局注意力模型,
通过从空间和全局分别考虑像素的位置相关性和尺度相关性,捕获特征的空间上下文信
息和尺度上下文信息。该模块通过聚合特征的空间和尺度上下文信息,自适应地学习像
素之间的相似性,从而获取图像更多的全局上下文信息,解决场景中复杂结构导致的问
题。然后,针对场景理解中物体的局部细节容易被忽略的问题,提出了一个增强的残差
细化模块,在获取多尺度特征的同时,获取更深层次的语义信息和更多的细节信息,进
一步细化场景结构。在NYU Depth V2数据集上的实验结果表明,该方法在物体边界和
局部细节具有较好的性能。
(2)针对已有非监督深度估计方法中细节信息预测不够准确、模糊重建等问题,
基于深度学习的单目深度估计综述
基于深度学习的单目深度估计综述
前段时间有思考过结合3D信息来辅助多目标跟踪任务,不过效果没有达到我的预期。一方面是多目标跟踪相关数据集除了KITTI之外缺乏多任务标注信息,另一方面单目深度估计对于密集拥挤人群的效果很差。所以我觉得对于稀疏场景、车辆跟踪或者提供真实3D信息和相机信息的场景任务更有意义。下面的总结主要是我2019年初整理的文献,时效性可能还没跟上。
1任务介绍
深度估计是计算机视觉领域的一个基础性问题,其可以应用在机器人导航、增强现实、三维重建、自动驾驶等领域。而目前大部分深度估计都是基于二维RGB图像到RBG-D图像的转化估计,主要包括从图像明暗、不同视角、光度、纹理信息等获取场景深度形状的Shape from X方法,还有结合SFM(Structure from motion)和SLAM(Simultaneous Localization And Mapping)等方式预测相机位姿的算法。其中虽然有很多设备可以直接获取深度,但是设备造价昂贵。也可以利用双目进行深度估计,但是由于双目图像需要利用立体匹配进行像素点对应和视差计算,所以计算复杂度也较高,尤其是对于低纹理场景的匹配效果不好。而单目深度估计则相对成本更低,更容易普及。
那么对于单目深度估计,顾名思义,就是利用一张或者唯一视角下的RGB图像,估计图像中每个像素相对拍摄源的距离。对于人眼来说,由于存在大量的先验知识,所以可以从一只眼睛所获取的图像信息中提取出大量深度信息。那么单目深度估计不仅需要从二维图像中学会客观的深度信息,而且需要提取一些经验信息,后者则对于数据集中相机和场景会比较敏感。
通过阅读文献,可以将基于深度学习的单目深度估计算法大致分为以下几类:
• 监督算法
顾名思义,直接以2维图像作为输入,以深度图为输出进行训练:
上面给的例子是KITTI数据集中的一组例子,不过深度图可能看的不是很明显,我重新将深度图涂色之后:
深度解读|基于无监督深度学习的单目视觉的深度和自身运动轨迹估计的深度神经模型
深度解读|基于无监督深度学习的单目视觉的深度和自身运动轨迹估计的深度神经模型
本文是对文章《Unsupervised Learning of Depth and Ego-Motion from Video》的解读。
Figure 1. 深度图和Ground-Truth [1]
Figure 2. Absolute Trajectory Error(ATE) on KITTI dataset [1]
1. 概述
1.1为什么要讲这篇文章?
在无人驾驶、3D重建和AR三个领域中,对于周围环境物体的深度(Depth)和对自身位置的估计(State Estimation)一直是一个非常棘手而复杂的问题。过去常用的方法,传统的SLAM,通常用非常繁琐的数学公式和基于特征点/直接法的方法来进行轨迹估算,而深度通常用单目视觉(多态几何),双目视觉,激光雷达来进行估计。
但传统方法通常只能进行稀疏的特征点(Features),进行深度估计和自身姿态估计,而不能利用所有pixel,而这对于自动驾驶领域中重建高精地图和AR领域中的室内环境感知来说就会导致信息的缺失。
1.2 这篇文章提出了什么新方法?
这篇文章主要提出了一种基于无监督深度学习的单目视觉的深度和自身运动轨迹估计的深度神经模型。
它的新颖之处在于:
1. 提出了一种堪称经典的:depth network和ego-motion
network共同训练的架构模式。(因此这篇文章可以说是最2年基于深度学习的depth estimation的祖师爷,Google和Toyota的最新论文都借鉴了它的训练模式)
2. 无监督学习:只需任意单目相机的视频就可以学习其深度和轨迹信息。
3. 同时追踪所有像素点,不丢失任何场景信息。
4. 深度估计比肩传统SLAM,自身轨迹估计优于传统SLAM。
它在工程之中的应用价值:
1. 高境地图重建(自动驾驶车,移动机器人)
2. 3D视觉效果重建
