综述卷积神经网络:从基础技术到
综述卷积神经网络:从基础技术到
1 引言
1.1 动机
过去几年来,计算机视觉研究主要集中在卷积神经网络(常简称为 ConvNet 或
CNN)上。这些工作已经在广泛的分类和回归任务上实现了新的当前最佳表现。相对而言,尽管这些方法的历史可以追溯到多年前,但对这些系统得到出色结果的方式的理论理解还很滞后。事实上,当前计算机视觉领域的很多成果都是将 CNN 当作黑箱使用,这种做法是有效的,但其有效的原因却非常模糊不清,这严重满足不了科学研究的要求。尤其是这两个可以互补的问题:(1)在被学习的方面(比如卷积核),究竟被学习的是什么?(2)在架构设计方面(比如层的数量、核的数量、池化策略、非线性的选择),为什么某些选择优于另一些选择?这些问题的答案不仅有利于提升我们对 CNN 的科学理解,而且还能提升它们的实用性。
此外,目前实现 CNN 的方法需要大量训练数据,而且设计决策对结果表现有很大的影响。更深度的理论理解应该能减轻对数据驱动的设计的依赖。尽管已有实证研究调查了所实现的网络的运行方式,但到目前为止,这些结果很大程度上还局限在内部处理过程的可视化上,目的是为了理解 CNN 中不同层中发生的情况。
1.2 目标
针对上述情况,本报告将概述研究者提出的最突出的使用多层卷积架构的方法。要重点指出的是,本报告将通过概述不同的方法来讨论典型卷积网络的各种组件,并将介绍它们的设计决策所基于的生物学发现和/或合理的理论基础。此外,本报告还将概述通过可视化和实证研究来理解 CNN 的不同尝试。本报告的最终目标是阐释 CNN 架构中涉及的每一个处理层的作用,汇集我们当前对 CNN 的理解以及说明仍待解决的问题。
1.3 报告提纲
本报告的结构如下:本章给出了回顾我们对卷积网络的理解的动机。第 2 章将描述各种多层网络并给出计算机视觉应用中使用的最成功的架构。第 3 章将更具体地关注典型卷积网络的每种构造模块,并将从生物学和理论两个角度讨论不同组件的设计。最后,第 4 章将会讨论 CNN 设计的当前趋势以及理解 CNN 的工作,并且还将重点说明仍然存在的一些关键短板。
2 多层网络
总的来说,本章将简要概述计算机视觉领域中所用的最突出的多层架构。需要指出,尽管本章涵盖了文献中最重要的贡献,但却不会对这些架构进行全面概述,因为其它地方已经存在这样的概述了(比如 [17, 56, 90])。相反,本章的目的是为本报告的剩余部分设定讨论基础,以便我们详细展示和讨论当前对用于视觉信息处理的卷积网络的理解。
2.1 多层架构
在近来基于深度学习的网络取得成功之前,最先进的用于识别的计算机视觉系统依赖于两个分离但又互补步骤。第一步是通过一组人工设计的操作(比如与基本集的卷积、局部或全局编码方法)将输入数据变换成合适的形式。对输入的变换通常需要找到输入数据的一种紧凑和/或抽象的表征,同时还要根据当前任务注入一些不变量。这种变换的目标是以一种更容易被分类器分离的方式改变数据。其次,被变换的数据通常用于训练某些类型的分类器(比如支持向量机)来识别输入信号的内容。通常而言,任何分类器的表现都会受到所使用的变换方法的严重影响。
多层学习架构为这一问题带来了不同的前景,这种架构提出不仅要学习分类器,而且要从数据中直接学习所需的变换操作。这种形式的学习通常被称为「表征学习」,当应用在深度多层架构中时即被称为「深度学习」。
多层架构可以定义为允许从输入数据的多层抽象中提取有用信息的计算模型。一般而言,多层架构的设计目标是在更高层凸显输入中的重要方面,同时能在遇到更不重要的变化时变得越来越稳健。大多数多层架构都是将带有交替的线性和非线性函数的简单构建模块堆叠在一起。多年以来,研究者已经提出了很多不同类型的多层架构,本章将会覆盖计算机视觉应用中所采用的最为突出的此类架构。人工神经网络是其中的关注重点,因为这种架构的表现非常突出。为了简单起见,后面会直接将这类网络称为「神经网络」。
2.1.1 神经网络
典型的神经网络由一个输入层、一个输出层和多个隐藏层构成,其中每一层都包含多个单元。
图 2.1:典型神经网络架构示意图,图来自 [17]
自动编码器可以定义为由两个主要部分构成的多层神经网络。第一个部分是编码器,可以将输入数据变换成特征向量;第二个部分是解码器,可将生成的特征向量映射回输入空间。
图
2.2:典型自动编码器网络的结构,图来自 [17]
2.1.2 循环神经网络
当谈到依赖于序列输入的任务时,循环神经网络(RNN)是最成功的多层架构之一。RNN 可被视为一种特殊类型的神经网络,其中每个隐藏单元的输入时其当前时间步骤观察到的数据和其前一个时间步骤的状态。
图
2.3:标准循环神经网络的运算的示意图。每个 RNN 单元的输入都是当前时间步骤的新输入和前一个时间步骤的状态;然后根据计算得到新输出,这个输出又可被馈送到多层 RNN 的下一层进行处理。
图 2.4:典型 LSTM 单元示意图。该单元的输入是当前时间的输入和前一时间的输入,然后它会返回一个输出并将其馈送给下一时间。LSTM 单元的最终输出由输入门、输出门和记忆单元状态控制。图来自 [33]
2.1.3 卷积网络
卷积网络(CNN)是一类尤其适合计算机视觉应用的神经网络,因为它们能使用局部操作对表征进行分层抽象。有两大关键的设计思想推动了卷积架构在计算机视觉领域的成功。第一,CNN 利用了图像的 2D 结构,并且相邻区域内的像素通常是高度相关的。因此,CNN 就无需使用所有像素单元之间的一对一连接(大多数神经网络都会这么做),而可以使用分组的局部连接。第二,CNN 架构依赖于特征共享,因此每个通道(即输出特征图)是在所有位置使用同一个过滤器进行卷积而生成的。
图 2.5:标准卷积网络的结构的示意图,图来自 [93]
图 2.6:Neocognitron 的结构示意图,图来自 [49]
2.1.4 生成对抗网络
典型的生成对抗网络(GAN)由两个互相竞争的模块或子网络构成,即:生成器网络和鉴别器网络。
图 2.7:生成对抗网络的一般结构的示意图
2.1.5 多层网络的训练
如前面讨论的一样,多种多层架构的成功都很大程度上取决于它们的学习过程的成功。其训练过程通常都基于使用梯度下降的误差的反向传播。由于使用简单,梯度下降在训练多层架构上有广泛的应用。
2.1.6 简单说说迁移学习
使用多层架构提取的特征在多种不同数据集和任务上的适用性可以归功于它们的分层性质,表征会在这样的结构中从简单和局部向抽象和全局发展。因此,在其层次结构中的低层级提取的特征往往是多种不同任务共有的特征,因此使得多层结构更容易实现迁移学习。
2.2 空间卷积网络
理论上而言,卷积网络可以应用于任意维度的数据。它们的二维实例非常适用于单张图像的结构,因此在计算机视觉领域得到了相当大的关注。有了大规模数据集和强大的计算机来进行训练之后,CNN 近来在多种不同任务上的应用都出现了迅猛增长。本节将介绍为原来的 LeNet 引入了相对新颖的组件的比较突出的 2D CNN 架构。
2.2.1 CNN 近期发展中的关键架构
图 2.8:AlexNet 架构。需要指出,虽然从图上看这是一种有两个流的架构,但实际上这是一种单流的架构,这张图只是说明 AlexNet 在 2 个不同 GPU 上并行训练的情况。图来自 [88]
图 2.9:GoogLeNet
架构。(a)典型的 inception 模块,展示了顺序和并行执行的操作。(b)由层叠的许多 inception 模块构成的典型 inception 架构的示意图。图来自 [138]
图 2.10:ResNet 架构。(a)残差模块。(b)由层叠的许多残差模块构成的典型 ResNet 架构示意图。图来自 [64]
图 2.11:DenseNet 架构。(a)dense 模块。(b)(b)由层叠的许多 dense 模块构成的典型
DenseNet 架构的示意图。图来自 [72]
2.2.2 实现 CNN 的不变性
使用 CNN 的一大难题是需要非常大的数据集来学习所有的基本参数。甚至拥有超过
100 万张图像的 ImageNet 等大规模数据集在训练特定的深度架构时仍然被认为太小。满足这种大数据集要求的一种方法是人工增强数据集,具体做法包括对图像进行随机翻转、旋转和抖动(jittering)等。这些增强方法的一大优势是能让所得到的网络在面对各种变换时能更好地保持不变。
2.2.3 实现 CNN 的定位
除了识别物体等简单的分类任务,CNN 近来也在需要精准定位的任务上表现出色,比如形义分割和目标检测。
2.3 时空卷积网络
使用 CNN 为各种基于图像的应用带来了显著的性能提升,也催生了研究者将 2D 空间 CNN 扩展到视频分析的 3D 时空 CNN 上的兴趣。一般而言,文献中提出的各种时空架构都只是试图将空间域 (x,y) 的 2D 架构扩展到时间域 (x, y, t) 中。在基于训练的时空 CNN 领域存在 3 种比较突出的不同架构设计决策:基于 LSTM 的 CNN、3D
CNN 和 Two-Stream CNN。
2.3.1 基于 LSTM 的时空 CNN
基于 LSTM 的时空 CNN 是将 2D 网络扩展成能处理时空数据的一些早期尝试。它们的操作可以总结成图 2.16 所示的三个步骤。第一步,使用一个 2D 网络处理每一帧,并从这些 2D 网络的最后一层提取出特征向量。第二步,将这些来自不同时间步骤的特征用作 LSTM 的输入,得到时间上的结果。第三步,再对这些结果求平均或线性组合,然后再传递给一个 softmax 分类器以得到最终预测。
2.3.2 3D CNN
这种突出的时空网络是将 2D CNN 最直接地泛化到图像时空域中。它直接处理 RGB
图像的时间流,并通过应用所学习到的 3D 卷积过滤器来处理这些图像。
2.3.3 Two-Stream CNN
这种类型的时空架构依赖于一种双流式(two-stream)的设计。标准的双流式架构是采用两个并行通路——一个用于处理外观,另一个用于处理运动;这种方法类似于生物视觉系统研究中的双流式假设。
2.4 整体讨论
需要重点指出的是,尽管这些网络在很多计算机视觉应用上都实现了很有竞争力的结果,但它们的主要缺点仍然存在:对所学习到的表征的确切本质的理解很有限、依赖于大规模数据训练集、缺乏支持准确的表现边界的能力、网络超参数选择不清晰。
人工智能深度学习:从入门到精通(微课版)-教学大纲
课程大纲
上课周
(每周3课时) 章节
内容 案例支持
1. 机器学习、深度学习与人工智能
1 第一章深度学习简介 2. 深度学习与回归分析
± 及TenSOrFIOW安装 3. 深度学习发展历程
4. 深度学习擅长领域
5. 安装Tenso
1. 神经网络模型介绍
2. 激活函数
2 第二章神经网络基础 3. 神经网络的训练
4. 神经网络过拟合及处理方法
1. 神经网络的数据结构
3 第三章神经网络的 2. 图像数据的存储与运算 1、美食评分
TensorFIow实现 3. 线性回归模型的
TensorFIow实现 2、颜值打分
第三章神经网络的
TensorFIow实现 1. 逻辑回归模型的
1、手写数字识别
2、性别识别 4
2. TensorFIow实现上机实验(一)
1. 卷积神经网络基本结构
5 第四章卷积神经网络 2. 卷积与池化的通俗理解
基础 3. 卷积
4. 池化
1. 1eNet-5 1、手写数据识别
6 第五章经典卷积神经 2. AIexNet 2、中文字体识
网络(上) 别:隶书和行
楷
1. VGG 1×加利福尼亚理
第五章经典卷积神经 2. BatchNorma1ization技 工学院鸟类数
7 网络(上) 巧 据库分类 3. DataAugmentation技巧 2、猫狗分类
8 第五章经典卷积神经 上机实验(二) 学生上机利用案例
网络(上) 实现经典网络
9 第六章经典卷积神经 1、 Inception 1、花的三分类问题
网络(T) 2、 ResNet 2、F1OWer分类问题
第六章经典卷积神经 1、 DenseNet 1、性别区分
10 网络(T) 2、 MobiIeNet 2、狗的分类
3、 迁移学习
11 第六章经典卷积神经 上机实验(三) 学生上机利用案例
深度卷积神经网络在计算机视觉中的应用研究综述
深度卷积神经网络在计算机视觉中的应用研究综述
深度卷积神经网络(Deep Convolutional Neural Networks,
DCNNs)是一种用于解决计算机视觉领域相关问题的有效方法,它可以用来解决计算机识别、文本检测、图像分类和目标检测等任务。DCNN模型能够成功地将计算机视觉领域的任务解码,并有效地提取出有意义的特征。
DCNN由权重连接的多层网络构成,每一层都由一系列的卷积、池化和非线性变换操作构成。第一层的卷积操作通过扩大输入中的特征,从而创建新的特征图。随后,通过池化操作消除不重要的特征,获得更强的局部特征,并提取尽可能多的外观特征。为了提取全局特征,DCNN还使用了多层结构,以捕捉不同尺度空间上的特征。此外,为了对特征进行语义分析,DCNN还使用了非线性变换。
DCNN模型在计算机视觉领域有着巨大的应用价值,被广泛用于许多任务中,例如人脸识别、行为识别、图像分割、图像检索、图像标注等,在这些任务中,DCNN模型都能够取得优异的性能。此外,DCNN模型也可用于移动设备上的低功耗、即时图像处理和学习,从而简化计算机视觉领域的应用研究。
总之,深度卷积神经网络有效地将计算机视觉中的许多任务解码,能够有效地提取有意义的特征,并且能够应用于多个计算机视觉领域的任务,因此DCNN模型是在计算机视觉领域中的研究中极具价值的。
图像识别中的卷积神经网络应用研究
新技术新工艺
2021年 第
1期
图像识别中的卷积神经网絡应用研究
*
张玉红】,白韧祥】,孟凡军
2,王思斯
3,吴 彪
3
(1吉林建筑大学电气与计算机学院,吉林长春130118$.长春设备工艺研究所,吉林 长春130012;
3.吉林省乔富建设股份有限公司,吉林长春130000)
摘要:传统图像识别方法存在自适应能力弱的问题,如果待识别对象存在较大残缺或者其他外在噪
声干扰,模型则无法获得理想结果#最早在图像处理中成功应用的深度学习是人工智能中非常重要的部
分#在图像处理中,带有卷积结构的多层网络的卷积神经网络被加拿大教授及其小组成员提出并优化。
在其过程有了突破性发展的情况下,利用卷积神经网络完成了图像识别的设计用以增加模型对图片的识
别准确率和在线运算速度,同时减少图像大量特征的提取工作,在识别系统中通过运用随机梯度下降法对
系统进行优化,加快模型收敛#根据试验结果,采用卷积神经网络设计的训练模型,对数据集识别的准确
率可达到96%,为大规模图像分类更好地发展提供基础支持#
关键词:深度学习;神经网络;图像处理;梯度下降;卷积层;池化
中图分类号:
TP 3 文献标志码:
A
Research on Application of Convolution Neural Network in Image Recognition
ZHANG Yuhong1 , BAI Renxiang1 , MENG Fanjun2 , WANG Sisi3 , WU Biao3
(1. School of Electrical Engineering and Co7puter, Jilin Jianzhu University, Changchun 130118, China;
2. Changchun Equip7ent Technology Research Institute, Changchun 130012 , China;
3. Jilin Qiaofu Construction Co. , Ltd. , Changchun 130000 , China)
卷积神经网络的批量归一化技术介绍(Ⅱ)
卷积神经网络的批量归一化技术介绍
卷积神经网络(Convolutional Neural Network,CNN)作为一种深度学习模型,在计算机视觉、自然语言处理等领域有着广泛的应用。而批量归一化(Batch Normalization)作为一种优化训练过程和提高模型性能的技术,在CNN中也扮演着重要的角色。本文将介绍CNN的批量归一化技术,从原理、优势和实践应用三个方面展开讨论。
一、批量归一化的原理
批量归一化的主要思想是对每一层的输入进行归一化处理,使得每一层的输入分布相对固定。在CNN中,每一层的输入都经过激活函数,输出的结果会受到输入数据的分布影响。如果输入数据的分布发生变化,就会影响模型的收敛速度和稳定性。
具体而言,对于一层神经网络,在进行激活函数操作之前,将这一层的输入进行归一化处理,即将输入减去均值并除以标准差,然后再乘以一个可学习的参数进行线性变换,最后再加上一个可学习的偏移项。这样做可以使得每一层的输入分布相对固定,让模型更容易学习到有效的特征。
二、批量归一化的优势
批量归一化的优势主要体现在以下几个方面: 1. 加速收敛:批量归一化使得每一层的输入分布相对固定,减少了网络训练过程中的内部协变量转移(Internal Covariate Shift)问题,加速了网络的收敛速度。
2. 防止梯度消失和梯度爆炸:批量归一化可以使得每一层的激活函数的输入分布相对固定,避免了梯度消失和梯度爆炸的问题,使得网络更容易训练。
3. 正则化效果:批量归一化在一定程度上起到了正则化的作用,减少了模型的过拟合风险。
4. 提高模型泛化能力:批量归一化可以使得网络对输入数据的变化更加鲁棒,提高了模型的泛化能力。
三、批量归一化的实践应用
批量归一化技术在CNN中的实践应用非常广泛。一般来说,在卷积层和全连接层之后都可以加入批量归一化层。在实际的网络设计中,可以使用批量归一化技术来加速模型的训练收敛、提高模型的性能。
卷积神经网络在模式识别中的应用概述
卷积神经网络在模式识别中的应用概述
摘要:卷积神经网络(convolutional neural network,CNN)强大的建模和表征能力很好地解决了特征表达能力不足和维数灾难等模式识别方面的关键问题,受到学者们的广泛关注。因此,本文首先介绍了卷积神经网络的发展历程及其理论模型,然后重点对卷积神经网络在文字语音识别、图像识别和人脸表情识别等中的应用作了总结。最后对卷积神经网络未来在模式识别领域的发展潜力和应用前景进行了展望。
关键词:卷积神经网络;模式识别;文字语音识别;图像识别;人脸表情识别
1 引 言
模式识别(Pattern Recognition)是人类的一项基本智能,在日常生活中,人们经常在进行“模式识别”。随着20世纪40年代计算机的出现以及50年代人工智能的兴起,人们当然也希望能用计算机来代替或扩展人类的部分脑力劳动。(计算机)模式识别在20世纪60年代初迅速发展并成为一门新学科,是指对表征事物或现象的各种形式的(数值的、文字的和逻辑关系的)信息进行处理和分析,以对事物或现象进行描述、辨认、分类和解释的过程,是信息科学和人工智能的重要组成部分。
模式识别又常称作模式分类,从处理问题的性质和解决问题的方法等角度,模式识别分为有监督的分类(Supervised Classification)和无监督的分类(Unsupervised Classification)两种。模式还可分成抽象的和具体的两种形式[1]。前者如意识、思想、议论等,属于概念识别研究的范畴,是人工智能的另一研究分支。我们所指的模式识别主要是对语音波形、地震波、心电图、脑电图、图片、照片、文字、符号、生物的传感器等对象进行测量的具体模式进行分类和辨识。
模式识别方法主要可分为四种,分别为:模板匹配法、统计模式识别法、语法模式识别法以及神经网络。其中模板匹配法是出现较早的一种方法,实现起来较简单,匹配是个通用的操作,用于定义两个实体间的相似性程度,一般是采用二维模板,匹配的要素一般采用像素、曲线及形状信息,当然在定义模板及相似性函数时要考虑到实体的姿态及比例问题,这种方法一般不需要训练,实际上模板就是由训练集建立起来的,它的缺点是适应性差。统计模式识别法的基本原理是:有相似性的样本在模式空间中互相接近,并形成“集团”,即“物以类聚”。统计模式识别的主要方法有:判别函数法, k近邻分类法,非线性映射法,特征分析法,主因子分析法等。语法模式识别法是针对复杂模式提出的,一般将模式分为子模式一级,称为基元。这种方法其难点是基元的提取及从训练数据中提取语法、结构规则。神经网络是一种复杂的并行的非线性系统,完成复杂的计算,网络的最大特点就是从训练数据中学习到输入-输出间的复杂关系,并对数据具有适应性。
基于卷积神经网络的识别技术研究
基于卷积神经网络的识别技术研究
一、引言
卷积神经网络(Convolutional Neural Network, CNN)是一种应用广泛的深度学习算法,在图像识别、语音识别、自然语言处理等领域取得了非常显著的成果。基于卷积神经网络的识别技术也是市场上热门的技术之一。
本文旨在对基于卷积神经网络的识别技术进行深入研究,探究其原理及应用,以期为相关领域进行技术优化提供借鉴。
二、基本原理
卷积神经网络是一种前向反馈神经网络,主要用于处理具有网格状拓扑结构的数据,如图像。该网络主要由三种层组成:卷积层、池化层和全连接层。
卷积层主要用于提取图像特征,它通过将多个卷积核应用于输入图像,生成多个卷积特征映射。池化层则是为了减少数据维度,常用的池化方法有最大池化和平均池化。全连接层则将卷积层和池化层输出的特征向量进行连接,实现分类任务。
卷积神经网络有以下两种常见结构:LeNet和AlexNet。其中,LeNet是最早提出的卷积神经网络,它由两个卷积层、两个池化层和三个全连接层组成,主要应用于手写数字识别。而AlexNet则是一种更深的卷积神经网络,它有五个卷积层、三个池化层和三个全连接层。
三、高级技术
1.迁移学习
迁移学习是指在一个领域训练好的模型可以应用于另一个领域。在基于卷积神经网络的识别技术中,迁移学习可以通过利用预训练模型对小样本数据进行特征提取,从而提高模型的准确性和泛化能力。常用的预训练模型有VGG、ResNet、Inception等。
2.物体检测
物体检测是指在图像中检测出特定物体的位置和数量,常用的方法有R-CNN、Fast R-CNN、Faster R-CNN、YOLO等。其中,Faster R-CNN是目前较为先进的物体检测方法,它通过引入区域提议网络(Region Proposal Network, RPN)和锚框(Anchor)机制,实现了物体检测的端到端训练。
3.图像分割
卷积神经网络中的残差连接技术介绍(Ⅰ)
卷积神经网络中的残差连接技术介绍
随着深度学习技术的不断发展,卷积神经网络(Convolutional Neural
Network, CNN)已经成为了图像识别、语音识别等领域的重要工具。然而,随着网络深度的增加,传统的卷积神经网络也面临着梯度消失和梯度爆炸的问题,导致训练困难和网络性能下降。为了解决这一问题,残差连接技术应运而生,它通过引入跳跃连接的方式,使得网络可以更轻松地训练深度网络,并且取得更好的性能。
残差连接技术的提出
残差连接技术最早由Kaiming He等人在2015年提出。他们在研究深度神经网络训练过程中发现,网络层数的增加并不一定会带来性能的增加,甚至会出现性能下降的情况。分析发现,深层网络在进行反向传播时,梯度的传播会受到网络深度的影响,导致梯度消失和梯度爆炸的问题。为了解决这一问题,他们提出了残差连接技术。
残差连接技术的原理
残差连接技术的核心思想是引入跳跃连接,将输入特征与输出特征直接相加,从而得到残差学习。这使得网络可以学习残差而不是直接学习特征,从而更容易地训练深度网络。具体来说,在传统的卷积层中,假设输入特征为x,输出特征为H(x),则残差连接可以表示为:
F(x) = H(x) - x 然后将残差连接的输出与输入特征相加,得到最终的输出:
y = F(x) + x
这样一来,即使网络无法学习到恒等映射,也可以通过残差学习来逼近。在实际应用中,残差连接可以应用于卷积层、全连接层甚至是整个网络中,从而有效地解决了深度网络训练的困难。
残差连接技术的应用
残差连接技术已经被成功地应用于许多深度学习模型中,取得了显著的性能提升。其中最著名的就是ResNet(Residual Network),它是由Kaiming He等人提出的一种深度残差网络。在2015年的ImageNet大规模视觉识别挑战赛中,ResNet取得了惊人的成绩,验证了残差连接技术在图像识别领域的有效性。此外,残差连接技术也被广泛地应用于语音识别、自然语言处理等领域,取得了显著的性能提升。
深度卷积神经网络在计算机视觉中的应用研究综述 2
深度卷积神经网络在计算机视觉中的应用研究综述
卢宏涛;张秦川
【摘 要】随着大数据时代的到来,含更多隐含层的深度卷积神经网络(Convolutional neural networks,CNNs)具有更复杂的网络结构,与传统机器学习方法相比具有更强大的特征学习和特征表达能力.使用深度学习算法训练的卷积神经网络模型自提出以来在计算机视觉领域的多个大规模识别任务上取得了令人瞩目的成绩.本文首先简要介绍深度学习和卷积神经网络的兴起与发展,概述卷积神经网络的基本模型结构、卷积特征提取和池化操作.然后综述了基于深度学习的卷积神经网络模型在图像分类、物体检测、姿态估计、图像分割和人脸识别等多个计算机视觉应用领域中的研究现状和发展趋势,主要从典型的网络结构的构建、训练方法和性能表现3个方面进行介绍.最后对目前研究中存在的一些问题进行简要的总结和讨论,并展望未来发展的新方向.
【期刊名称】《数据采集与处理》
【年(卷),期】2016(031)001
【总页数】17页(P1-17)
【关键词】深度学习;卷积神经网络;图像识别;目标检测;计算机视觉
【作 者】卢宏涛;张秦川
【作者单位】上海交通大学计算机科学与工程系,上海,200240;上海交通大学计算机科学与工程系,上海,200240
【正文语种】中 文 【中图分类】TP391
图像识别是一种利用计算机对图像进行处理、分析和理解,以识别各种不同模式的目标和对象的技术,是计算机视觉领域的一个主要研究方向,在以图像为主体的智能化数据采集与处理中具有十分重要的作用和影响。使用图像识别技术能够有效地处理特定目标物体的检测和识别(如人脸、手写字符或是商品)、图像的分类标注以及主观图像质量评估等问题。目前图像识别技术在图像搜索、商品推荐、用户行为分析以及人脸识别等互联网应用产品中具有巨大的商业市场和良好的应用前景,同时在智能机器人、无人自动驾驶和无人机等高新科技产业以及生物学、医学和地质学等众多学科领域具有广阔的应用前景。早期的图像识别系统主要采用尺度不变特征变换(Scale-invariant feature transform,SIFT[1])和方向梯度直方图(Histogram of oriented gradients,HOG[2])等特征提取方法,然后将提取到的特征输入至分类器中进行分类识别。这些特征本质上是一种手工设计的特征,针对不同的识别问题,提取到的特征好坏对系统性能有着直接的影响,因此需要研究人员对所要解决的问题领域进行深入的研究,以设计出适应性更好的特征,从而提高系统的性能。这个时期的图像识别系统一般都是针对某个特定的识别任务,且数据的规模不大,泛化能力较差,难以在实际应用问题当中实现精准的识别效果。
卷积神经网络研究综述
卷积神经网络研究综述
作者:李炳臻 刘克 顾佼佼 姜文志
来源:《计算机时代》2021年第04期
摘 要: 回顾了卷积神经网络的发展历程, 介绍了卷积神经网络的基本运算单元。在查阅大量资料基础上,重点介绍了有代表性的AlexNet、VGGNet、GoogLeNet、ResNet等,对他们所用到的技术进行剖析,归纳、总结、分析其优缺点,并指出卷积神经网络未来的研究方向。
关键词: 卷积神经网络; AlexNet; VGGNet; GoogLeNet; ResNet
中图分类号:TP399 文献标识码:A 文章编号:1006-8228(2021)04-08-05
Absrtact: This paper reviews the development of convolutional neural networks, and
introduces the basic operation unit of convolutional neural networks. On the basis of consulting a large amount of information, this paper focuses on the representative convolutional neural networks
such as AlexNet, VGGNet, GoogLeNet and ResNet etc., analyzes the technologies they used,
summarizes and analyzes their advantages and disadvantages, and points out the future research
direction of convolutional neural networks.
【机器学习基础】卷积神经网络(CNN)基础
【机器学习基础】卷积神经⽹络(CNN)基础
最近⼏天陆续补充了⼀些“线性回归”部分内容,这节继续机器学习基础部分,这节主要对CNN的基础进⾏整理,仅限于基础原理的了解,更复杂的内容和实践放在以后再进⾏总结。
卷积神经⽹络的基本原理
前⾯对全连接神经⽹络和深度学习进⾏了简要的介绍,这⼀节主要对卷积神经⽹络的基本原理进⾏学习和总结。
所谓卷积,就是通过⼀种数学变换的⽅式来对特征进⾏提取,通常⽤于图⽚识别中。
既然全连接的神经⽹络可以⽤于图⽚识别,那么为什么还要⽤卷积神经⽹络呢?
(1)⾸先来看下⾯⼀张图⽚:
在这个图⽚当中,鸟嘴是⼀个很明显的特征,当我们做图像识别时,当识别到有“鸟嘴”这样的特征时,可以具有很⾼的确定性认为图⽚是⼀个鸟类。
那么,在提取特征的过程中,有时就没有必要去看完整张图⽚,只需要⼀⼩部分就能识别出⼀定具有代表的特征。
因此,使⽤卷积就可以使某⼀个特定的神经元(在这⾥,这个神经元可能就是⽤来识别“鸟嘴”的)仅仅处理带有该特征的部分图⽚就可以了,⽽不必去看整张图⽚。
那么这样就会使得这个神经元具有更少的参数(因为不⽤再跟图⽚的每⼀维输⼊都连接起来)。
(2)再来看下⾯⼀组图⽚:
上⾯两张图⽚都是鸟类,⽽不同的是,两只鸟的“鸟嘴”的位置不同,但在普通的神经⽹络中,需要有两个神经元,⼀个去识别左上⾓的“鸟嘴”,另⼀个去识别中间的“鸟嘴”:
但其实这两个“鸟嘴”
的形状是⼀样的,这样相当于上⾯两个神经元是在做同⼀件事情。 ⽽在卷积神经⽹络中,这两个神经元可以共⽤⼀套参数,⽤来做同⼀件事情。
(3)对样本进⾏⼦采样,往往不会影响图⽚的识别。
如下⾯⼀张图:
假设把⼀张图⽚当做⼀个矩阵的话,取矩阵的奇数⾏和奇数列,可看做是对图⽚的⼀种缩放,⽽这种缩放往往不会影响识别效果。
卷积神经⽹络中就可以对图⽚进⾏缩放,是图⽚变⼩,从⽽减少模型的参数。
卷积神经⽹络的基本结构如图所⽰:
从右到左,输⼊⼀张图⽚→卷积层→max pooling(池化层)→卷积层→max pooling(池化层)→......→展开→全连接神经⽹络→输出。
