卷积神经网络综述
卷积神经网络总结
1 卷积神经网络
卷积神经网络是深度学习的一种,已成为当前图像理解领域的研究热点它的权值共享网络结构使之更类似于生物神经网络,降低了网络模型的复杂度,减少了权值的数量。这个优点在网络的输入是多维图像时表现得更为明显, 图像可以直接作为网络的输入,避免了传统识别算法中复杂的特征提取和数据重建过程. 卷积网络是为识别二维形状而特殊设计的一个多层感知器,这种网络结构对平移、比例缩放以及其他形式的变形具有一定不变性. 在典型的CNN 中,开始几层通常是卷积层和下采样层的交替, 在靠近输出层的最后几层网络通常是全连接网络。卷积神经网络的训练过程主要是学习卷积层的卷积核参数和层间连接权重等网络参数, 预测过程主要是基于输入图像和网络参数计算类别标签。卷积神经网络的关键是:网络结构(含卷积层、下采样层、全连接层等) 和反向传播算法等。在本节中, 我们先介绍典型CNN 的网络结构和反向传播算法, 然后概述常用的其他CNN 网络结构和方法。神经网络参数的中文名称主要参考文献[18] 卷积神经网络的结构和反向传播算法主要参考文献[17] 。
1.1 网络结构
1.1.1 卷积层
在卷积层, 上一层的特征图(Feature map) 被一个可学习的卷积核进行卷积, 然后通过一个激活函数(Activation function), 就可以得到输出特征图. 每个输出特征图可以组合卷积多个特征图的值[17] :
()lljjxfu
1jlllljjijjiMuxkb
其中, lju称为卷积层l的第j 个通道的净激活(Netactivation), 它通过对前一层输出特征图1ljx进行卷积求和与偏置后得到的, ljx是卷积层l的第j 个通道的输出。()f称为激活函数, 通常可使用sigmoid 和tanh 等函数。jM表示用于计算lju的输入特征图子集, lijk是卷积核矩阵, ljb是对卷积后特征图的偏置。对于一个输出特征图ljx,每个输入特征图1ljx对应的卷积核lijk可能不同,“*”是卷积符号。
《2024年基于深度学习的人体行为识别算法综述》范文
《基于深度学习的人体行为识别算法综述》篇一
一、引言
随着深度学习技术的快速发展,人体行为识别在智能监控、人机交互、医疗康复等领域的应用越来越广泛。基于深度学习的人体行为识别算法已成为研究热点,其准确性和效率不断提高。本文旨在综述基于深度学习的人体行为识别算法的最新进展,分析其优缺点,为相关研究提供参考。
二、深度学习在人体行为识别中的应用
深度学习通过模拟人脑神经网络的工作方式,从大量数据中自动提取特征,具有强大的特征学习和表示能力。在人体行为识别中,深度学习主要应用于视频序列的图像处理和特征提取。
1. 卷积神经网络(CNN)
卷积神经网络是一种常用的深度学习模型,广泛应用于图像处理和视频分析。在人体行为识别中,CNN可以自动提取视频中的时空特征,如骨骼序列、关节角度等。通过训练,CNN可以学习到不同行为之间的差异,从而实现行为识别。
2. 循环神经网络(RNN)
循环神经网络可以处理具有时序依赖性的数据,如视频序列。在人体行为识别中,RNN可以通过捕捉时间序列上的上下文信息,提取更丰富的行为特征。同时,RNN还可以根据视频中的人体姿态、动作等变化预测未来行为。 3. 长短期记忆网络(LSTM)
长短期记忆网络是一种特殊的循环神经网络,能够解决RNN在处理长序列时的梯度消失和梯度爆炸问题。在人体行为识别中,LSTM可以捕捉到视频中长时间的行为模式和上下文信息,提高识别的准确性和稳定性。
三、基于深度学习的人体行为识别算法综述
基于深度学习的人体行为识别算法主要包括基于单一模型的方法和基于多模型融合的方法。
1. 基于单一模型的方法
基于单一模型的方法主要采用CNN、RNN或LSTM等单一模型进行人体行为识别。其中,CNN主要用于提取时空特征,RNN和LSTM则用于捕捉时序信息。这些方法具有计算效率高、模型简单的优点,但可能存在特征提取不全面、易受外界干扰等问题。
2. 基于多模型融合的方法
什么是卷积神经网络?
什么是卷积神经网络?
卷积神经网络,作为一种深度学习算法,被广泛应用在图像、语音、自然语言处理等领域中。那么,为什么卷积神经网络会成为热门的研究方向呢?以下为你揭开卷积神经网络受欢迎的原因。
一、数据分析与图像识别
卷积神经网络是应对图像识别等应用的一种非常有效的方法。通过特定的卷积层、池化层等设计,神经网络可以提取输入图像的特征信息,成功实现对不同类型的图像分类。
例如,在医学图像识别领域,卷积神经网络广泛应用于肺癌、乳腺癌等疾病的诊断中,这些疾病的影像通常较为复杂,需要大量的数据处理和判断,卷积神经网络能够大幅提升准确率。
二、迁移学习
在大规模数据处理中,卷积神经网络作为学习模型,拥有较高的泛化能力。同一模型可以应用在多个任务的数据集中,通过改变模型的输入和输出层,进一步提高数据处理效率。
例如,在图像分类中,如果之前训练好的模型可以适用于新的分类任务,此时可以通过迁移学习,直接拿之前的模型进行使用,适度调整神经网络中的某些参数,就可以大幅提升新任务的分类准确率。
三、网络可解释性
卷积神经网络的前向过程非常简单直观,因此结构层次分明,并且可以直观化理解。这也极大地增强了网络可解析的特性,通过可视化的方式,我们可以更好地理解它是如何实现图像识别、分类等任务的。
例如,在自动驾驶领域,卷积神经网络中的遮挡问题非常严重,如果把神经网络中的每一个层都可视化出来,就能够发现其网络结构的不同,从而检测出哪些部分容易被遮挡。
综上所述,卷积神经网络成为热门研究方向的原因众多:数据分析与图像识别、迁移学习、网络可解释性等,都是卷积神经网络成为大众研究关注的原因之一。在未来,随着技术的进一步发展,相信卷积神经网络会被广泛应用于各种研究领域,推动科技创新和智能化的发展。
什么是卷积神经网络?为什么它们很重要?
什么是卷积神经⽹络?为什么它们很重要?
卷积神经⽹络的四个基本操作:1、卷积
2、⾮线性处理(Relu)
3、⾚化或者亚采样
4、分类(全连接层)
⼀、先说卷积,卷积的主要⽬的是为了从输⼊图像中提取特征。卷积可以通过从输⼊的⼀⼩块数据中
学习到图像的特征,并且可以保留像素的空间关系。
在CNN术语中,3X3的矩阵叫做 滤波器(filter)或者核(kernel) 或者 特征检测器,
通过图像上滑动滤波器并且计算点乘得到的矩阵叫做 “卷积特征(Convolved feature)"
滤波器在原始输⼊图像上的作⽤是特征检测器。
在实践中CNN会在训练过程中学习到的这些滤波器的值,我们使⽤的滤波器越多,提取到的图像特征就越多,⽹络
所能在未知图像上识别的模式就越好。
特征图的⼤⼩由三个参数控制,我们需要在卷积前确定它们:
(1)深度:深度对应的是卷积操作所需要的滤波器的个数。
(2)步长:步长是我们在输⼊矩阵上滑动滤波器矩阵的像素数。当步长为1时,我们每次移动滤波器⼀个像素的位置。
当步长为⼆时,每次移动滤波器会跳动2个像素。步长越⼤,讲会得到更⼩的特征图。
(3)零填充,对应padding参数的设置吧。有时,在输⼊矩阵的边缘使⽤零值进⾏填充。这样我们可以对输⼊图像矩阵的边缘
进⾏滤波。零填充的⼀⼤好处是可以让我们控制特征图的⼤⼩。使⽤零填充的也叫翻卷机,不适⽤零填充的叫做
严格卷积。
⼆、⾮线性处理
这部分主要是激活函数了,relu函数,tanh函数,sigmoid函数relu⽤的⽐价多,可以解决梯度消失的问题,但是讲BN的那篇论⽂说加了BN操作之后⽤sigmoid函数效果更好。
不过我⾃⼰试了mnist数据集的效果,还是relu更好些,不过BN加在激活函数之前确实是这样。
三、池化操作
池化操作,叫做亚采样或者下采样,降低了各个特征图的维度,但可以保持⼤部分重要的信⼼。
常⽤的池化操作包括:最⼤化,平均化,加和等。
池化可以控制特征的维度,见识⽹络中的参数和计算量,控制过拟合
【机器学习基础】卷积神经网络(CNN)基础
【机器学习基础】卷积神经⽹络(CNN)基础
最近⼏天陆续补充了⼀些“线性回归”部分内容,这节继续机器学习基础部分,这节主要对CNN的基础进⾏整理,仅限于基础原理的了解,更复杂的内容和实践放在以后再进⾏总结。
卷积神经⽹络的基本原理
前⾯对全连接神经⽹络和深度学习进⾏了简要的介绍,这⼀节主要对卷积神经⽹络的基本原理进⾏学习和总结。
所谓卷积,就是通过⼀种数学变换的⽅式来对特征进⾏提取,通常⽤于图⽚识别中。
既然全连接的神经⽹络可以⽤于图⽚识别,那么为什么还要⽤卷积神经⽹络呢?
(1)⾸先来看下⾯⼀张图⽚:
在这个图⽚当中,鸟嘴是⼀个很明显的特征,当我们做图像识别时,当识别到有“鸟嘴”这样的特征时,可以具有很⾼的确定性认为图⽚是⼀个鸟类。
那么,在提取特征的过程中,有时就没有必要去看完整张图⽚,只需要⼀⼩部分就能识别出⼀定具有代表的特征。
因此,使⽤卷积就可以使某⼀个特定的神经元(在这⾥,这个神经元可能就是⽤来识别“鸟嘴”的)仅仅处理带有该特征的部分图⽚就可以了,⽽不必去看整张图⽚。
那么这样就会使得这个神经元具有更少的参数(因为不⽤再跟图⽚的每⼀维输⼊都连接起来)。
(2)再来看下⾯⼀组图⽚:
上⾯两张图⽚都是鸟类,⽽不同的是,两只鸟的“鸟嘴”的位置不同,但在普通的神经⽹络中,需要有两个神经元,⼀个去识别左上⾓的“鸟嘴”,另⼀个去识别中间的“鸟嘴”:
但其实这两个“鸟嘴”
的形状是⼀样的,这样相当于上⾯两个神经元是在做同⼀件事情。 ⽽在卷积神经⽹络中,这两个神经元可以共⽤⼀套参数,⽤来做同⼀件事情。
(3)对样本进⾏⼦采样,往往不会影响图⽚的识别。
如下⾯⼀张图:
假设把⼀张图⽚当做⼀个矩阵的话,取矩阵的奇数⾏和奇数列,可看做是对图⽚的⼀种缩放,⽽这种缩放往往不会影响识别效果。
卷积神经⽹络中就可以对图⽚进⾏缩放,是图⽚变⼩,从⽽减少模型的参数。
卷积神经⽹络的基本结构如图所⽰:
从右到左,输⼊⼀张图⽚→卷积层→max pooling(池化层)→卷积层→max pooling(池化层)→......→展开→全连接神经⽹络→输出。
卷积神经网络在模式识别中的应用概述
卷积神经网络在模式识别中的应用概述
摘要:卷积神经网络(convolutional neural network,CNN)强大的建模和表征能力很好地解决了特征表达能力不足和维数灾难等模式识别方面的关键问题,受到学者们的广泛关注。因此,本文首先介绍了卷积神经网络的发展历程及其理论模型,然后重点对卷积神经网络在文字语音识别、图像识别和人脸表情识别等中的应用作了总结。最后对卷积神经网络未来在模式识别领域的发展潜力和应用前景进行了展望。
关键词:卷积神经网络;模式识别;文字语音识别;图像识别;人脸表情识别
1 引 言
模式识别(Pattern Recognition)是人类的一项基本智能,在日常生活中,人们经常在进行“模式识别”。随着20世纪40年代计算机的出现以及50年代人工智能的兴起,人们当然也希望能用计算机来代替或扩展人类的部分脑力劳动。(计算机)模式识别在20世纪60年代初迅速发展并成为一门新学科,是指对表征事物或现象的各种形式的(数值的、文字的和逻辑关系的)信息进行处理和分析,以对事物或现象进行描述、辨认、分类和解释的过程,是信息科学和人工智能的重要组成部分。
模式识别又常称作模式分类,从处理问题的性质和解决问题的方法等角度,模式识别分为有监督的分类(Supervised Classification)和无监督的分类(Unsupervised Classification)两种。模式还可分成抽象的和具体的两种形式[1]。前者如意识、思想、议论等,属于概念识别研究的范畴,是人工智能的另一研究分支。我们所指的模式识别主要是对语音波形、地震波、心电图、脑电图、图片、照片、文字、符号、生物的传感器等对象进行测量的具体模式进行分类和辨识。
模式识别方法主要可分为四种,分别为:模板匹配法、统计模式识别法、语法模式识别法以及神经网络。其中模板匹配法是出现较早的一种方法,实现起来较简单,匹配是个通用的操作,用于定义两个实体间的相似性程度,一般是采用二维模板,匹配的要素一般采用像素、曲线及形状信息,当然在定义模板及相似性函数时要考虑到实体的姿态及比例问题,这种方法一般不需要训练,实际上模板就是由训练集建立起来的,它的缺点是适应性差。统计模式识别法的基本原理是:有相似性的样本在模式空间中互相接近,并形成“集团”,即“物以类聚”。统计模式识别的主要方法有:判别函数法, k近邻分类法,非线性映射法,特征分析法,主因子分析法等。语法模式识别法是针对复杂模式提出的,一般将模式分为子模式一级,称为基元。这种方法其难点是基元的提取及从训练数据中提取语法、结构规则。神经网络是一种复杂的并行的非线性系统,完成复杂的计算,网络的最大特点就是从训练数据中学习到输入-输出间的复杂关系,并对数据具有适应性。
深度学习中的卷积神经网络
深度学习中的卷积神经网络
深度学习作为一项涉及模式识别、自然语言处理等各种领域的技术,近年来越来越受到关注。在深度学习算法中,卷积神经网络(Convolutional Neural Networks,CNN)被广泛应用于图像识别、人脸识别、语音识别等领域,其出色的处理能力备受业界赞赏。
卷积神经网络的概念和发展
卷积神经网络是一种用于图像、语音等自然信号处理的深度神经网络,于1980年代初在心理学、生物学以及神经学等领域内开始得到关注,主要是用来模仿生物神经系统中的视觉感知机制。1998年,科学家Yann LeCun基于卷积神经网络提出了一个手写数字识别系统——LeNet,该系统主要应用于美国邮政部门的手写数字识别。这个系统在当时的手写数字识别领域中取得了很大的成功,证明了卷积神经网络在图像处理领域的应用潜力。
近年来,随着深度学习技术的快速发展,以及算力和数据的快速增长,卷积神经网络得到了快速发展。在图像识别和视觉研究领域,卷积神经网络取得了很大的成功。2012年,Hinton等学者提出的AlexNet模型利用多层卷积神经网络对图像进行了分类,取得了ImageNet图像识别比赛冠军,大大提高了卷积神经网络在图像识别领域的应用价值,在业界掀起了一股深度学习的浪潮。
卷积神经网络的结构和特点
卷积神经网络与传统神经网络的最大区别在于其采用了特殊的卷积层结构,并通过卷积核来共享参数,从而大大减少了模型的参数数量。卷积神经网络的基本结构包含了卷积层、池化层、全连接层和softmax分类器。
卷积层(Convolutional Layer)是卷积神经网络中最重要的结构,其主要功能是提取输入信号的局部特征。卷积层通过在输入信号上滑动卷积核的方式来提取特征,卷积核由一组可训练的权重和一个偏置项构成。卷积层会对特征图进行下采样,从而得到更多特征,进而提高模型的表现能力。
池化层(Pooling Layer)用于降维和特征提取,可以减少卷积层的矩阵运算量,并防止过拟合。池化层的常见方式为最大池化,即在一个区域内取最大值。因为最大池化可以保留图像的主要特征,所以在实际应用中被广泛使用。
浅谈卷积神经网络
科技论坛 ・43・ 浅谈卷积神经网络 景国秀 (西安思源学院,陕西西安710038) 摘要:卷积神经网络,顾名思义就是由若干卷积层组成网络,而每层卷积层都由若干卷积核组成。其运作原理分为以下几步:将一 副原始图像输入网络,网络的底层卷积核对图像进行卷积操作,而处理后的结果被称为特征图,意为由卷积核提取出来的图像特征;而 后,该层卷积核组成的特征图作为下一层卷积层的输入依次进行特征提取。通过上述步骤的多次重复,即可以将图像的初始特征逐渐抽 象、深化,最终演变成利于网络进行分类的特征。 关键词:卷积神经网络;矩阵分析;结构 1卷积神经网络(GNN)介绍 卷积神经网络(Convolution ̄Neural Networks),是基于人的视 觉认知模型上的一种人工神经网络,由于其具有位移、缩放即扭曲 图像不变性,且其分层式的特征提取方式,使得我们得到的从低层 次到高层次的各层特征。 2网络原理 卷积神经网络的设计受人眼的视觉通路启发,通过将上一层的 输出当做下一层的输入,由此实现特征的提取以及抽象化。1958 年,David Hubel进行了一项关于的猫的视觉研究。而后,随着人们 的进一步研究,人们发现人脑中也有类似的细胞。而人脑的视觉通 路也是在这种基础上构成的。 卷积神经网络进行特征提取的方式与人脑视觉回路进行特征 提取的方式相同:从像素级别进行特征提取,得到图像的边沿特征, 而后进行特征组合得到更高级的局部特征,而后再进行特征提取与 特征组合,知道得到对应的目标模型进行分类。 3网络结构 一个卷积神经网络主要由以下四部分组成:卷积层(Convolution Layer),池化层(Pooling Layer),全连接层(Fully Connected Layer), 损失函数(Loss Function)。通过将各层进行级联,实现对图像的特征 分层提取以及特征组合。 3.1卷积层 卷积层实现的是对图像的特征提取工作。在卷积神经网络中处 于低层次的卷积层,完成对图像的边缘检测,而更高层次的卷积层 则是对提取到的特征图做进一步的特征提取,产生更加抽象的特 征,便于进行分类等工作任务。每一个卷积层都含有若干个卷积核, 通过不同的卷积核完成对不同特征的提取,其公式表达如式(1)所 示。 =厂( + ) J 。Z— ‘ (1) f:贸I---)贸——激活函数 其中,激活函数是用来加入非线性因素的,以增强系统的表达 能力。常用的激活函数有Sigmoid函数(2),TanH函数(3)和ReLU 函数(4)。 l g ( ) (2) nHfx'l=生 (3) e le 、 R比U(x)=max(O,x) 一 3,2池化层 池化层实现对特征图的再采样,通过将图像分成若干小区域 (通常是2x2像素大小),在每个小区域内采样,不仅减少了数据量, 同时也使得获取的特征更加有效。常用的池化方法有最大值池化 (Max—Pooling),均值池化(Mean—Polling)。本文中使用的是最大值池 化(5),通过在小区域中挑选出数值最大的值作为输出,实现了对主 要特征的提取。其池化方法如式 )所示: 。 ( 一 ) f51 3.3全连接层 全连接层是一种特殊的卷积层,通常位于网络的最顶层。全连 接层与卷积层一样,含有许多卷积层,不同于卷积层的是它的卷积 核大小与输入的特征图大小相同,因此全连接层实现了对最后的抽 象特征进行组合。 3-4损失函数 损失函数是网络在训练过程中必不可少的部分。在训练过程 中,通过比较网络的输出与既定目标间的特征距离,利用反向传导 算法,不断调整整个网络中的参数,从而不断优化网络结构,使得网 络由最初始的随机结构演变为特定结构,更好的完成任务目标。常 用的损失函数有SoftMax损失函数以及欧氏距离损失函数等,都是 针对做不同任务设计的损失函数。 3.4.1 SoflMax损失函数 SoflMax损失函数是Logistic损失函数在多分类问题上的推广, 在多分类问题中,类标签可以取k个不同的标签值。因此,我们在 训练中,对于训练集{(x∞,Y∞),(x。 ,Y。 )'.. x㈣,y㈣)},我们有 {l,乏… j。对于给定的输入x,需要估算其属于类别j的概率, 因此使用概率估计函数h (x0)对其进行估计。 h (x卿)= P(Y0 = )JX0);0 l P 一 ●●●●-● ’ 而SoftMax损失函数的目标函数则可以写为式(7): 1『J,, 1 ‘,( )=. l∑(1一yO))1og(1一h (x回))+y∞logh (x。)l(7) 【 l J 3.4.2欧式距离损失函数 欧式距离损失函数是以减小系统输出和指定标签间的欧式距 离为目标,是一种基本的损失函数。 4结论 卷积神经网络的层级间的结构,使得网络有着生物学基础,而 且使得该方面的很多研究都远远超过较为传统的方法,为图像处理 等领域做出了突出贡献。卷积神经网络就是矩阵分析的一个典型 应用。我们通过将物理问题数学化,将数学问题矩阵化,能更好地、 更’陕地解决实际生活中的问题。 参考文献 『1]Simard P Y,Steinkraus D,Piatt J C.Best practices foreonvo— lutional neural networks applied to visual document analysis【C】. 2013 12th International Conference on Document Analysis and Recognition.IEEE Computer Society,2003,2:958—958. 【2】He K,Zhang X,Ren S,et a1.Spatial Pyramid Pooling in Deep Convolutional Networks for Visual Recognition[J].IEEE Transactions on Pattern Analysis&Machine Intelligence,2014,37 (9):1904—1916. 【3]Ouyang W,Wang X,Zeng X,et a1.DeeplD—Net:Deformable deep convolutional neural networks for object detection[C].Computer Vision and Pattern Recognition.IEEE,2015:358—360.
图卷积神经网络(GCN)入门
图卷积神经网络(GCN)入门
图卷积网络Graph Convolutional Nueral Network,简称GCN,最近两年大热,取得不少进展。不得不专门为GCN开一个新篇章,表示其重要程度。本文结合大量参考文献,从理论到实践,从由来到数学推导,讲述GCN的发展和应用。
综述
在扎进GCN的汪洋大海前,我们先搞清楚GCN是做什么的,有什么用。深度学习一直都是被几大经典模型给统治着,如CNN、RNN等等,它们无论再CV还是NLP领域都取得了优异的效果,而GCN主要是针对图结构的。社交网络、信息网络中有很多类似的结构。实际上,这样的网络结构(Non Euclidean
Structure)就是图论中抽象意义上的拓扑图。图的结构一般来说是十分不规则的,可以认为是无限维的一种数据,所以它没有平移不变性。每一个节点的周围结构可能都是独一无二的,这种结构的数据,就让传统的CNN、RNN瞬间失效。所以很多学者从上个世纪就开始研究怎么处理这类数据了。这里涌现出了很多方法,例如GNN、DeepWalk、node2vec等等,GCN只是其中一种。图卷积神经网络,实际上跟CNN的作用一样,就是一个特征提取器,只不过它的对象是图数据。GCN精妙地设计了一种从图数据中提取特征的方法,从而让我们可以使用这些特征去对图数据进行节点分类(node
classification)、图分类(graph classification)、边预测(link prediction) ,还可以顺便得到 图的嵌入表示(graph embedding),可见用途广泛。因此现在人们脑洞大开,让GCN到各个领域中发光发热。我们直接看看GCN的核心部分:假设我们手头有一批图数据,其中有\(N\)个节点(node),每个节点都有自己的特征,我们设这些节点的特征组成一个\(N×D\)维的矩阵\(X\),然后各个节点之间的关系也会形成一个\(N×N\)维的矩阵\(A\),也称为 邻接矩阵(adjacency matrix)。\(X\)和\(A\)便是我们模型的输入。
(完整版)卷积神经网络CNN原理、改进及应用
卷积神经网络(CNN)
一、简介
卷积神经网络(Convolutional Neural Networks,简称CNN)是近年发展起来,并引起广泛重视的一种高效的识别方法。
1962年,Hubel和Wiesel在研究猫脑皮层中用于局部敏感和方向选择的神经元时发现其独特的局部互连网络结构可以有效地降低反馈神经网络的复杂性,继而提出了卷积神经网络[1](Convolutional
Neural Networks-简称CNN)7863。现在,CNN已经成为众多科学领域的研究热点之一,特别是在模式分类领域,由于该网络避免了对图像的复杂前期预处理,可以直接输入原始图像,因而得到了更为广泛的应用。
Fukushima在1980年基于神经元间的局部连通性和图像的层次组织转换,为解决模式识别问题,提出的新识别机(Neocognitron)是卷积神经网络的第一个实现网络[2]。他指出,当在不同位置应用具有相同参数的神经元作为前一层的patches时,能够实现平移不变性1296。随着1986年BP算法以及T-C问题[3](即权值共享和池化)9508的提出,LeCun和其合作者遵循这一想法,使用误差梯度(the error
gradient)设计和训练卷积神经网络,在一些模式识别任务中获得了最先进的性能[4][5]。在1998年,他们建立了一个多层人工神经网络,被称为LeNet-5[5],用于手写数字分类,这是第一个正式的卷积神经网络模型3579。类似于一般的神经网络,LeNet-5有多层,利用BP算法来训练参数。它可以获得原始图像的有效表示,使得直接从原始像素(几乎不经过预处理)中识别视觉模式成为可能。然而,由于当时大型训练数据和计算能力的缺乏,使得LeNet-5在面对更复杂的问题时,如大规模图像和视频分类,不能表现出良好的性能。
因此,在接下来近十年的时间里,卷积神经网络的相关研究趋于停滞,原因有两个:一是研究人员意识到多层神经网络在进行BP训练时的计算量极其之大,当时的硬件计算能力完全不可能实现;二是包括SVM在内的浅层机器学习算法也渐渐开始暂露头脚。直到2006年,Hinton终于一鸣惊人,在《科学》上发表文章,使得CNN再度觉醒,并取得长足发展。随后,更多的科研工作者对该网络进行了改进。其中,值得注意的是Krizhevsky等人提出的一个经典的CNN架构,相对于图像分类任务之前的方法,在性能方面表现出了显著的改善2674。他们方法的整体架构,即AlexNet[9](也叫ImageNet),与LeNet-5相似,但具有更深的结构。它包括8个学习层(5个卷积与池化层和3个全连接层),前边的几层划分到2个GPU上,(和ImageNet是同一个)并且它在卷积层使用ReLU作为非线性激活函数,在全连接层使用Dropout减少过拟合。该深度网络在ImageNet大赛上夺冠,进一步掀起了CNN学习热潮。
