中国教育热线  >  新闻  >  深度学习十年开展回忆里程碑论文汇编(上)

深度学习十年开展回忆里程碑论文汇编(上)

放大字体  缩小字体 2020-01-21 14:23:45  阅读:464 来源:自媒体 作者:TalkingData

原标题:深度学习十年开展回忆:里程碑论文汇编(上)

跟着21世纪第二个十年即将完毕,咱们有必要回忆一下这十年来在深度学习范畴所取得的巨大进步。在功用日益强壮的计算机及大数据可用性的推进下,深度学习现已成功霸占了从前扎手的难题,特别是在计算机视觉和自然言语处理方面。深度学习在咱们的日常日子中已无处不在,从无人驾驶到医学影像剖析,从虚拟助理到深度假装。

本篇文章概述了曩昔十年来最有影响力的一些论文。我期望经过简洁明了的摘要来供给深度学习范畴不同方向的起点,而且供给了相当多的参阅资料。

考虑到这项研讨的性质,能够说是一千个人心中有一千个哈姆雷特。最有影响力的论文一般既不是榜首篇论文也不是最好的那篇论文。我尽力在它们之间找到平衡,并将最有影响力的论文作为首要条目,而将相关论文作为荣誉奖予以列出。当然,鉴于主观性的存在,这份列表并不是什么威望榜单如此。假如你觉得这份榜单有所遗失,次序或描绘存在过错,请告诉我一声,以便加以改进,让这份榜单愈加完好精确。

2010

了解深度前馈神经网络练习的难点(7446次引证)

Xavier初始化后的激活(上)和不进行初始化的激活(下)

本文探讨了深度网络的一些问题,特别是权值的初始随机化。本文还留意到了S型曲线和双曲正切激活问题,并提出了代替计划SoftSign,它是一种具有愈加滑润的渐近线的S型激活函数。可是,本文最首要的奉献在于初始化。

当运用正态散布的权重进行初始化时,数值很或许会急剧增大或许减小,然后无法进行练习。假定前一层的值是正态散布的独立同散布,则将它们相加会增大其方差,因而应按输入数量成份额地缩小方差,以坚持输出值遵守规范正态散布。将这个逻辑反过来(即按输出数量做处理)则能够处理梯度的问题。本文介绍的Xavier初始化是两者之间的折衷,是运用方差为

的正态散布初始化权重, 和 分别是前一层神经元和后一层神经元的数量。2015年的一篇论文《深入研讨整流函数:在ImageNet分类上逾越人类水平》介绍了Kaiming初始化,它是在Xavier初始化的根底上考虑了ReLU激活函数的一个改进版别。

2011

深度稀少整流神经网络 (4071 次引证)

从最早的MLP到2015年左右的许多神经网络都是用S型函数作为激活函数。S型函数具有处处可微和输出有界的特色,常用的有Logistic函数和双曲正切函数。而且它与神经生物学中的全或无定律相吻合。(注:全或无定律是神经传导的一项根本特性。即当影响到达神经元的反响阈限时,它便以最大的脉冲振幅加以反响,但影响强度达不到某种阈限时,神经元便不发生反响。概况参阅https://en.wikipedia.org/wiki/All-or-none_law)可是,由于S型函数的导数从零开始敏捷衰减,因而跟着神经网络层数的添加,梯度一般会敏捷减小。这便是咱们常说的梯度消失问题,这也正是其时神经网络难以深度扩展的原因之一。该论文提出,运用ReLU激活函数来处理梯度消失问题,然后为神经网络的深度开展奠定了根底。 (注:ReLU,Rectified Linear Unit,一种常用的激活函数,称为线性整流函数或批改线性单元)

S型函数及其导数

尽管如此,ReLU函数仍是存在一些缺点:它们在0处不行微,它们能够无限增加,而且当一半节点激活并饱满后,剩余的节点就成了“逝世”节点。2011年以来,人们提出了许多改进办法来处理这样的一个问题,但其成效大多不如vanilla ReLUs。

《Digital selection and analogue amplification coexist in a cortex-inspired silicon circuit》(2000)一文被遍及以为是树立ReLU的生物学合理性的榜首篇论文,而《What is the Best Multi-Stage Architecture for Object Recognition?》一文则是我能找到的将ReLU函数(在本文中其被称为活跃部分)用于神经网络的最早的论文。

闻名文章对其的引证:

  • 整流非线性改进神经网络声学模型: 该论文介绍了带走漏线性整流函数(Leaky ReLU),由于在负半部分上存在较小的梯度“走漏”,因而其输出不为零。这也避免了ReLU激活函数中部分神经元逝世现象的呈现。可是,Leaky ReLU在0处的导数是不接连的。
  • 指数线性单元快速精确的深度网络学习: 指数线性单元(ELUs,Exponential Linear Units)和 Leaky ReLU相似,但在负侧更滑润且饱满值为-1。
  • Self-Normalizing神经网络: 自归一化神经网络(SELUs,Self-Normalizing Neural Networks)旨在缩放ELU来创立固定点,并将其散布修正为规范正态散布,然后处理数据批量归一化的需求。
  • 高斯差错线性单位: 高斯差错线性单元(GELU,Gaussian Error Linear Units (GELUs):)作为一种常用的激活函数,其激活是依据高斯散布及对应的随机正则器dropout。具体来说,一个特定的值被保存的概率是规范正态散布的累积散布函数。因而,这个变量的期望值在随机正则化后就变成了。GELU在许多SOTA模型中有所运用,如BERT和GPT/GPT2。

2012

深度卷积神经网络的ImageNet分类(52025次引证)

AlexNet 结构

AlexNet是一个运用ReLU激活函数,包括6千万参数的卷积神经网络。其最首要的奉献在于展现了深层网络的强壮功用,由于就其实质而言,它的架构是曩昔的神经网络的更深版别。

闻名文章对其的引证:

ImageNet层次结构中的图画示例

  • 灵敏、高功用的卷积神经网络用于图画分类: 这篇论文早于AlexNet宣布并与AlexNet有着许多共同点:这两篇论文都运用GPU加快练习神经网络,都运用ReLU激活函数来处理梯度消失问题。一些人以为这篇文章被萧瑟是很不公平的,它的被引量远少于AlexNet。

LeNet 结构

2013

单词和短语的散布式表明及其组合性(16923次引证)

本文(以及同一作者之前的论文《Efficient Estimation of Word Representations in Vector Space》)介绍了word2vec,现在它已然成为深度学习的NLP模型中文本编码的首要办法。它依据呈现在相似上下文中的单词或许具有相似的意义这一思维,而将单词嵌入向量中,然后运用于其他模型。Word2vec练习了这样一个网络,可拿来猜测一个给定单词的上下文,然后提取出网络中潜在的向量。

闻名文章对其的引证:

  • GloVe: 单词表明的大局向量: GloVe的中心思维与word2vec相同,是其改进版别,可是完成办法略有不同。关于这两个模型哪一个更好,人们至今没有结论。

运用深度强化学习玩Atari(3251次引证)

DeepMind的Atari DQN的研讨成果敞开了深度强化学习范畴的大门。强化学习之前常用在比如网格国际之类的低维环境,很难在杂乱环境中有所运用。Atari是强化学习在高纬度环境下的榜首例成功运用,这使得强化学习从籍籍无名而回身称为AI范畴的香饽饽。

本文特别运用了深度Q学习,这是一种依据价值百科的强化学习办法。依据价值百科便是说方针是经过遵从由Q值函数隐式界说的战略来了解在每种状况下取得的奖赏的期望值。本文所运用的战略是 —它依据Q函数及概率的估量成果而采纳最贪婪(即得分最高)的举动。这样也是为了探究整个状况空间。练习Q值函数的方针是从贝尔曼方程(Bellman equation)推导出来的,它将Q值分解为当时奖赏值与加权后的下一期的最大Q值之和 ,然后能轻松完成参数的自更新。这种依据当时值和未来价值百科函数之和来更新价值百科函数的办法一般被称为时差学习(Temporal Difference Learning)。

闻名文章对其的引证:

  • Learning from Delayed Rewards: Christopher Watkins宣布于1989年的博士毕业论文介绍了Q学习。

2014

生成对立网络(被引证13917次)

因其绝妙的可视化功用,生成对立网络怎样称其成功也不为过。依托于生成器(Generator)和鉴别器(Discriminator)之间的极大极小博弈,GANs能够对杂乱、多维度散布进行建模,其方针一般是图片。生成器的方针便是最小化鉴别器正确鉴别过错样本的对数概率,也即log(1 - D(G(bold)))log(1−D(G(z))) ;而鉴别器的方针则是最大化关于正确和过错样本的分类差错,也即log D(x) + log(1 - D(G(bold)))logD(x)+log(1−D(G(z))) 。

“极大极小博弈中对生成器的投入关于理论研讨非常有利,但在实践操作中用途不大——Goodfellow, 2016”

实践运用中,生成器常被练习用作最大化鉴别器判别犯错的对数概率,即D(G(bold))D(G(z)) , (相关阅览:NIPS2016攻略:生成对立网络,章节3.2.3)。这一小小的改动减小了梯度饱满(gradient saturating)且提高了模型练习的安稳性。

闻名文章对其的引证:

  • Wassertein GAN及改进的Wassertein GAN: 原版生成对立网络(Vanilla GANs)存在种种问题,特别是练习的安稳性问题。即便经过细微调整,原版GANs也常常练习失利,或许呈现形式溃散(也即,生成器生成只生成几张图片)的状况。调整梯度的Wassertein GAN提高了练习安稳性,因而也成为现在事实上默许运用GAN。原版GANs运用Jensen-Shannon间隔法,导致散布之间因不正常的梯度饱满简直不相交;WGAN与之不同,选用的是Earth Mover间隔法。WGAN原稿论文经过约束权重的办法,强加了一个要求梯度小于任何一个常量的Lipschitz接连性约束,然后经过调整梯度的办法改进了一些存在的问题。
  • StyleGAN: StyleGAN能够生成令人惊叹的、简直无法区别于实在图片的高清图片。生成如此高清图片的GANs之中所运用的最重要的技能便是渐进地增大图片巨细,而StyleGAN内置了这项技能。StyleGAN还能修正不同巨细规划的图片的隐空间,然后只对生成图片的特定细节做相关操作。

经过联合学习对齐和翻译的神经机器翻译(被引证9882次)

这篇文章引入了attention的概念,即,咱们我们能够不挑选紧缩信息进一个RNN的隐空间里,而是在内存中保存悉数的内容,经过“mathcal(nm)O(nm)”这一操作,使输出的一切要素处理输入的一切要素。即便attention要求递加二阶收敛,它仍然比固定状况的RNNs体现更优异,不仅在相似于翻译和言语建模的文本处理范畴不行或缺,其身影也络绎在与之相去甚远的GANs范畴的模型中。

Adam:随机优化的一个办法(被引证34082次)

Adam因其易于微调在自适应优化中被广泛运用,它依据为每个参数适配独自的学习率的理念。尽管最新的一些文章对Adam的体现提出了质疑,但它仍然是深度学习范畴中最为盛行的优化算法。

闻名文章对其的引证:

  • 无耦合权重衰减正则化: 这篇文章宣称发现了在一般施行中运用带权重衰减的Adam运用的一个过错,并提出代替计划AdamW优化来处理上述问题。
  • RMSProp: 另一个盛行的自适应优化办法(特别是RNNs范畴,尽管这个办法与Adam比较终究孰优孰劣还在争辩中)。RMSProp因其或许是机器学习范畴的课程ppt中被引证最多而“臭名远扬”。

2015

开始被规划为处理深度CNNs中的斜度消失/爆破问题而发生的残差块(residual block),现在已成为简直一切CNNs的构建柱石。概念其实分外的简略:在每个卷积层块前的输入加进输出中。残差网络的创意源自于神经网络理论上不应以更多层来降维,由于最坏的状况下,剩余的层会被粗犷地设为恒等映射(identity mapping)。可是实践操作中,更深度网络练习中常遇到各种困难;残差网络使各层更简略学习恒等映射,一起削减了梯度消失的问题。尽管办法非常简略,但从作用上看,特别是在更深度网络中,残差网络比惯例CNNs超卓得多。

闻名文章对其的引证:

许多不同CNNs之间的比照

(其它许多更杂乱得CNN根底理论文章也非常优异,这儿只列举了一小部分历史上重要的网络理论)

  • 高速网络: 残差网络是前期高速网络的一个特例。前期的高速网络经过一个相似但更杂乱的封闭式规划,来在更深度网络中处理梯度。
  • 更深度的卷积: Inception模块理论源于把卷积化为因子来削减参数数量,以及削减激活次数。它能容下更深度的层嵌套,对这篇文章中说到的GoogleNet非常有利;文中的GoogleNet后来改名为SOTA网络(ILSVRC2014)。之后的许多再次介绍Inception模块的文章也相继宣布了,Inception模块终究以Inception版别4嵌入于ResNets中,概况参阅:Inception-ResNet及残差联系在机器学习上的影响。
  • 神经常微分方程: 神经常微分方程这篇文章曾获2018年NIPS最佳论文奖,区分开了残差和微分方程。其中心观念便是讲残差网络视作接连转化的一个离散化,然后可界说残差网络为一个常微分方程的参数设定,也就能够用现成的求解器来求解。

Batch正则化:经过内部变量转化加快深度网络练习(被引证14384次)

Batch正则化是现在简直一切神经网络的又一支柱。Batch正则依据另一个简略而强有用的概念:练习中保存均值和方差数据,运用它们将原散布正则化至均值为0和方差为1。Batch正则化有用的切当原因仍存疑,但它们在实操中的有用性却母庸怀疑。

闻名文章的引证:

不同正则化手法的可视化

  • 层正则化,实例正则化,以及群正则化: 许多其它依据不同办法加总数据的可选办法如漫山遍野般呈现,分别是同批处理,批处理和通道,或许批处理和多通道。这些技能在不期望同批处理和/或通道中的不同样本相互搅扰的时分非常有用,关于这点最好的比如便是GANs中的运用。

未完持续

转自:大数据文摘

来历:leogao.dev

编译:武帅、狗小白、马莉

2020年,LeCun、周志华、李开复等大佬对AI有何等待?

2020 年值得重视的十大技能趋势

责任编辑: