
在医生那年,我无意阅读理论物理学. 我不知道该出售可爱的玩具还是深度学习出售可爱的玩具而感到羞耻. 我刚刚改变了职业生涯半年多,并且敢于出售它. 真可惜〜喵〜
目前,本盟关注深度学习的机制和优化. 过渡时间不长,平均水平. 他一直都知道他可以隐藏自己的名字,成为一只安静可爱的猫. 与被摄对象相比,白梅和福帅以目标检测和视频分析,NLP等娱乐,赚钱,KPI为主. Ben Meng当前的研究仍然缺乏工程属性(没有钱可以刷ImageNet),并且没有竞争力(HR说医生不能向大学生发送ML文章...),辛苦的工作只能给知识以水.
好的,让我们开始认真的讨论. 说到优化这个坑,Benmeng并不打算深入研究各种大型机器学习优化问题或数值优化算法. Benmeng只关心非常深的网络的优化. 针对此类问题,Ben Meng认为网络结构+数据是王道. 至于各种数值优化算法,它们并不是针对深度的,但是宽度学习也是可用的. 他们只是锦上添花. 让我们开始本萌的演讲:
机制,当前在机器学习学术界的仇恨是: 为什么深度学习起作用. 顺便说一句,一些大人物仍然对深度学习感到冷嘲热讽. 他们主要不喜欢过多的黑匣子和过多的花招. 我记得施温格(Schwinger)总是鄙视费曼(Feynman)的费曼图,称其为“把戏”,但秘密地秘密使用了费曼(Feynman). 数字很重要. . . . 但是,深度学习的惊人成就对所有人都是显而易见的. 优化,我将GD类型优化放到后面,这里我只谈一些宏观方面. 超深层网络,然后出现一个问题,为什么我们需要走得那么深. 我们知道,在深度网络中有很多递归,GPU不太适合处理器. 传统的理解是模型公差的问题. 俗话说,这是深不可测的,但没有人说这是深不可测的. 但是回到数学上,该模型需要具有高容量,并且几层超宽网络可以做到这一点. 实际上,宽容并不重要. 关键是优化. 有人提供了证据. 他们计算出鞍点和局部临界点(通常称为临界点)的数量随网络规模而变化. 人们发现临界点的数量与
(引用公式11),通过增加宽度带来的局部优势呈指数增长. 相反,深度增加所带来的局部优势的增加要慢得多. 我们知道,如果本地优势过多,则存在过度拟合的风险. 从理论上讲,加深交换公差要比扩大交换公差更经济,过拟合的风险也较低. 同时,根据该理论,极深网络的性能瓶颈可能不在于过度拟合. 这样,很高兴,深度学习将变得深入. (这不是胡话〜喵!)
降级问题. 降级意味着非常深的网络的性能要比较浅的网络的性能差,而且越深的网络的性能越差,这不能满足我们最初的深化意图. 残留网络的出现有效地改变了这种现状. 每个人都凭直觉认为残差,即同一时期论文的高速公路网络,都采取捷径将梯度引回到上一层,以便底层可以更有效地学习,从而使网络不那么深. 但是,依靠此思想,可以设计一个具有快捷方式但效果显着的网络. 例如,在每个残差块中,两个CNN层基于特征图进行逐元素求和,然后将其添加到标识映射中. 本·莫(Ben Moe)猜测,捷径的想法可能太肤浅了. 另外,减少的特征是残渣或高速的问题. 梯度回流过程可能会跳过块内的权重层. 这样,某些街区尚未接受任何培训. 结果,不同的块可能不会学到任何东西,或者学到几乎相同的东西. 的东西. 剩余的改进版本随机深度网络可以部分避免此问题. 通过随机地迫使某些块的权重层关闭,迫使其他块对训练数据进行新的调整,可以理解为在层上使用了辍学技术(例如随机深度). 处于休眠状态,如果Ben Meng错了,他可以来邀请我喝茶.

在残留网络之后,可以说各种带有快捷方式的网络如雨后春笋般涌现. 更有趣的设计,如深度融合网络,分形网络,resnet /宽余数网络中的resnet,resnet的resnet. 首先,基本上是将不同深度的多个网络直接合并. 第二个很有趣. 不再使用残差了-也就是说,不添加身份映射的输入. 其设计的网络原理具有1-N的任意深度(难怪它称为分形). 培训需要从中选择一项. 优化了数据到损失层的图形路径. 有三分之二的人都走了扩大剩余区块的道路. 我认为,何开明的整篇文章仅讨论了减少瓶颈宽度研究参数的必要性,以及其他人如何离开扩大范围. 理解学术上被(被)引用(也是划船)是通过这种方式产生的. 对于最后一个网络,一个快捷方式是不够的,在block和block之间还有另一个快捷方式. .
下面列出了各种困难. 实际上,有些困难并不像人们所说的那么可怕.
================================================ ======================
好吧,关于这么多一般性的事情,这是Benmeng的一些观点. Benmeng打算通过一些网络拓扑指标来衡量网络的性能,并正确遵循网络分类路线. 由于是分类,因此有必要使用特征. 目前,Ben Meng给出的网络特征如下:
有效宽度小. (防止过度拟合)前向深度较小,反向深度尽可能小. (即使层数很大,也有利于优化)满足条件1、2时,参数应尽可能多. (不要欠佳)
本萌做了一些实验:
================================================ ==================

以下是Benmeng的思考过程. 为什么要用这种方式定义宽度和深度?由于深度部分的理论目前过于肮脏,因此Benmeng目前无意在论文中对其进行阐述,并将在下次进行数值验证. 如果确认这与影响的深度有关,那么本萌肯定会成为一个重大新闻!如果不是这样,仅是理论对Ben Meng撒谎,Ben Meng就只能继续喂猫. . . 但是,通过理论设计的C,D网络,实验证明了它的有效性,也证明了B的结果是失败的,并且总会有安慰奖.
首先,下面给出一个玩具模型. 该玩具模型实际上是用于分析鞍点数的模型. 特定的google搜索p型旋转玻璃模型与深度学习相同. 论文很多.
看看宽度是怎么来的
在神经网络末端的神经元输出可以看作是多个连接的输入和输出路径的总和,可以通过看图片来理解(未绘制某些路径)

当然,路径之间会有重叠. 实际上,将输出作为独立的总和高估是太多了. 但是,这里我们忽略路径的重叠,通常使用多个路径的平均值代替输出. 毕竟,最终的分类取决于谁年龄更大. 除以相同的因素不会影响判断. 数学上是:

这样,假设每层的平均有效宽度为n,层数为p,则可以将路径数重新表示为:
这是获得有效宽度的方式.
然后定义深度
只需根据信息流选择一条路径,就可以粗略地看成一条旋转链,或者可以理解一张图片:

然后,各个网络的单个区块的自旋链结构,继续绘制图片(Cryben Meng计算机仅具有ubuntu系统,绘制图片全部是Google幻灯片):


然后,考虑多个块,输出是连续乘法,例如残差:
渐变为:
这样,例如梯度相关性的计算,softmax将上限输出一个exp,因此为了完成计算,请考虑
类型分布:
实际上,本孟很懒,其中有一些技巧,并且仅在网络有两个块时才考虑计算.
然后解释B,C,D网络的设计概念:
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/tongxingongju/article-304158-1.html
潜艇下潜
经济下行压力大是最好的借口
整点实在的