
重尾的普遍性预测了超大型预训练深层神经网络的测试准确性趋势,这是今年1月24日在Arxiv上发布的一篇论文. 作者还对此主题发表了一系列的部分理论文章,这是其中最实用的文章

本文建立了神经网络泛化能力的泛化理论,它不仅可以解释神经网络中各种正则化方法为何有效,而且可以使用指标来预测训练网络的泛化. 在本文中,我认为有很多高级数学,其中许多我觉得更难理解,因此这里只是我所理解的概述,写下本文的注释,更喜欢专家问
当我第一次学习深度学习时,我对各种正则化方法感到困惑. 传统的机器学习是增加L1或L2常规项目. 当涉及深度学习时,许多看似完全不同的方法(例如批处理大小,辍学和提前停止)称为正则化. 两者都是正则化方法. 有了这么多的正则化方法,对于监督学习而言,两个训练有相同数据的DNN使用不同的超参数进行训练,不同的优化方法和正则化方法,除了让模型在真实数据上运行之外,无法估算预先建立模型. 如果可以通过对模型本身的分析来评估模型的相对泛化能力,则可以将其用作微调模型的指导.

该理论已得到验证,该数据来自真实世界的神经网络. 通过在ImageNet数据集上比较50个预训练的DNN,而无需更改模型的损失函数和网络结构,则无需重新训练模型. 当甚至不需要导入测试数据时,计算网络中每个权重矩阵的Frobenius范数的平均值,发现该平均值与模型的预测精度有关,因此可以将其推广可以通过上述指标预测模型的模型. 能力. 用于验证的模型涵盖了15种不同的网络结构,例如VGG16,ResNet等. 这表明该方法适用于各种模型.

在这里,我们显示了具有批正则化功能的不同预训练VGG和VGG网络的性能. 这里的横轴是网络的预测精度,纵轴是评估作者文章中定义的模型归一化能力的指标,左图是先前的方法,右图是新提出的指标. 可以看出这里的拟合非常好神经网络预测,接近线性拟合.


以上内容反映了ResNet上的不同情况. 除了局部分离组点外,本文提出的指标还反映了模型的相对质量. 更多网络结构的比较如下;

作者还在pytorch和Keras下提供了一个名为WeightWatcher的程序包,该程序包可以使用一行代码并将经过训练的模型作为参数来计算上述指标. 作者尝试了一下,非常方便.


接下来要解释其背后的数学原理,首先,为网络各层的权重矩阵W构造相关矩阵X

计算X矩阵的秩,并将矩阵的秩写为一系列加权秩,称为经验光谱密度(ESD)


后来,作者指出,由随机数生成的矩阵的秩可用于执行幂定律运算以适应这种分布. 这里介绍随机矩阵理论

此处的alpha表示幂律分布的尾部有多长时间. 对于ImageNet中的7,500个权重矩阵,下图表示不同矩阵的最佳拟合alpha落入不同时间间隔的次数. -80%的情况下,图中的alpha介于2-4之间,有一些非常大的情况.

用于预测上述模型的预测准确性的垂直轴是所有层的累加组平均值,并且不同深度处的层数所对应的权重由公式中的beta来控制,
在文章指出无论如何进行正则化后,都避免了权重矩阵的秩被过度重尾的随机矩阵拟合,即每个的alpha值越低上一层,网络在该层上过度拟合的风险越低. 权重矩阵的秩呈现出太长的尾幂律分布,可以直观地想象为给出了一些权重不成比例高的像素,这意味着该网络层的观察场受到限制,并且位置较高重量及其灵敏度神经网络预测,这使得模型更容易过拟合. 因此,将网络中每一层权重矩阵的alpha值添加到权重衰减中,可用于评估模型是否过拟合.
总而言之,本文提出的测量模型相对泛化能力的通用方法是使用现有的成熟模型,发现规则,并以此指导新模型的训练. 该方法可用于转移学习和模型微调. 我只了解本文数学的知识,有一些问题,没有答案. 第一种是非CNN系列的网络结构,例如胶囊网络,图卷积网络GCN等. 第二种方法是否适用于自动编码器系列模型. 如果将重建误差用作水平轴,则可以通过本文中的指标评估模型的泛化能力. 第三点是该方法用于图像切割. 它也会有更好的结果. 第四个问题是该方法是否适合NLP任务. 返回搜狐,查看更多
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-183849-1.html
不是现在