
对于人类来说,描述我们的眼睛所看到的东西(即“视觉世界”)是微不足道的,但是对于计算机而言,识别人类的“对象”是相当困难的.
解决此问题可以带来很高的回报. “图像识别”技术,更广泛地说是“计算机视觉”技术,是许多新兴技术的基础. 自动驾驶汽车,面部识别软件,监视管道缺陷和违规行为的“智能工厂”,保险公司用来对索赔照片进行处理和分类的自动化软件……这些高科技技术都需要“图像识别”.
科学家如何解决这一挑战?
学会“看”是一项艰巨而昂贵的任务

理论上,我们可以使用常规的神经网络进行图像分析,但是在实际操作中,从计算角度来看,使用此方法的成本非常高. 例如,常规的神经网络即使处理非常小的图像(假设为30×30像素的图像),仍需要900个数据输入和500,000个以上的参数. 对于相对强大的机器来说图像识别原理,这种处理仍然可行. 但是,如果需要处理较大的图像,则机器所需的数据输入和参数数量将增加到难以想象的水平.
真正的解决方案卷积
幸运的是,我们发现仅对神经网络的结构进行小的更改就可以使大图像的处理更具操作性. 修改后的神经网络称为“卷积神经网络”,也称为CNN或ConvNets.
在任何图像中,相似性和相似性之间的相关性非常强. 确切地说,“卷积神经网络”使用此原理. 具体而言,图像中的两个相邻像素比图像中的两个单独像素更相关. 但是,在常规的神经网络中图像识别原理,每个像素都连接到单独的神经元. 这样一来,计算负担自然就会增加,而增加的计算负担实际上会削弱网络的准确性.

卷积网络通过减少许多不必要的连接来解决此问题. 用技术术语来说,“卷积网络”根据相关程度过滤不必要的连接,从而使图像处理过程在计算上更具可操作性. “卷积网络”有意限制连接,使神经元仅接受来自上一层小段(假设3×3或5×5像素)的输入,从而避免了过多的计算负担.
“卷积神经网络”的内在原理
卷积神经网络如何准确过滤掉不必要的连接?秘密在于添加了两个新层: 卷积层和会聚层. 我们用一个案例来确定照片中是否存在一个名为“奶奶”的物体,并分解“卷积神经网络”的操作,并逐个描述它们.
卷积层

1. 首先,我们将祖母的照片分解为3×3像素,重叠的马赛克块.
2. 然后,我们在简单的单层神经网络上运行每个图块,并保持权衡取舍. 此操作将使我们的马赛克变为一个图片组. 由于我们从一开始就将原始图像分割成小图像,因此用于图像处理的神经网络也相对易于操作.
3. 接下来,我们将这些输出值安排在图片组中,使用数字代表照片中每个区域的内容,数字轴代表高度,宽度和颜色. 然后,我们对每个图块进行三维数值表示.
会聚层

“会聚层”将这个三维(或三维)图形组的空间尺寸与采样功能结合在一起,以输出仅包含图像相对重要部分的联合数组. 该联合数组不仅可以最大程度地减少计算量,而且可以有效避免过拟合的问题.
最后,我们将从“收敛层”获得的样本数组用作常规的,完全连接的神经网络. 通过卷积和收敛,我们大大减少了输入数量,普通的普通网络可以完全处理它.
以上仅是“卷积神经网络”工作过程的简要说明. 实际上,它的工作过程更加复杂. 另外,与我们这里的情况不同,实际上由“卷积神经网络”处理的内容通常包含数百甚至数千个标签.
张伟伟整理
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-162763-1.html
一切爱好和平与尊重他国领土主权的国家