数据探索 – 详细了解我们的数据
数据清洗 – 清理数据,使其更适合统计建模
预测建模 – 运行实际算法并获得结果
使用pandas进行数据探索
为了进一步探索我们的数据,给你介绍另一个动物(好像Python还不够!)- Pandas

Pandas是Python中最有好用的数据分析库之一(我知道这些名字听起来很奇怪,先这样!)促使越来越多数据科学界人士使用Python。现在我们将使用pandas从Analytics Vidhya比赛中读取数据集,进行探索性分析,并构建我们的第一个基础分类算法来解决这个问题。
在数据加载之前,先了解Pandas中2个关键数据结构 – Series和DataFrames。
Series及DataFrame介绍
Series可以理解为1维标签/索引数组。你可以通过这些标签访问series的各个元素。
Dataframe类似于Excel工作簿,列名称引用列,使用行号访问行。本质区别在于dataframes中列名称和行号称为列和行索引。
Series和DataFrames构成了Pandas在Python中的核心数据模型。数据集首先被读入Dataframes,然后各种操作(例如分组、聚合等)可以非常容易地应用于其列。
应用案例 – 贷款预测问题
以下是变量的描述:
开始数据探索
首先,在terminal/ Windows命令提示符下键入以下命令,以Inline Pylab模式启动iPython界面:
ipython notebook --pylab=inline
这样在pylab环境中打开了iPython notebook,它已经导入了一些有用的库。此外,可以内联绘制数据,这使得它成为一个非常好的交互式数据分析环境。 你可以通过键入以下命令(并获得如下图所示的输出)来检查环境是否加载正确:
plot(arange(5))

我当前在Linux中工作,并将数据集存储在以下位置: /home/kunal/Downloads/Loan_Prediction/train.csv
导入库和数据集:
以下是我们将在本教程中使用的库:
numpymatplotlibpandas
请注意,由于Pylab环境,你不需要导入matplotlib和numpy。我仍然将它们保留在代码中,以便在不同的环境中使用代码。
导入库后,使用函数read_csv()读取数据集。代码如下:
import pandas as pdimport numpy as npimport matplotlib as pltdf = pd.read_csv("/home/kunal/Downloads/Loan_Prediction/train.csv") #使用Pandas读入数据集转换成dataframe
快速数据探索
读取数据集后,可以使用head()函数查看前几行
df.head(10)

这样输出了10行,或者,也可以打印查看更多行数据集。
接下来,可以使用describe()函数来查看数值字段的摘要
df.describe()

describe()函数将在其输出中提供计数、平均值、标准偏差(std)、最小值、四分位数和最大值。
这里有几个发现,你可以通过看看describe()函数的输出来绘制:
1.LoanAmount有(614 – 592)22个缺失值。
2.Loan_Amount_Term有(614 – 600)14个缺失值。
3.Credit_History有(614 – 564)50个缺失值。
4.我们也可以看到,约84%的申请人有信用记录,怎么样?Credit_History字段的平均值为0.84(记住,Credit_History对于具有信用记录的用户而言为1,否则为0)
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-78832-4.html
高速成长的时代已经永远结束
还没到就直接误击沉吧
加油