b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

python基础教程 pdf 【知识】使用Python来学习数据科学的完整教程(4)

电脑杂谈  发布时间:2018-02-15 11:42:06  来源:网络整理

数据探索 – 详细了解我们的数据

数据清洗 – 清理数据,使其更适合统计建模

预测建模 – 运行实际算法并获得结果

使用pandas进行数据探索

为了进一步探索我们的数据,给你介绍另一个动物(好像Python还不够!)- Pandas

Pandas是Python中最有好用的数据分析库之一(我知道这些名字听起来很奇怪,先这样!)促使越来越多数据科学界人士使用Python。现在我们将使用pandas从Analytics Vidhya比赛中读取数据集,进行探索性分析,并构建我们的第一个基础分类算法来解决这个问题。

在数据加载之前,先了解Pandas中2个关键数据结构 – Series和DataFrames。

Series及DataFrame介绍

Series可以理解为1维标签/索引数组。你可以通过这些标签访问series的各个元素。

Dataframe类似于Excel工作簿,列名称引用列,使用行号访问行。本质区别在于dataframes中列名称和行号称为列和行索引。

Series和DataFrames构成了Pandas在Python中的核心数据模型。数据集首先被读入Dataframes,然后各种操作(例如分组、聚合等)可以非常容易地应用于其列。

应用案例 – 贷款预测问题

以下是变量的描述:

开始数据探索

首先,在terminal/ Windows命令提示符下键入以下命令,以Inline Pylab模式启动iPython界面:

ipython notebook --pylab=inline

这样在pylab环境中打开了iPython notebook,它已经导入了一些有用的库。此外,可以内联绘制数据,这使得它成为一个非常好的交互式数据分析环境。 你可以通过键入以下命令(并获得如下图所示的输出)来检查环境是否加载正确:

plot(arange(5))

我当前在Linux中工作,并将数据集存储在以下位置: /home/kunal/Downloads/Loan_Prediction/train.csv

导入库和数据集:

以下是我们将在本教程中使用的库:

numpymatplotlibpandas

请注意,由于Pylab环境,你不需要导入matplotlib和numpy。我仍然将它们保留在代码中,以便在不同的环境中使用代码。

导入库后,使用函数read_csv()读取数据集。代码如下:

import pandas as pdimport numpy as npimport matplotlib as pltdf = pd.read_csv("/home/kunal/Downloads/Loan_Prediction/train.csv") #使用Pandas读入数据集转换成dataframe

快速数据探索

读取数据集后,可以使用head()函数查看前几行

df.head(10)

这样输出了10行,或者,也可以打印查看更多行数据集。

接下来,可以使用describe()函数来查看数值字段的摘要

df.describe()

describe()函数将在其输出中提供计数、平均值、标准偏差(std)、最小值、四分位数和最大值。

这里有几个发现,你可以通过看看describe()函数的输出来绘制:

1.LoanAmount有(614 – 592)22个缺失值。

2.Loan_Amount_Term有(614 – 600)14个缺失值。

3.Credit_History有(614 – 564)50个缺失值。

4.我们也可以看到,约84%的申请人有信用记录,怎么样?Credit_History字段的平均值为0.84(记住,Credit_History对于具有信用记录的用户而言为1,否则为0)


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-78832-4.html

相关阅读
    发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

    • 顾晓涵
      顾晓涵

      加油

    • 鲁宣公姬妥
      鲁宣公姬妥

      高速成长的时代已经永远结束

    • 橙条瑠妃
      橙条瑠妃

      还没到就直接误击沉吧

    热点图片
    拼命载入中...