b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

python基础教程 pdf 【知识】使用Python来学习数据科学的完整教程(6)

电脑杂谈  发布时间:2018-02-15 11:42:06  来源:网络整理

这表明如果申请人有有效的信用记录,获得贷款的机会是没有有效信用记录的8倍。你可以通过已婚,自雇,居住地区等绘制相似的图表。

或者,这两个图也可以通过将它们组合在堆叠图表中来进行可视化:

temp3 = pd.crosstab(df['Credit_History'], df['Loan_Status'])temp3.plot(kind='bar', stacked=True, color=['red','blue'], grid=False)

还可以添加性别(类似于Excel中的数据透视表):

如果你还没有意识到,我们在这里创建了两个基本的分类算法,一个基于信用记录,另一个基于2分类变量(包括性别)。你可以快速编码,以便在AV Datahacks上创建你的第一次提交版本。

我们看到如何在Python中使用pandas进行探索性数据分析,希望你对pandas(熊猫)的爱将会增加,pandas库为你的数据集分析提供一些帮助。

接下来,我们进一步探讨ApplicantIncome和LoanStatus变量,执行数据运算并创建一个数据集以应用各种建模技术。强烈建议再选择一个数据集和问题,阅读一个独立的例子,然后再做进一步分析。

python基础教程 pdf_python入门百度云pdf_python基础教程第四版

python数据清洗:Pandas

对于从事数据分析的人来说,下面这些是你必须要做的。

数据清洗 – 重构数据

在数据探索时,为了构建一个好的模型,需要先解决掉数据集中发现了的一些问题。这个过程通常称为“数据清洗”。针对以下问题,我们看到:

1.变量缺失值。我们应该根据缺失值的数量和变量的预期重要性明智地估计这些值。

2.在分析这些分布的同时,我们看到变量ApplicantIncome和LoanAmount似乎都包含了离群值。虽然他们可能会有直观的意义,但应该得到适当的处理。

除了这些数值型的数据问题之外,我们还应该关注非数值型数据,如性别、区域、已婚、教育程度和赡养人数,用以挖掘任何有用的信息。

检查数据集中的缺失值

一起看看所有变量中的缺失值,因为大多数模型不能使用含缺失值的数据,缺失值填补很重要。所以,我们检查数据集中的null / NaN的数量。

df.apply(lambda x: sum(x.isnull()),axis=0)

如果值为null则isnull()返回1,那么该命令计算出每个列中缺失值的数量。

虽然缺失值数量不是很多,但是大多变量都有缺失值,需要估算并填补缺失值。

注意:缺失值可能并不总是NaN。例如,如果Loan_Amount_Term为0,那么是否有意义,或者是否是缺失值?我想你的答案是缺失值,你是对的。所以我们应该检查数据是否有实际意义。

如何填补LoanAmount中的缺失值?

有许多方法来填补贷款额度的缺失值,最简单的是用均值替换,可以通过以下代码来完成:

df['LoanAmount'].fillna(df['LoanAmount'].mean(), inplace=True)

另外也可以是建立一个监督学习模型,以其他变量如年龄等为基础预测贷款额度。

既然现在是数据清洗的步骤,我宁愿采取介于两者之间的一种方法。一个关键的假设是,一个人教育程度或者个体经营户与否,可以结合起来给出一个很好的贷款额度的估计。

首先,我们来看一下箱线图,看看是否存在趋势规律:

因此,我们看到每个组的贷款额中位数有一些变化,可以用来作估算值。但是,我们必须先确保Self_Employed和Education变量中的每一个都不应该有缺少值。

如前所述,Self_Eployee有一些缺失的值。看看频率表:


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-78832-6.html

相关阅读
    发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

    热点图片
    拼命载入中...