
这表明如果申请人有有效的信用记录,获得贷款的机会是没有有效信用记录的8倍。你可以通过已婚,自雇,居住地区等绘制相似的图表。
或者,这两个图也可以通过将它们组合在堆叠图表中来进行可视化:
temp3 = pd.crosstab(df['Credit_History'], df['Loan_Status'])temp3.plot(kind='bar', stacked=True, color=['red','blue'], grid=False)

还可以添加性别(类似于Excel中的数据透视表):

如果你还没有意识到,我们在这里创建了两个基本的分类算法,一个基于信用记录,另一个基于2分类变量(包括性别)。你可以快速编码,以便在AV Datahacks上创建你的第一次提交版本。
我们看到如何在Python中使用pandas进行探索性数据分析,希望你对pandas(熊猫)的爱将会增加,pandas库为你的数据集分析提供一些帮助。
接下来,我们进一步探讨ApplicantIncome和LoanStatus变量,执行数据运算并创建一个数据集以应用各种建模技术。强烈建议再选择一个数据集和问题,阅读一个独立的例子,然后再做进一步分析。

python数据清洗:Pandas
对于从事数据分析的人来说,下面这些是你必须要做的。
数据清洗 – 重构数据
在数据探索时,为了构建一个好的模型,需要先解决掉数据集中发现了的一些问题。这个过程通常称为“数据清洗”。针对以下问题,我们看到:
1.变量缺失值。我们应该根据缺失值的数量和变量的预期重要性明智地估计这些值。
2.在分析这些分布的同时,我们看到变量ApplicantIncome和LoanAmount似乎都包含了离群值。虽然他们可能会有直观的意义,但应该得到适当的处理。
除了这些数值型的数据问题之外,我们还应该关注非数值型数据,如性别、区域、已婚、教育程度和赡养人数,用以挖掘任何有用的信息。
检查数据集中的缺失值
一起看看所有变量中的缺失值,因为大多数模型不能使用含缺失值的数据,缺失值填补很重要。所以,我们检查数据集中的null / NaN的数量。
df.apply(lambda x: sum(x.isnull()),axis=0)
如果值为null则isnull()返回1,那么该命令计算出每个列中缺失值的数量。

虽然缺失值数量不是很多,但是大多变量都有缺失值,需要估算并填补缺失值。
注意:缺失值可能并不总是NaN。例如,如果Loan_Amount_Term为0,那么是否有意义,或者是否是缺失值?我想你的答案是缺失值,你是对的。所以我们应该检查数据是否有实际意义。
如何填补LoanAmount中的缺失值?
有许多方法来填补贷款额度的缺失值,最简单的是用均值替换,可以通过以下代码来完成:
df['LoanAmount'].fillna(df['LoanAmount'].mean(), inplace=True)
另外也可以是建立一个监督学习模型,以其他变量如年龄等为基础预测贷款额度。
既然现在是数据清洗的步骤,我宁愿采取介于两者之间的一种方法。一个关键的假设是,一个人教育程度或者个体经营户与否,可以结合起来给出一个很好的贷款额度的估计。
首先,我们来看一下箱线图,看看是否存在趋势规律:

因此,我们看到每个组的贷款额中位数有一些变化,可以用来作估算值。但是,我们必须先确保Self_Employed和Education变量中的每一个都不应该有缺少值。
如前所述,Self_Eployee有一些缺失的值。看看频率表:
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-78832-6.html
真假分辨不出
自由平等的社会