b2科目四模拟试题多少题驾考考爆了怎么补救
b2科目四模拟试题多少题 驾考考爆了怎么补救

python基础教程 pdf 【知识】使用Python来学习数据科学的完整教程(9)

电脑杂谈  发布时间:2018-02-15 11:42:06  来源:网络整理

我们可以很容易地做出一些直观的假设,获得贷款的机会会更高:

1.具有信用记录的申请人

2.具有较高申请收入和综合收入的申请人

3.高等教育水平的申请人

4.具有高增长前景的城市地产

我们用’Credit_History’做我们的第一个模型。

outcome_var = 'Loan_Status'model = LogisticRegression()predictor_var = ['Credit_History']classification_model(model, df,predictor_var,outcome_var)

准确度:80.945%,交叉验证得分:80.946%

#We can try different combination of variables:predictor_var = ['Credit_History','Education','Married','Self_Employed','Property_Area']classification_model(model, df,predictor_var,outcome_var)

准确度:80.945%交叉验证得分:80.946%

一般来说,我们期望通过增加变量数量来提高准确度,但这是一个更具挑战性的案例,准确度和交叉验证得分不受重要性较小的变量的影响。信用历史是主导模式。我们现在有两个选择:

1.特征工程:挖掘新信息,并尝试预测。这个留给大家去发挥创造力。

2.更好的建模技术。接下来我们来探讨一下。

决策树

决策树是构建预测模型的另一种方法,通常比逻辑回归模型具有更高的精度。

model = DecisionTreeClassifier()predictor_var = ['Credit_History','Gender','Married','Education']classification_model(model, df,predictor_var,outcome_var)

准确度:81.930%,交叉验证得分:76.656%

这里,基于分类变量的模型不会受信用历史产生影响。我们来尝试几个数值型变量:

#We can try different combination of variables:predictor_var = ['Credit_History','Loan_Amount_Term','LoanAmount_log']classification_model(model, df,predictor_var,outcome_var)

准确度:92.345%交叉验证得分:71.009%

在这里我们观察到,添加变量后模型准确度上升,交叉验证错误率下降。这是模型数据过拟合的结果。我们尝试一个更复杂的算法,看看是否有帮助。

随机森林

随机森林是解决分类问题的另一种算法。

随机森林的一个优点是我们可以将所有特征放在一起,并返回一个可用于选择的特征重要性矩阵。model = RandomForestClassifier(n_estimators=100)predictor_var = ['Gender', 'Married', 'Dependents', 'Education', 'Self_Employed', 'Loan_Amount_Term', 'Credit_History', 'Property_Area', 'LoanAmount_log','TotalIncome_log']classification_model(model, df,predictor_var,outcome_var)


本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-78832-9.html

相关阅读
    发表评论  请自觉遵守互联网相关的政策法规,严禁发布、暴力、反动的言论

    热点图片
    拼命载入中...