我们可以很容易地做出一些直观的假设,获得贷款的机会会更高:
1.具有信用记录的申请人
2.具有较高申请收入和综合收入的申请人
3.高等教育水平的申请人
4.具有高增长前景的城市地产
我们用’Credit_History’做我们的第一个模型。
outcome_var = 'Loan_Status'model = LogisticRegression()predictor_var = ['Credit_History']classification_model(model, df,predictor_var,outcome_var)
准确度:80.945%,交叉验证得分:80.946%
#We can try different combination of variables:predictor_var = ['Credit_History','Education','Married','Self_Employed','Property_Area']classification_model(model, df,predictor_var,outcome_var)
准确度:80.945%交叉验证得分:80.946%
一般来说,我们期望通过增加变量数量来提高准确度,但这是一个更具挑战性的案例,准确度和交叉验证得分不受重要性较小的变量的影响。信用历史是主导模式。我们现在有两个选择:
1.特征工程:挖掘新信息,并尝试预测。这个留给大家去发挥创造力。
2.更好的建模技术。接下来我们来探讨一下。
决策树
决策树是构建预测模型的另一种方法,通常比逻辑回归模型具有更高的精度。
model = DecisionTreeClassifier()predictor_var = ['Credit_History','Gender','Married','Education']classification_model(model, df,predictor_var,outcome_var)
准确度:81.930%,交叉验证得分:76.656%
这里,基于分类变量的模型不会受信用历史产生影响。我们来尝试几个数值型变量:
#We can try different combination of variables:predictor_var = ['Credit_History','Loan_Amount_Term','LoanAmount_log']classification_model(model, df,predictor_var,outcome_var)
准确度:92.345%交叉验证得分:71.009%
在这里我们观察到,添加变量后模型准确度上升,交叉验证错误率下降。这是模型数据过拟合的结果。我们尝试一个更复杂的算法,看看是否有帮助。
随机森林
随机森林是解决分类问题的另一种算法。
随机森林的一个优点是我们可以将所有特征放在一起,并返回一个可用于选择的特征重要性矩阵。model = RandomForestClassifier(n_estimators=100)predictor_var = ['Gender', 'Married', 'Dependents', 'Education', 'Self_Employed', 'Loan_Amount_Term', 'Credit_History', 'Property_Area', 'LoanAmount_log','TotalIncome_log']classification_model(model, df,predictor_var,outcome_var)
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-78832-9.html
你还叽叽呱呱
美国是全世界的政府
一旦开战吃亏的还是自己