接下来,我们将导入所需的模块。然后我们将定义一个通用分类函数,它将模型作为输入,并确定准确度和交叉验证得分。既然这是一个介绍性的文章,我将不再赘述编码的细节。
#Import models from scikit learn module:from sklearn。linear_model import LogisticRegressionfrom sklearn。cross_validation import KFold #For K-fold cross validationfrom sklearn。ensemble import RandomForestClassifierfrom sklearn。tree import DecisionTreeClassifier, export_graphvizfrom sklearn import metrics#Generic function for making a classification model and accessing performance:def classification_model(model, data, predictors, outcome): #Fit the model: model。fit(data[predictors],data[outcome]) #Make predictions on training set: predictions = model。
predict(data[predictors]) #Print accuracy accuracy = metrics。accuracy_score(predictions,data[outcome]) print "Accuracy : %s" % "{0:。3%}"。format(accuracy) #Perform k-fold cross-validation with 5 folds kf = KFold(data。shape[0], n_folds=5) error = [] for train, test in kf: # Filter training data train_predictors = (data[predictors]。iloc[train,:]) # The target we're using to train the algorithm。 train_target = data[outcome]。iloc[train] # Training the algorithm using the predictors and target。 model。
fit(train_predictors, train_target) #Record error from each cross-validation run error。append(model。score(data[predictors]。iloc[test,:],data[outcome]。iloc[test])) print "Cross-Validation Score : %s" % "{0:。3%}"。format(np。mean(error)) #Fit the model again so that it can be refered outside the function: model。fit(data[predictors],data[outcome])
逻辑回归
我们来做第一个逻辑回归模型。一种方法是将所有变量都放入模型中,但这可能会导致过拟合。 简单来说,模型采用所有变量,有可能理解数据的特定的复杂关系,并不能很好地推广。
本文来自电脑杂谈,转载请注明本文网址:
http://www.pc-fly.com/a/jisuanjixue/article-78832-8.html
无人敢搞独立
f
差距主要在单舰吨位
反咬一口啊