diff --git "a/notebook.ipynb" "b/notebook.ipynb" new file mode 100644--- /dev/null +++ "b/notebook.ipynb" @@ -0,0 +1,2538 @@ +{ + "cells": [ + { + "cell_type": "code", + "execution_count": 4, + "id": "2b3e2ef6", + "metadata": {}, + "outputs": [], + "source": [ + "import pandas as pd\n", + "import numpy as np\n", + "import seaborn as sns\n", + "import matplotlib.pyplot as plt" + ] + }, + { + "cell_type": "code", + "execution_count": 5, + "id": "c81ee67a", + "metadata": {}, + "outputs": [ + { + "data": { + "text/html": [ + "
| \n", + " | Age | \n", + "Gender | \n", + "Stream | \n", + "Internships | \n", + "CGPA | \n", + "Hostel | \n", + "HistoryOfBacklogs | \n", + "PlacedOrNot | \n", + "
|---|---|---|---|---|---|---|---|---|
| 0 | \n", + "22 | \n", + "Male | \n", + "Electronics And Communication | \n", + "1 | \n", + "8 | \n", + "1 | \n", + "1 | \n", + "1 | \n", + "
| 1 | \n", + "21 | \n", + "Female | \n", + "Computer Science | \n", + "0 | \n", + "7 | \n", + "1 | \n", + "1 | \n", + "1 | \n", + "
| 2 | \n", + "22 | \n", + "Female | \n", + "Information Technology | \n", + "1 | \n", + "6 | \n", + "0 | \n", + "0 | \n", + "1 | \n", + "
| 3 | \n", + "21 | \n", + "Male | \n", + "Information Technology | \n", + "0 | \n", + "8 | \n", + "0 | \n", + "1 | \n", + "1 | \n", + "
| 4 | \n", + "22 | \n", + "Male | \n", + "Mechanical | \n", + "0 | \n", + "8 | \n", + "1 | \n", + "0 | \n", + "1 | \n", + "
| \n", + " | Age | \n", + "Internships | \n", + "CGPA | \n", + "Hostel | \n", + "HistoryOfBacklogs | \n", + "PlacedOrNot | \n", + "
|---|---|---|---|---|---|---|
| count | \n", + "2966.000000 | \n", + "2966.000000 | \n", + "2966.000000 | \n", + "2966.000000 | \n", + "2966.000000 | \n", + "2966.000000 | \n", + "
| mean | \n", + "21.485840 | \n", + "0.703641 | \n", + "7.073837 | \n", + "0.269049 | \n", + "0.192178 | \n", + "0.552596 | \n", + "
| std | \n", + "1.324933 | \n", + "0.740197 | \n", + "0.967748 | \n", + "0.443540 | \n", + "0.394079 | \n", + "0.497310 | \n", + "
| min | \n", + "19.000000 | \n", + "0.000000 | \n", + "5.000000 | \n", + "0.000000 | \n", + "0.000000 | \n", + "0.000000 | \n", + "
| 25% | \n", + "21.000000 | \n", + "0.000000 | \n", + "6.000000 | \n", + "0.000000 | \n", + "0.000000 | \n", + "0.000000 | \n", + "
| 50% | \n", + "21.000000 | \n", + "1.000000 | \n", + "7.000000 | \n", + "0.000000 | \n", + "0.000000 | \n", + "1.000000 | \n", + "
| 75% | \n", + "22.000000 | \n", + "1.000000 | \n", + "8.000000 | \n", + "1.000000 | \n", + "0.000000 | \n", + "1.000000 | \n", + "
| max | \n", + "30.000000 | \n", + "3.000000 | \n", + "9.000000 | \n", + "1.000000 | \n", + "1.000000 | \n", + "1.000000 | \n", + "
| \n", + " | Age | \n", + "Gender | \n", + "Stream | \n", + "Internships | \n", + "CGPA | \n", + "Hostel | \n", + "HistoryOfBacklogs | \n", + "PlacedOrNot | \n", + "
|---|---|---|---|---|---|---|---|---|
| 0 | \n", + "22 | \n", + "Male | \n", + "Electronics And Communication | \n", + "1 | \n", + "8 | \n", + "1 | \n", + "1 | \n", + "1 | \n", + "
| 1 | \n", + "21 | \n", + "Female | \n", + "Computer Science | \n", + "0 | \n", + "7 | \n", + "1 | \n", + "1 | \n", + "1 | \n", + "
| 2 | \n", + "22 | \n", + "Female | \n", + "Information Technology | \n", + "1 | \n", + "6 | \n", + "0 | \n", + "0 | \n", + "1 | \n", + "
| 3 | \n", + "21 | \n", + "Male | \n", + "Information Technology | \n", + "0 | \n", + "8 | \n", + "0 | \n", + "1 | \n", + "1 | \n", + "
| 4 | \n", + "22 | \n", + "Male | \n", + "Mechanical | \n", + "0 | \n", + "8 | \n", + "1 | \n", + "0 | \n", + "1 | \n", + "
| \n", + " | Age | \n", + "Gender | \n", + "Stream | \n", + "Internships | \n", + "CGPA | \n", + "Hostel | \n", + "HistoryOfBacklogs | \n", + "PlacedOrNot | \n", + "
|---|---|---|---|---|---|---|---|---|
| 0 | \n", + "22 | \n", + "Male | \n", + "Electronics And Communication | \n", + "1 | \n", + "8 | \n", + "1 | \n", + "1 | \n", + "1 | \n", + "
| 1 | \n", + "21 | \n", + "Female | \n", + "Computer Science | \n", + "0 | \n", + "7 | \n", + "1 | \n", + "1 | \n", + "1 | \n", + "
| 2 | \n", + "22 | \n", + "Female | \n", + "Information Technology | \n", + "1 | \n", + "6 | \n", + "0 | \n", + "0 | \n", + "1 | \n", + "
| 3 | \n", + "21 | \n", + "Male | \n", + "Information Technology | \n", + "0 | \n", + "8 | \n", + "0 | \n", + "1 | \n", + "1 | \n", + "
| 4 | \n", + "22 | \n", + "Male | \n", + "Mechanical | \n", + "0 | \n", + "8 | \n", + "1 | \n", + "0 | \n", + "1 | \n", + "
| \n", + " | Age | \n", + "Gender | \n", + "Stream | \n", + "Internships | \n", + "CGPA | \n", + "Hostel | \n", + "HistoryOfBacklogs | \n", + "PlacedOrNot | \n", + "
|---|---|---|---|---|---|---|---|---|
| 0 | \n", + "22 | \n", + "Male | \n", + "Electronics And Communication | \n", + "1 | \n", + "8 | \n", + "yes | \n", + "yes | \n", + "1 | \n", + "
| 1 | \n", + "21 | \n", + "Female | \n", + "Computer Science | \n", + "0 | \n", + "7 | \n", + "yes | \n", + "yes | \n", + "1 | \n", + "
| 2 | \n", + "22 | \n", + "Female | \n", + "Information Technology | \n", + "1 | \n", + "6 | \n", + "no | \n", + "no | \n", + "1 | \n", + "
| 3 | \n", + "21 | \n", + "Male | \n", + "Information Technology | \n", + "0 | \n", + "8 | \n", + "no | \n", + "yes | \n", + "1 | \n", + "
| 4 | \n", + "22 | \n", + "Male | \n", + "Mechanical | \n", + "0 | \n", + "8 | \n", + "yes | \n", + "no | \n", + "1 | \n", + "
ColumnTransformer(transformers=[('num',\n",
+ " Pipeline(steps=[('skew', PowerTransformer()),\n",
+ " ('scaler', StandardScaler())]),\n",
+ " ['Age', 'Internships', 'CGPA']),\n",
+ " ('cat',\n",
+ " Pipeline(steps=[('encode',\n",
+ " OneHotEncoder(handle_unknown='ignore'))]),\n",
+ " ['Gender', 'Stream', 'Hostel',\n",
+ " 'HistoryOfBacklogs'])])In a Jupyter environment, please rerun this cell to show the HTML representation or trust the notebook. ['Age', 'Internships', 'CGPA']
| \n", + " | \n",
+ " \n",
+ " method\n",
+ " method: {'yeo-johnson', 'box-cox'}, default='yeo-johnson' The power transform method. Available methods are: - 'yeo-johnson' [1]_, works with positive and negative values - 'box-cox' [2]_, only works with strictly positive values\n", + " \n", + " | \n",
+ " 'yeo-johnson' | \n", + "
| \n", + " | \n",
+ " \n",
+ " standardize\n",
+ " standardize: bool, default=True Set to True to apply zero-mean, unit-variance normalization to the transformed output.\n", + " \n", + " | \n",
+ " True | \n", + "
| \n", + " | \n",
+ " \n",
+ " copy\n",
+ " copy: bool, default=True Set to False to perform inplace computation during transformation.\n", + " \n", + " | \n",
+ " True | \n", + "
| \n", + " | \n",
+ " \n",
+ " copy\n",
+ " copy: bool, default=True If False, try to avoid a copy and do inplace scaling instead. This is not guaranteed to always work inplace; e.g. if the data is not a NumPy array or scipy.sparse CSR matrix, a copy may still be returned.\n", + " \n", + " | \n",
+ " True | \n", + "
| \n", + " | \n",
+ " \n",
+ " with_mean\n",
+ " with_mean: bool, default=True If True, center the data before scaling. This does not work (and will raise an exception) when attempted on sparse matrices, because centering them entails building a dense matrix which in common use cases is likely to be too large to fit in memory.\n", + " \n", + " | \n",
+ " True | \n", + "
| \n", + " | \n",
+ " \n",
+ " with_std\n",
+ " with_std: bool, default=True If True, scale the data to unit variance (or equivalently, unit standard deviation).\n", + " \n", + " | \n",
+ " True | \n", + "
['Gender', 'Stream', 'Hostel', 'HistoryOfBacklogs']
| \n", + " | Name | \n", + "accuracy_score | \n", + "
|---|---|---|
| 0 | \n", + "logistic_regression | \n", + "0.747340 | \n", + "
| 1 | \n", + "Decision_tree | \n", + "0.765957 | \n", + "
| 2 | \n", + "knn | \n", + "0.704787 | \n", + "
| 3 | \n", + "AdaBoostClassifier | \n", + "0.803191 | \n", + "
| 4 | \n", + "XGBClassifier | \n", + "0.760638 | \n", + "
| 5 | \n", + "GradientBoostingClassifier | \n", + "0.835106 | \n", + "
| 6 | \n", + "RandomForestClassifier | \n", + "0.744681 | \n", + "