{ "cells": [ { "cell_type": "code", "execution_count": 48, "id": "d0a81c59", "metadata": {}, "outputs": [], "source": [ "import pandas as pd\n", "from sklearn.model_selection import train_test_split\n", "from sklearn.ensemble import RandomForestClassifier\n", "from sklearn.preprocessing import LabelEncoder,StandardScaler\n", "from sklearn.metrics import classification_report,confusion_matrix\n", "from sklearn.linear_model import LogisticRegression\n", "from imblearn.over_sampling import SMOTE\n", "from xgboost import XGBClassifier" ] }, { "cell_type": "code", "execution_count": 2, "id": "efc8e955", "metadata": {}, "outputs": [], "source": [ "le=LabelEncoder()\n", "scaler=StandardScaler()\n", "scaler_new=StandardScaler()\n", "model_rf=RandomForestClassifier(random_state=42,n_estimators=100)\n", "model_rf_new=RandomForestClassifier(random_state=42,n_estimators=100)\n", "model_rf_new2=RandomForestClassifier(random_state=42)\n", "model_log_reg=LogisticRegression(random_state=42)\n", "le_new=LabelEncoder()\n", "smote=SMOTE(random_state=42)" ] }, { "cell_type": "code", "execution_count": 3, "id": "591fef9f", "metadata": {}, "outputs": [], "source": [ "df=pd.read_csv('../Data/cancer-risk-factors.csv')" ] }, { "cell_type": "code", "execution_count": 4, "id": "462e2140", "metadata": {}, "outputs": [ { "data": { "text/html": [ "
| \n", " | Patient_ID | \n", "Cancer_Type | \n", "Age | \n", "Gender | \n", "Smoking | \n", "Alcohol_Use | \n", "Obesity | \n", "Family_History | \n", "Diet_Red_Meat | \n", "Diet_Salted_Processed | \n", "Fruit_Veg_Intake | \n", "Physical_Activity | \n", "Air_Pollution | \n", "Occupational_Hazards | \n", "BRCA_Mutation | \n", "H_Pylori_Infection | \n", "Calcium_Intake | \n", "Overall_Risk_Score | \n", "BMI | \n", "Physical_Activity_Level | \n", "Risk_Level | \n", "
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 0 | \n", "LU0000 | \n", "Breast | \n", "68 | \n", "0 | \n", "7 | \n", "2 | \n", "8 | \n", "0 | \n", "5 | \n", "3 | \n", "7 | \n", "4 | \n", "6 | \n", "3 | \n", "1 | \n", "0 | \n", "0 | \n", "0.398696 | \n", "28.0 | \n", "5 | \n", "Medium | \n", "
| 1 | \n", "LU0001 | \n", "Prostate | \n", "74 | \n", "1 | \n", "8 | \n", "9 | \n", "8 | \n", "0 | \n", "0 | \n", "3 | \n", "7 | \n", "1 | \n", "3 | \n", "3 | \n", "0 | \n", "0 | \n", "5 | \n", "0.424299 | \n", "25.4 | \n", "9 | \n", "Medium | \n", "
| 2 | \n", "LU0002 | \n", "Skin | \n", "55 | \n", "1 | \n", "7 | \n", "10 | \n", "7 | \n", "0 | \n", "3 | \n", "3 | \n", "4 | \n", "1 | \n", "8 | \n", "10 | \n", "0 | \n", "0 | \n", "6 | \n", "0.605082 | \n", "28.6 | \n", "2 | \n", "Medium | \n", "
| 3 | \n", "LU0003 | \n", "Colon | \n", "61 | \n", "0 | \n", "6 | \n", "2 | \n", "2 | \n", "0 | \n", "6 | \n", "2 | \n", "4 | \n", "6 | \n", "4 | \n", "8 | \n", "0 | \n", "0 | \n", "8 | \n", "0.318449 | \n", "32.1 | \n", "7 | \n", "Low | \n", "
| 4 | \n", "LU0004 | \n", "Lung | \n", "67 | \n", "1 | \n", "10 | \n", "7 | \n", "4 | \n", "0 | \n", "6 | \n", "3 | \n", "10 | \n", "9 | \n", "10 | \n", "9 | \n", "0 | \n", "0 | \n", "5 | \n", "0.524358 | \n", "25.1 | \n", "2 | \n", "Medium | \n", "
| \n", " | Age | \n", "Gender | \n", "Smoking | \n", "Alcohol_Use | \n", "Obesity | \n", "Family_History | \n", "Diet_Red_Meat | \n", "Diet_Salted_Processed | \n", "Fruit_Veg_Intake | \n", "Physical_Activity | \n", "Air_Pollution | \n", "Occupational_Hazards | \n", "BRCA_Mutation | \n", "H_Pylori_Infection | \n", "Calcium_Intake | \n", "Overall_Risk_Score | \n", "BMI | \n", "Physical_Activity_Level | \n", "
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 0 | \n", "68 | \n", "0 | \n", "7 | \n", "2 | \n", "8 | \n", "0 | \n", "5 | \n", "3 | \n", "7 | \n", "4 | \n", "6 | \n", "3 | \n", "1 | \n", "0 | \n", "0 | \n", "0.398696 | \n", "28.0 | \n", "5 | \n", "
| 1 | \n", "74 | \n", "1 | \n", "8 | \n", "9 | \n", "8 | \n", "0 | \n", "0 | \n", "3 | \n", "7 | \n", "1 | \n", "3 | \n", "3 | \n", "0 | \n", "0 | \n", "5 | \n", "0.424299 | \n", "25.4 | \n", "9 | \n", "
| 2 | \n", "55 | \n", "1 | \n", "7 | \n", "10 | \n", "7 | \n", "0 | \n", "3 | \n", "3 | \n", "4 | \n", "1 | \n", "8 | \n", "10 | \n", "0 | \n", "0 | \n", "6 | \n", "0.605082 | \n", "28.6 | \n", "2 | \n", "
| 3 | \n", "61 | \n", "0 | \n", "6 | \n", "2 | \n", "2 | \n", "0 | \n", "6 | \n", "2 | \n", "4 | \n", "6 | \n", "4 | \n", "8 | \n", "0 | \n", "0 | \n", "8 | \n", "0.318449 | \n", "32.1 | \n", "7 | \n", "
| 4 | \n", "67 | \n", "1 | \n", "10 | \n", "7 | \n", "4 | \n", "0 | \n", "6 | \n", "3 | \n", "10 | \n", "9 | \n", "10 | \n", "9 | \n", "0 | \n", "0 | \n", "5 | \n", "0.524358 | \n", "25.1 | \n", "2 | \n", "
| ... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "... | \n", "
| 1995 | \n", "60 | \n", "1 | \n", "4 | \n", "6 | \n", "4 | \n", "0 | \n", "10 | \n", "6 | \n", "4 | \n", "4 | \n", "5 | \n", "3 | \n", "1 | \n", "0 | \n", "4 | \n", "0.437539 | \n", "30.3 | \n", "3 | \n", "
| 1996 | \n", "84 | \n", "1 | \n", "5 | \n", "7 | \n", "8 | \n", "0 | \n", "10 | \n", "0 | \n", "1 | \n", "2 | \n", "1 | \n", "3 | \n", "0 | \n", "0 | \n", "2 | \n", "0.451128 | \n", "25.9 | \n", "4 | \n", "
| 1997 | \n", "65 | \n", "0 | \n", "7 | \n", "2 | \n", "10 | \n", "0 | \n", "4 | \n", "2 | \n", "2 | \n", "3 | \n", "6 | \n", "0 | \n", "0 | \n", "1 | \n", "0 | \n", "0.295760 | \n", "22.5 | \n", "3 | \n", "
| 1998 | \n", "64 | \n", "1 | \n", "10 | \n", "2 | \n", "10 | \n", "0 | \n", "2 | \n", "10 | \n", "7 | \n", "5 | \n", "4 | \n", "2 | \n", "0 | \n", "0 | \n", "10 | \n", "0.422201 | \n", "25.3 | \n", "3 | \n", "
| 1999 | \n", "64 | \n", "0 | \n", "3 | \n", "4 | \n", "10 | \n", "0 | \n", "0 | \n", "5 | \n", "1 | \n", "0 | \n", "3 | \n", "9 | \n", "0 | \n", "0 | \n", "0 | \n", "0.518137 | \n", "23.0 | \n", "3 | \n", "
2000 rows × 18 columns
\n", "RandomForestClassifier(random_state=42)In a Jupyter environment, please rerun this cell to show the HTML representation or trust the notebook.
LogisticRegression(random_state=42)In a Jupyter environment, please rerun this cell to show the HTML representation or trust the notebook.
RandomForestClassifier(random_state=42)In a Jupyter environment, please rerun this cell to show the HTML representation or trust the notebook.
RandomForestClassifier(random_state=42)In a Jupyter environment, please rerun this cell to show the HTML representation or trust the notebook.