
The Problem
Auto insurance claims fraud causes billions in annual losses, but fraudulent claims are inherently rare, creating severe class imbalance in datasets. Standard machine learning classifiers trained on uncalibrated, imbalanced distributions tend to optimize for majority accuracy, missing high-risk fraudulent claims and driving up financial liability.
Architecture & Approach
The pipeline applies Synthetic Minority Over-sampling Technique (SMOTE) to synthetically balance minority fraud classes prior to model training. An optimized XGBoost gradient boosted classifier is trained with stratified cross-validation and hyperparameter tuning to achieve an 85.2% ROC-AUC score. The inference system is wrapped in an interactive Streamlit web dashboard that allows claims adjusters to evaluate claim risk scores, inspect feature contributions, and adjust risk decision thresholds in real time.
About the Project
A fraud-classification system trained on SMOTE-balanced data with XGBoost, presented through an interactive Streamlit dashboard. The final model achieved 85.2% ROC-AUC with real-time risk scoring.
Key Metrics
85.2%
ROC-AUC
SMOTE Oversampling
Balancing
XGBoost Classifier
Core Model
Streamlit Cloud Dashboard
Interface