HK
Auto Insurance Fraud Detection Streamlit dashboard showing classification results and model metrics
Back to Projects

Auto Insurance Fraud Detection

Live · Deployed2024

The Problem

Auto insurance claims fraud causes billions in annual losses, but fraudulent claims are inherently rare, creating severe class imbalance in datasets. Standard machine learning classifiers trained on uncalibrated, imbalanced distributions tend to optimize for majority accuracy, missing high-risk fraudulent claims and driving up financial liability.

Architecture & Approach

The pipeline applies Synthetic Minority Over-sampling Technique (SMOTE) to synthetically balance minority fraud classes prior to model training. An optimized XGBoost gradient boosted classifier is trained with stratified cross-validation and hyperparameter tuning to achieve an 85.2% ROC-AUC score. The inference system is wrapped in an interactive Streamlit web dashboard that allows claims adjusters to evaluate claim risk scores, inspect feature contributions, and adjust risk decision thresholds in real time.

About the Project

A fraud-classification system trained on SMOTE-balanced data with XGBoost, presented through an interactive Streamlit dashboard. The final model achieved 85.2% ROC-AUC with real-time risk scoring.

Key Metrics

85.2%

ROC-AUC

SMOTE Oversampling

Balancing

XGBoost Classifier

Core Model

Streamlit Cloud Dashboard

Interface

Technologies

PythonXGBoostSMOTEStreamlitscikit-learnPandas