Un pipeline complet d’exploration de données conçu pour prédire le niveau de revenus à partir des caractéristiques démographiques et personnelles d’un individu. Le projet couvre l’ensemble du cycle de vie de la science des données : analyse exploratoire et visualisation des données, traitement des valeurs manquantes et des valeurs aberrantes, encodage catégoriel (étiquette + ordinal), normalisation des caractéristiques, correction du déséquilibre entre les classes à l’aide de SMOTE, et réduction de la dimensionnalité via l’ACP et la sélection de caractéristiques. Plusieurs algorithmes de classification classiques ont été entraînés et comparés à un réseau neuronal artificiel personnalisé développé avec Keras/TensorFlow, dont les hyperparamètres ont été affinés afin d’identifier le modèle le plus performant. Les résultats ont été interprétés et visualisés afin de mettre en évidence les facteurs démographiques les plus déterminants pour la prédiction des revenus.
Analyse exploratoire de données identifiant les clients à risque d'attrition, pour aider la banque à adopter des stratégies de rétention.
Combine process mining et machine learning pour détecter les réclamations d'assurance frauduleuses à partir de journaux d'événements.