
Combine process mining et machine learning pour détecter la fraude dans les réclamations d'assurance automobile. Des journaux d'événements suivant le flux standard de traitement des réclamations (déclaration de sinistre → attribution → décision → provision → paiement → clôture) sont analysés dans Celonis pour révéler goulots d'étranglement, reprises et déviations suspectes sur des milliers d'enregistrements. Un jeu de données à 21 caractéristiques (catégorielles : dossier/client/police/accident ; numériques : montants, âge du client, durée de traitement, nombre d'activités) alimente un modèle Python/scikit-learn, avec SMOTE pour l'équilibrage des classes, afin de classer les réclamations en valides, frauduleuses ou en violation.
Moteur de scoring du risque de churn pour l'activité pièces détachées d'un concessionnaire, isolant une cohorte fiable de 230 comptes à partir d'un export de 3,1 M de lignes corrompu par un bug de plafonnement ayant fait disparaître 63 % des clients, et surpassant les modèles de référence récence/fréquence avec un PR-AUC de 0,51 validé par bootstrap.
Segmentation non supervisée de 2 635 clients réels en 4 segments (ARI bootstrap de 0,97), révélant une liste de réactivation de 668 000 $ extraite d'un export tronqué.
Pipeline complet d'exploration de données permettant de prédire la tranche de revenus d'un individu à partir de données démographiques et socio-économiques, comprenant l'analyse exploratoire des données (EDA), le traitement des valeurs manquantes et des valeurs aberrantes, l'équilibrage des classes par SMOTE, la sélection de caractéristiques basée sur l'ACP et un réseau neuronal artificiel (RNA) optimisé, évalué par rapport à des modèles d'apprentissage automatique classiques.