IA et lutte contre la fraude. 6 chapitres et un QCM final.
Comment l'intelligence artificielle est devenue le coeur de la détection de fraude au paiement. La matière première (features et signaux faibles), l'évolution des modèles (règles, gradient boosting, graphes), le scoring en temps réel à l'autorisation, l'arbitrage entre fraude subie et faux refus. Puis la boucle de feedback par les chargebacks, la contre-attaque de la GenAI côté fraudeurs (deepfakes, fraude assistée), le paysage des outils, et la gouvernance d'un modèle de décision automatisée (explicabilité, RGPD, AI Act).
Chiffrer le coût de la fraude au paiement et comprendre pourquoi les règles seules ne suffisent plus
Décrire la matière première d'un moteur de détection : features transactionnelles, de vélocité, comportementales et de graphe
Situer les grandes familles de modèles, des moteurs de règles au gradient boosting (GBM) et à l'analyse de graphes/réseau, et savoir quand les combiner
Maîtriser le scoring en temps réel à l'autorisation et l'arbitrage précision/rappel entre fraude subie et faux refus
Chapitre 1. Le coût de la fraude et les limites des règles.
La fraude au paiement désigne les opérations non autorisées par le titulaire du compte, ainsi que celles qu'il a autorisées sous l'effet d'une manipulation. Deux rapports en donnent l'ordre de grandeur, l'un mondial et l'autre européen. Selon le Nilson Report (2024), les pertes mondiales sur cartes ont atteint 33,83 milliards de dollars en 2023, le cabinet projetant un cumul supérieur à 400 milliards sur la décennie à venir. En Europe, le rapport conjoint BCE / EBA sur la fraude aux paiements (août 2024) chiffre la fraude totale à 4,3 milliards d'euros en 2022 tous instruments confondus. La ventilation par canal d'acceptation fait apparaître une concentration nette. La fraude carte se concentre massivement sur le card-not-present (paiement à distance), qui représente près de 79 % de la valeur de la fraude carte dans l'EEE.
🔑
Pourquoi l'IA, et pas seulement des règles ?
Un moteur de règles (« si montant > 3 000 € et pays ≠ pays d'émission, alors bloquer ») est lisible, auditable et instantané. Sa logique reste statique, générique et facile à contourner. Le fraudeur qui découvre un seuil par tâtonnement place ensuite ses opérations juste en dessous. La règle écrite pour un schéma de fraude déjà observé refuse entre-temps des porteurs légitimes dont les habitudes ont changé. L'IA répond à ces limites. Son apport tient en trois points : apprendre des combinaisons de signaux, s'adapter aux nouveaux schémas et scorer une probabilité plutôt que trancher en binaire.
33,83 Md$
pertes mondiales sur cartes en 2023
Nilson Report, 2024
4,3 Md€
fraude totale aux paiements dans l'EEE en 2022 (tous instruments)
BCE / EBA, Rapport sur la fraude aux paiements, août 2024
≈ 79 %
part du card-not-present dans la valeur de la fraude carte (EEE)
BCE / EBA, 2024
< 0,05 %
taux de fraude cible sur transactions authentifiées par SCA/3DS, très inférieur au non-authentifié
BCE / EBA, 2024
L'authentification forte a déplacé la fraude, pas fait disparaître
En Europe, la DSP2 et l'authentification forte du client (SCA), déployées via 3-D Secure, ont fait chuter la fraude sur les transactions authentifiées. D'autres marchés reposent sur des mécanismes d'authentification différents. La fraude s'est déplacée vers les flux hors périmètre SCA. Y figurent les transactions cross-border avec un acquéreur hors EEE, les paiements initiés par le commerçant (MIT) et les opérations exemptées au titre de l'analyse de risque de transaction (TRA). Deux autres voies contournent l'authentification sans avoir à la franchir. L'ingénierie sociale amène le porteur à authentifier lui-même un paiement qu'il croit légitime, et le détournement de compte (account takeover) place les moyens d'authentification du titulaire entre les mains du fraudeur. Le SCA n'a donc pas éteint le problème. Une barrière unique posée à l'entrée du parcours ne couvre plus ces situations. La détection doit donc scorer chaque transaction en continu, avant, pendant et après l'autorisation.
Règle : logique explicite figée, décision binaire, contournable dès que le seuil est connu
Modèle statistique / ML : apprend des corrélations sur des milliers de transactions, produit un score de risque continu
En pratique, on combine les deux : les règles gèrent le connu et le réglementaire (listes de sanctions, plafonds), le modèle gère le nuancé et l'inédit
🎯 Question éclair
Pourquoi un moteur de règles seul ne suffit-il plus pour lutter contre la fraude au paiement ?
Chapitre 2. Les features : la matière première de la détection.
Une feature est une variable numérique qui décrit un aspect d'une transaction et sert d'entrée au modèle. L'ensemble des features d'une opération forme son vecteur de features, une transaction traduite en dizaines ou centaines de variables numériques. La qualité de ces features détermine 80 % de la performance, bien avant le choix de l'algorithme. On les regroupe en grandes familles. Beaucoup ne prennent leur sens que dans le temps et dans le réseau.
💳
Transactionnelles
Montant, devise, MCC (catégorie du commerçant), canal (POS/CNP), heure, type de carte. Le brut de la transaction, nécessaire mais rarement suffisant.
⏱️
Vélocité
Nombre de transactions sur cette carte dans la dernière heure, nombre de cartes différentes sur cet appareil aujourd'hui. Le signal le plus discriminant, la fraude étant souvent une rafale.
🖐️
Comportementales / biométriques
Vitesse de frappe, façon de tenir le téléphone, parcours de navigation, habitudes horaires. La biométrie comportementale détecte un imposteur même avec les bons identifiants.
🕸️
De graphe / réseau
Liens de cette carte, de cet e-mail, de cet appareil et de cette IP avec des entités déjà frauduleuses. Le lien caché entre comptes est souvent le meilleur indice.
ℹ️
Le feature engineering agrégé : là où se gagne la détection
Les agrégats glissants comptent ou moyennent des événements sur une fenêtre de temps qui se déplace avec la date d'observation. Les features de cette forme sont les plus prédictives. Elles devancent les valeurs brutes lues sur la transaction. « Écart entre ce montant et le panier moyen des 30 derniers jours du porteur », « nombre de pays distincts sur cette carte en 24 h », « part des refus sur cet appareil cette semaine ». Le calcul de ces agrégats en moins de quelques millisecondes, au moment de l'autorisation, relève de l'ingénierie autant que de la data science.
Le device fingerprint et l'empreinte comportementale
Le device fingerprint identifie un appareil sans recourir à un cookie, en combinant la configuration du navigateur, la résolution, le fuseau, les polices et les capteurs. La réapparition d'une même empreinte d'appareil sur des cartes différentes compte parmi les alertes classiques. La biométrie comportementale modélise comment l'utilisateur interagit, par la vitesse de frappe, la façon de tenir le téléphone et le parcours de navigation. Un fraudeur en possession des identifiants et du mot de passe reproduit rarement la gestuelle du titulaire. Ces deux signaux sont passifs. Ils n'ajoutent aucune friction pour le client légitime.
Famille
Exemple de feature
Ce qu'elle capte
Transactionnelle
Montant / panier moyen du porteur (ratio)
Achat anormalement élevé pour ce profil
Vélocité
Nb de transactions carte dans la dernière heure
Rafale de tests de carte (card testing)
Comportementale
Cadence de frappe et pression tactile
Imposteur avec identifiants volés
Device
Nb de cartes distinctes vues sur cet appareil / 24 h
Appareil de fraudeur mutualisant des cartes volées
Graphe
Distance à une entité déjà signalée frauduleuse
Réseau organisé, fraude en anneau
Exemples de features par famille et leur pouvoir de discrimination
🎯 Question éclair
Pourquoi les features de vélocité et de graphe sont-elles souvent plus discriminantes que les features transactionnelles brutes ?
Chapitre 3. Les modèles : règles, gradient boosting, graphes.
La détection de fraude en production met en oeuvre plusieurs modèles à la fois, organisés en un empilement de couches complémentaires. Chaque couche répond à une question différente et couvre les angles morts des autres. Aucune ne les couvre toutes seule. Les fournisseurs parlent pour cette raison de « moteur de décision » plutôt que d'« algorithme ».
Le connu et le réglementaire, décision binaire immédiate
➜
Couche 2, modèle supervisé (GBM)
Score de probabilité de fraude à partir du vecteur de features
Le coeur statistique : XGBoost, LightGBM, gradient boosting
➜
Couche 3, analyse de graphe
Détection de réseaux et d'anomalies relationnelles
Fraude organisée, anneaux, entités liées
➜
Couche 4, non supervisé / anomalie
Repérage des comportements jamais vus (nouvelle fraude)
Filet de sécurité pour les schémas sans historique de labels
➜
Orchestration
Combine les scores en une décision : approuver, refuser, défier (step-up)
Seuils calibrés selon le coût métier
Pourquoi le gradient boosting domine (GBM)
Le gradient boosting sur arbres (GBM) est l'algorithme le plus répandu en détection de fraude, devant le réseau de neurones profond comme devant l'arbre de décision unique, sous les implémentations XGBoost et LightGBM. Il construit des centaines d'arbres de décision successifs, chacun corrigeant les erreurs du précédent. Trois propriétés expliquent cette place. Il excelle sur des données tabulaires et hétérogènes (numériques + catégorielles) et gère nativement les données manquantes. Il tolère le déséquilibre extrême des classes, la fraude représentant souvent moins de 1 % des transactions. Il se prête enfin à l'explicabilité par valeurs de SHAP, qui indiquent quelles features ont poussé le score vers le haut.
⚠️
Le piège du déséquilibre des classes
Si 0,5 % des transactions sont frauduleuses, un modèle qui prédit « jamais de fraude » atteint 99,5 % d'exactitude sans en détecter aucune. L'exactitude mesure la part de prédictions correctes. Cette part est dominée par la classe majoritaire dès que l'une des deux classes devient rare. L'accuracy n'est donc jamais retenue pour juger un modèle de fraude, qui s'évalue sur des métriques adaptées au déséquilibre : précision, rappel, aire sous la courbe précision-rappel (PR-AUC), et surtout le coût métier réel de chaque erreur.
Les graphes : voir la fraude organisée
L'analyse de graphe représente les entités du système de paiement comme un réseau et cherche la fraude dans les liens qui les unissent. Un GBM score une transaction quasi isolément. Il n'exploite pas l'information selon laquelle une carte, un e-mail jetable et un appareil appartiennent au même anneau de mules. La modélisation pose des noeuds et des arêtes : noeuds = cartes, comptes, appareils, IP ; arêtes = transactions partagées. On y cherche des sous-structures suspectes, par exemple des composantes densément connectées, des comptes reliés à une entité déjà frauduleuse ou une propagation de risque de proche en proche. Les réseaux de neurones de graphe (GNN) automatisent cette lecture. Cette couche sépare la détection d'une fraude opportuniste, une carte volée, de celle d'une fraude industrialisée, une plateforme de blanchiment.
Quel algorithme domine la détection de fraude sur données transactionnelles tabulaires, et pourquoi ?
Chapitre 4. Scoring temps réel et l'arbitrage des faux positifs.
Le scoring en temps réel désigne le calcul d'un score de risque pendant le déroulement de l'autorisation elle-même. Le score doit donc être produit avant que l'autorisation ne parte au réseau, soit un budget de latence de l'ordre de quelques dizaines de millisecondes. Tout le pipeline tient dans cette fenêtre. Il enchaîne la récupération des agrégats glissants, le calcul des features, l'inférence du modèle et l'application des règles. Le problème relève de l'ingénierie temps réel autant que de la data science, avec un feature store à faible latence, des modèles compilés et une mise en cache des compteurs de vélocité.
🔑
Le vrai coût caché : les faux refus
Un faux refus est le rejet, par le moteur de décision, d'une transaction légitime. Le niveau du seuil fixe la répartition entre les deux erreurs possibles. L'abaisser attrape plus de fraude (meilleur rappel) mais refuse davantage de clients légitimes (plus de faux positifs). Le coût d'un faux refus dépasse souvent celui de la fraude elle-même, entre la marge perdue sur la vente, le client froissé qui part chez le concurrent et la valeur vie client entamée. La performance d'un moteur se juge donc sur l'équilibre entre fraude évitée et chiffre d'affaires préservé, plutôt que sur le seul montant de fraude bloquée.
Précision, rappel et seuil de décision
Le modèle dit FRAUDE
Le modèle dit LÉGITIME
C'est réellement une fraude
Vrai positif (fraude évitée) ✅
Faux négatif (fraude subie, chargeback à venir) ❌
C'est réellement légitime
Faux positif (faux refus, vente et client perdus) ⚠️
Vrai négatif (transaction fluide) ✅
Comprendre les erreurs d'un modèle de fraude
Rappel (recall) : part de la fraude réelle effectivement attrapée, à maximiser sans exploser les faux positifs
Précision : part des alertes qui sont de vraies fraudes, sachant qu'une précision faible sature les équipes de revue manuelle
Le seuil n'est pas un réglage technique : c'est une décision métier qui traduit combien coûte un euro de fraude face à un euro de vente perdue
La revue manuelle (défi 3DS, step-up, appel client) est la troisième voie entre approuver et refuser : elle transforme un doute en décision informée
Les moteurs en production découpent l'échelle de score en plusieurs zones, au lieu de retenir un seuil unique. Au-dessus d'un score élevé, refus automatique ; en dessous d'un score faible, approbation fluide ; dans la zone grise, step-up d'authentification ou revue. Cette segmentation réduit la friction pour la grande masse des transactions légitimes et concentre l'effort de vérification sur les cas douteux. Les schémas de fraude évoluant, les bornes de ces zones sont recalibrées en permanence. Cette recalibration consomme des fraudes confirmées et des refus jugés après coup, que seule la boucle de feedback fournit.
🎯 Question éclair
Pourquoi ne juge-t-on pas la qualité d'un moteur de fraude au seul montant de fraude bloquée ?
Chapitre 5. La boucle de feedback : chargebacks et labels.
Les labels sont les étiquettes « fraude » ou « légitime » attachées a posteriori aux transactions, et sur lesquelles un modèle supervisé apprend. La vérité terrain arrive en retard et incomplète, la principale source étant le chargeback (impayé contesté). Les signalements réseau la complètent en remontant les fraudes déclarées par les émetteurs, TC40 chez Visa et SAFE (System to Avoid Fraud Effectively) chez Mastercard. Ces deux sources partagent un trait. Elles décrivent la transaction après coup, et seulement lorsqu'un tiers l'a signalée : le porteur qui conteste, l'émetteur qui déclare.
⚠️
La latence des étiquettes : entraîner avec un train de retard
Un chargeback pour fraude peut arriver plusieurs semaines à plusieurs mois après la transaction, et la décision prise reste sans confirmation pendant tout ce délai. Cette latence a deux conséquences sur l'apprentissage. Le réentraînement porte sur une période déjà dépassée, puisque les méthodes de fraude ont changé entre-temps. Une transaction récente non encore contestée ne peut pas être tenue pour légitime, car elle peut être une fraude en attente de label. Une évaluation qui compte ces transactions parmi les exemples légitimes surestime la performance du modèle.
Le cycle vertueux et ses fuites
La boucle d'apprentissage continue
Modèle
Score et décide en temps réel
Approuver / refuser / step-up
➜
Réalité
Le résultat se révèle plus tard
Chargeback, TC40/SAFE, ou silence
➜
Labellisation
On étiquette a posteriori les transactions
Fraude confirmée vs légitime présumée
➜
Réentraînement
Le modèle apprend des nouveaux cas
Puis recalibrage des seuils
Deux phénomènes limitent l'efficacité de cette boucle. Le feedback biaisé vient de ce que le statut réel n'est connu que pour les transactions approuvées. Une transaction refusée ne produit ni chargeback ni confirmation, et le modèle ne reçoit donc aucune information sur les refus injustifiés. La dérive (drift) tient à l'évolution conjointe de la distribution des transactions et des tactiques de fraude, qui dégrade la performance d'un modèle resté inchangé. Ces deux phénomènes imposent des campagnes de labellisation actives et un monitoring permanent, portant sur le taux d'alerte, la précision réalisée et les distributions de features.
Semaines à mois
délai typique entre une transaction et le chargeback qui l'étiquette
Réseaux carte (règles de contestation)
< 1 %
prévalence typique de la fraude dans les transactions, un déséquilibre extrême des labels
Estimation secteur
TC40 / SAFE
flux de signalement de fraude Visa / Mastercard, complémentaires des chargebacks
Visa / Mastercard
🎯 Question éclair
Quel est le principal défaut de la boucle de feedback fondée sur les chargebacks ?
Chapitre 6. GenAI des fraudeurs, outils et gouvernance.
La GenAI désigne les modèles génératifs capables de produire textes, images, voix et vidéos. L'IA se trouve aussi du côté du fraudeur, et la GenAI a industrialisé son arsenal. La GenAI sert à rédiger des messages de phishing sans faute et personnalisés à grande échelle, à créer des identités synthétiques, à contourner les contrôles KYC par deepfake (visage et voix) et à automatiser des campagnes entières. Des modèles malveillants vendus sur le dark web abaissent la barrière technique, comme FraudGPT et WormGPT (2023). Un escroc sans compétence en développement produit désormais un kit de fraude en quelques prompts.
🎭
Deepfakes KYC
Visage ou voix synthétisés pour passer un contrôle d'identité vidéo ou un vishing bancaire. Les tentatives de deepfake dans les parcours d'onboarding ont explosé depuis 2023.
👤
Identités synthétiques
Combinaison de données réelles et fabriquées pour créer un « client » qui n'existe pas, ouvrir des comptes et bâtir un historique avant de frapper (bust-out).
🎣
Phishing industrialisé
La GenAI rédige des leurres crédibles, sans fautes, dans toutes les langues, à volume illimité. L'ingénierie sociale change d'échelle.
🗣️
APP fraud assistée
Fraude par virement autorisé (authorized push payment). La victime paie elle-même, manipulée par un scénario que l'IA rend hyperréaliste.
40 Md$
pertes de fraude aux États-Unis attribuables à la GenAI attendues en 2027 (vs 12,3 Md$ en 2023)
Deloitte Center for Financial Services, 2024
≈ +900 % / an
hausse des incidents de deepfake observés dans certains parcours d'onboarding (2022→2023)
Sumsub, Identity Fraud Report 2023
2023
apparition de FraudGPT et WormGPT sur le dark web
Chercheurs en cybersécurité, 2023
ℹ️
La course aux armements
À chaque capacité offensive nouvelle répond une contre-mesure. La détection de deepfake analyse la vivacité et les artefacts de génération, et les signaux passifs (device, biométrie comportementale) échappent à l'imposteur. Les établissements échangent entre eux sur les mules et les scénarios observés. La détection de fraude est un domaine adversarial, dans lequel le modèle défensif et l'attaquant évoluent l'un en réaction à l'autre. Un modèle laissé en l'état y perd sa performance à mesure que les tactiques adverses se déplacent.
Le paysage des outils
Quelques acteurs de la détection de fraude par IAVisaMastercardSASASStripeNVNVIDIA
Le marché mêle les schemes (Visa, Mastercard), qui scorent au niveau du réseau, et les spécialistes e-commerce (Forter, Signifyd, Riskified, Sift, Ravelin, SEON). S'y ajoutent les plateformes AML/fraude bancaire (Feedzai, Featurespace, NICE Actimize, SAS) et les briques intégrées aux PSP (Radar chez Stripe). La consolidation s'accélère. Le rachat de Featurespace par Visa (annoncé en 2024, finalisé en 2025) illustre l'intégration verticale du scoring dans les réseaux eux-mêmes.
Gouverner un modèle de décision automatisée
Enjeu
Exigence
Cadre / bonne pratique
Explicabilité
Justifier chaque refus (top features contributrices)
SHAP, documentation du modèle, raison codifiée du refus
Décision automatisée
Encadrer un refus qui a un effet significatif sur la personne
RGPD art. 22 : droit à intervention humaine et à contestation
Statut réglementaire
Savoir si le système est « à haut risque »
AI Act : la détection de fraude est explicitement exclue du haut risque (à la différence du scoring de crédit)
Non-discrimination
Éviter les biais indirects (proxy sur origine, quartier)
Tests d'équité, surveillance des taux de refus par segment
Robustesse / drift
Détecter la dégradation et les attaques adverses
Monitoring continu, réentraînement, red teaming
Les piliers de gouvernance d'un moteur de fraude
🔑
Un point de droit souvent mal compris
Sous l'AI Act européen (en vigueur depuis le 1er août 2024, obligations « haut risque » à partir du 2 août 2026), le scoring de crédit est classé à haut risque. La détection de fraude financière en est explicitement exclue. Cette exclusion porte sur le classement à haut risque et ne vaut pas dispense de gouvernance. Le RGPD article 22 encadre toujours toute décision entièrement automatisée produisant un effet significatif, comme bloquer un paiement ou fermer un compte, et impose transparence, droit à une intervention humaine et possibilité de contester.
🎯 Question éclair
Sous l'AI Act européen, comment est traité un système d'IA de détection de fraude au paiement ?