Skip to content
Ancien logo de Centrale Marseille, avec le C orange et le globe bleu
Centrale Marseille, le logo historique
Logo de Centrale Méditerranée
Centrale Méditerranée, le logo actuel

DDEFI · Côté terrain

Le ML en finance : qui s'en sert, et pour quoi faire

On va passer des heures à dériver des gradients. Question légitime : ça sert à quoi, et qui paie pour ça ? Voici la carte, famille par famille, avec les entreprises qui ont publié ce qu'elles font.

Par Sitraka Forler · Enseignant, Durham Business SchoolMis à jour le 3 octobre 2026 À propos du site

époque 600log-loss 0,064erreurs 1 / 40

bons payeursdéfautsdonnées inventées, descente de gradient réelle

Petit avertissement avant de commencer. En crédit, le modèle le plus répandu n'a pas douze couches de neurones : c'est une régression logistique, et son premier lecteur est un régulateur. Gardez ça en tête pour la suite.

Chaque famille est présentée comme dans mes slides : d'abord la version gamin, ensuite la version ingénieur. Puis qui le fait vraiment (cliquez sur les numéros pour la source), et à quoi ressemble le lundi matin du poste.

25Md$

de fraude évitée par an, selon l'estimation de Visa [5]

91%

des prêts de la plateforme Upstart sont entièrement automatisés [1]

60%

d'alertes de blanchiment en moins chez HSBC [8]

800+

cas d'usage d'IA en production chez BNP Paribas [20]

La carte, en sept familles

FamilleCe qu'on préditModèle typiqueLa métrique qui compte
1. Créditle défaut à 12 mois (PD)régression logistique, boostingAUC ou Gini, et la calibration
2. Fraudela transaction frauduleuseboosting, réseaux, règlesle recall à budget d'alertes fixé, la latence
3. Blanchimentl'activité suspecterègles, anomalies, graphesalertes utiles sur alertes levées
4. Marchésun rendement, un coût d'exécutionlinéaire, arbres, renforcementSharpe hors échantillon, slippage
5. Gestiondes facteurs, une perte extrêmemodèles factoriels, PCAla tenue des backtests
6. Assurancefréquence × coût, la fraudeGLM, boostingratio sinistres sur primes
7. Validationsi le modèle des autres tienttous les précédentsstabilité, explicabilité

Famille 1 sur 7

Crédit : « Va-t-il rembourser ? »

Le grand classique. Si vous ne deviez retenir qu'un usage, ce serait celui-là. C'est aussi le projet fil rouge du cours.

Version gamin

Vous prêtez 20 € à un copain. Avant de dire oui, vous vous demandez s'il a rendu la dernière fois. La banque fait pareil, avec des centaines de colonnes à la place d'un souvenir.

Version ingénieur

On estime PD = P(défaut à 12 mois | x). La perte attendue, EL = PD × LGD × EAD, alimente les provisions (IFRS 9 : à 12 mois, ou à maturité si le risque s'est dégradé). Les mêmes PD, LGD et EAD entrent dans la formule de Bâle, qui fixe le capital censé couvrir la perte inattendue. Le modèle doit bien classer (AUC) et être calibré : parmi les clients notés à 2 %, à peu près 2 sur 100 font défaut.

Données
historique de remboursement, revenus, comportement de compte
Modèle
régression logistique le plus souvent, boosting quand on peut le justifier
Métrique
Gini, calibration par classe de risque, stabilité dans le temps

Qui le fait, pour de vrai

  • Upstart, place de marché américaine du prêt, cotée : 91 % des prêts passés par sa plateforme sont entièrement automatisés, et son modèle de prêt personnel utilise plus de 2 500 variables (rapport annuel 2025). [1]
  • BNP Paribas Personal Finance dit utiliser du ML depuis 2015 pour la décision de crédit, la fraude et l'analyse du risque. [2]
  • Côté superviseurs, l'EBA a publié un rapport entier sur le ML dans les modèles internes de notation, et la BCE a ajouté en 2025 une section ML à son guide : le modèle doit rester « adequately explainable ». [3][4]

Lundi matin

Réestimer une PD sur un portefeuille de particuliers, vérifier que le score ne dérive pas, puis écrire la documentation que l'équipe de validation va démonter ligne par ligne.

Le piège

L'accuracy. Avec 2 % de défauts, un modèle qui répond toujours « pas de défaut » affiche 98 % d'accuracy et ne sert à rien. C'est mon exemple de TD préféré, il est juste en dessous.

S'entraîner dans le navigateur : la matrice de confusion et le coût de l'erreur

Question éclair

2 % de défauts dans le portefeuille. Un modèle prédit « pas de défaut » pour tout le monde. Son accuracy ?

À vous de jouer : le seuil qui coûte

10 000 dossiers, 2 % de défauts. Par hypothèse, un défaut accepté coûte 4 500 € (un prêt de 10 000 € dont on récupère un peu plus de la moitié) et un bon client refusé coûte 600 € de marge perdue. Cliquez sur « meilleure accuracy » et regardez le recall. Puis sur « coût minimal ». Puis cassez le modèle en baissant son AUC, pour voir.

Distribution des scores des bons payeurs et des défauts, avec le seuil de refusmax accuracycoût minseuil■ bons payeurs■ défautson accepteon refuse

Les deux courbes sont dessinées à la même hauteur pour qu'on les voie. En vrai, il y a 49 bons payeurs pour 1 défaut.

Matrice de confusion sur 10 000 dossiers
Réalitérefuséaccepté
défautTP 7FN 193
bon payeurFP 5TN 9 795
Accuracy 98,0 %Recall 3,6 %Precision 60,3 %F1 0,07

Coût total : 870 506 € · meilleur seuil : 756 086 € · tout accepter : 900 000 €

Accuracy de 98,0 %, et vous laissez passer presque tous les défauts. Le fameux modèle « excellent » haha.

refuser si p > cFP / (cFP + cFN)
Avec nos coûts : refuser dès que la probabilité de défaut dépasse 600 / (600 + 4 500), soit environ 12 %. Le seuil sort des coûts, pas du modèle.

Deux banques avec le même modèle et des marges différentes n'ont donc pas le même seuil. Et elles ont raison toutes les deux.

« Pourquoi faire simple quand on peut faire compliqué ? »
Devise Shadok (Jacques Rouxel)

En crédit, c'est le simple qui paie : quinze variables qu'on sait défendre devant un superviseur. La BCE veut un modèle explicable. [4]

Famille 2 sur 7

Fraude au paiement : « C'est vraiment vous ? »

Probablement le ML le plus ancien en production dans la finance. Vous l'utilisez sans le savoir à chaque paiement par carte.

Version gamin

Votre carte paie un café à Marseille à 9 h, puis une télé à Singapour à 9 h 05. Même un enfant trouve ça louche. Le modèle tient ce raisonnement sur des milliards de paiements, en moins de temps qu'un clignement d'œil.

Version ingénieur

Classification binaire très déséquilibrée, en temps réel : le score doit sortir en quelques millisecondes, avant l'autorisation du paiement. Features de vélocité (nombre de paiements sur une heure), de distance, de marchand. Le seuil se règle sur un budget d'alertes. Et l'adversaire s'adapte : le drift est garanti.

Données
le flux de transactions, enrichi en temps réel
Modèle
boosting et réseaux de neurones, avec des règles métier par-dessus
Métrique
fraude détectée à taux de faux positifs fixé, et la latence

Qui le fait, pour de vrai

  • Visa estime que son système Advanced Authorization aide à éviter environ 25 milliards de dollars de fraude par an (12 mois à fin avril 2019), sur plus de 127 milliards de transactions en 2018, en à peu près 1 milliseconde chacune. Avec des réseaux de neurones en production depuis 1993 (oui, 1993). [5]
  • Stripe annonce pour son outil Radar 32 % de fraude en moins en moyenne. C'est Stripe qui parle de son propre produit, à lire comme tel. [6]
  • Worldline dit détecter une fraude en 11 millisecondes dans le meilleur des cas, avec jusqu'à 85 % de faux positifs en moins. [7]

Lundi matin

Les alertes ont doublé depuis vendredi. Nouveau schéma de fraude, ou variable cassée dans le pipeline ? Vous cherchez, vous réentraînez, et vous négociez le seuil avec l'équipe qui traite les alertes à la main.

Le piège

Le data leakage. Le label « fraude » arrive des semaines après le paiement, quand le client conteste. Si le futur se glisse dans l'entraînement, l'AUC est magnifique. Et fausse.

S'entraîner dans le navigateur : quand un modèle déployé se dégrade

Question éclair

Votre modèle de fraude a une AUC de 0,99 en validation et de 0,71 en production. Premier suspect ?

Famille 3 sur 7

Blanchiment : « D'où vient cet argent ? »

Moins glamour que le trading, je vous l'accorde. Mais au Luxembourg, où je travaille, la conformité est un employeur à part entière.

Version gamin

Un surveillant de cantine doit repérer ceux qui s'échangent des cartes sous la table. Sauf qu'il a un milliard d'élèves. Alors il siffle tout le temps, et presque toujours pour rien.

Version ingénieur

Historiquement, des règles (seuils de montant, pays, fréquence) qui lèvent beaucoup d'alertes pour peu de vrais cas. Le ML sert à trier : score de risque par client, détection d'anomalies, graphes de transactions. Peu de labels, donc beaucoup de non supervisé.

Données
transactions, connaissance client (KYC), réseaux de contreparties
Modèle
règles, isolation forest, clustering, modèles sur graphes
Métrique
taux d'alertes utiles, volume traité par analyste

Qui le fait, pour de vrai

  • HSBC avec l'outil AML AI de Google Cloud : 2 à 4 fois plus d'activité suspecte détectée, 60 % d'alertes en moins, sur 1,2 milliard de transactions par mois. C'est un dirigeant de HSBC qui le raconte. [8]
  • Au Luxembourg, la détection du blanchiment et de la fraude est le premier cas d'usage de l'IA chez les établissements de monnaie électronique, et le deuxième chez les établissements de paiement. [9]

Lundi matin

Vous travaillez avec des analystes conformité, pas avec des traders. Vous construisez le score qui trie leurs alertes, et vous documentez chaque variable : un jour, il faudra l'expliquer au régulateur.

Le piège

Croire qu'on peut jeter les règles. Les superviseurs attendent une couverture documentée des typologies connues, et certains seuils de déclaration sont dans la loi. Le ML vient par-dessus.

Famille 4 sur 7

Marchés : acheter, vendre, et surtout à quel prix

Celui qui fait rêver. Je vais doucher un peu l'enthousiasme, mais gentiment.

Version gamin

Vous voulez vendre 1 000 cartes Pokémon dans la cour. Si vous les sortez toutes d'un coup, le prix s'effondre. Alors vous vendez par petits paquets, au bon moment. Un algorithme d'exécution fait ça avec des actions.

Version ingénieur

Deux problèmes très différents. (1) Prédire des rendements : rapport signal sur bruit minuscule, séries non stationnaires, et un gros risque d'overfitting à force de backtests. (2) Exécuter un ordre : minimiser le coût d'impact, un problème de contrôle qu'on traite parfois par reinforcement learning.

Données
prix, carnets d'ordres, fondamentaux, données alternatives
Modèle
du linéaire régularisé aux arbres et réseaux ; RL côté exécution
Métrique
Sharpe hors échantillon, slippage en points de base

Qui le fait, pour de vrai

  • La référence académique : Gu, Kelly et Xiu (Review of Financial Studies, 2020) comparent les méthodes de ML pour prédire les rendements d'actions. Arbres et réseaux gagnent, et les signaux qui comptent restent le momentum, la liquidité et la volatilité. [10]
  • Des chercheurs de J.P. Morgan écrivaient dès 2018 faire tourner la « deuxième génération » de leur moteur de placement d'ordres par reinforcement learning. [11]
  • Man AHL dit faire trader des systèmes de ML dans un portefeuille client depuis début 2014. [12]
  • Two Sigma affiche environ 640 pétaoctets de données sur sa page d'accueil. Sans dire ce qu'ils en font, évidemment haha. [13]

Lundi matin

L'essentiel du temps part dans les données et le backtest, très peu dans le modèle. Et vous avez un collègue payé pour prouver que votre signal est un artefact.

Le piège

Le backtest qui a trop servi. Testez 1 000 stratégies au hasard, gardez la meilleure : bravo, vous avez trouvé le max de 1 000 tirages.

S'entraîner dans le navigateur : backtester sans se mentir
« En essayant continuellement, on finit par réussir. Donc plus ça rate, plus on a de chances que ça marche. »
Devise Shadok (Jacques Rouxel)

Un backtest relancé 1 000 fois, quoi.

Question éclair

Vous testez 200 stratégies sur le même historique et vous gardez la meilleure. Son Sharpe en backtest est…

Famille 5 sur 7

Gestion d'actifs : le simulateur de vol

Ici, la robustesse compte plus que le dernier point d'AUC.

Version gamin

Un gérant garde les économies de millions de gens. Avant de bouger un euro, il veut savoir ce qui se passe si les taux montent demain. La plateforme de risque, c'est son simulateur de vol.

Version ingénieur

Modèles factoriels (la régression linéaire, encore elle), PCA sur les courbes de taux, simulation de scénarios, VaR et Expected Shortfall. Le ML arrive par les bords : données alternatives, lecture automatique de textes, optimisation de portefeuille.

Données
positions, prix, courbes, expositions aux facteurs
Modèle
factoriels, PCA, covariance régularisée
Métrique
backtests de VaR, tracking error

Qui le fait, pour de vrai

  • BlackRock écrit noir sur blanc dans son rapport annuel 2025 qu'il utilise du ML et de l'IA dans son activité. Ses services technologiques, dont la plateforme Aladdin, pèsent 2,0 milliards de dollars de revenus, pour 14 000 milliards d'encours gérés. [14]

Lundi matin

Un chiffre de risque a bougé bizarrement cette nuit, et des centaines de gérants le consultent ce matin. C'est vous qu'on appelle.

Le piège

Une matrice de covariance estimée sur trop peu de données. Elle a l'air précise, et l'optimiseur adore ses erreurs.

S'entraîner dans le navigateur : optimiser un portefeuille

Famille 6 sur 7

Assurance : tarifer, régler, détecter

Les actuaires faisaient des modèles prédictifs bien avant qu'on appelle ça de la data science. Respect.

Version gamin

Dix copains mettent chacun 1 € dans une boîte pour rembourser celui qui casse ses lunettes. Question : combien doit mettre celui qui les casse tous les mois ?

Version ingénieur

prime pure = fréquence × coût moyen, estimés par des GLM (Poisson pour la fréquence, Gamma pour le coût), et de plus en plus par boosting. Côté sinistres : classification pour automatiser les cas simples, et détection de fraude avec très peu de labels.

Données
contrats, sinistres, photos et documents de déclaration
Modèle
GLM en référence, boosting en challenger
Métrique
ratio sinistres sur primes, lift par décile

Qui le fait, pour de vrai

  • Shift Technology (une entreprise française) et AXA ont renouvelé leur partenariat pour cinq ans en mars 2026, sur 15 pays : sinistres, fraude, souscription. Ils travaillent ensemble depuis 2016. [15]
  • Allianz UK a annoncé 1,7 million de livres économisées avec son outil de ML contre la fraude aux sinistres. [16]
  • Lemonade : son assistant prend 96 % des premières déclarations de sinistre, et environ 55 % des sinistres sont traités automatiquement (rapport annuel 2025). [17]

Lundi matin

Le GLM de tarification est votre baseline, l'équité de traitement votre contrainte. Le boosting doit prouver qu'il fait mieux sans devenir une boîte noire.

Le piège

Une variable qui discrimine sans le dire. Le code postal en sait souvent plus long qu'il n'en a l'air.

Famille 7 sur 7

Valider le modèle des autres

Bâle 1 : un ratio. Puis le monde s'est révélé plus complexe qu'un seul ratio. Donc on en a fait plusieurs haha. Et quelqu'un doit vérifier les modèles qui les calculent.

Version gamin

Avant de laisser un élève corriger les copies des autres, quelqu'un vérifie qu'il sait compter. Puis quelqu'un vérifie le vérificateur.

Version ingénieur

Tout modèle qui touche au capital ou aux provisions passe par une validation indépendante. Pour évaluer un algorithme d'IA, l'ACPR proposait en 2020, dans un document de réflexion, quatre critères : traitement adéquat des données, performance, stabilité, explicabilité. [18] Aux États-Unis, la lettre SR 11-7 sur le risque de modèle a été remplacée en avril 2026 par SR 26-2 (l'ancienne traîne encore dans les fiches de poste). [19]

Données
les mêmes que le modèle audité, plus tout ce qu'il a oublié
Modèle
un challenger, des tests de sensibilité, des backtests
Métrique
stabilité (PSI), performance hors échantillon, explicabilité

Qui le fait, pour de vrai

  • L'échelle du sujet en France : BNP Paribas annonce plus de 800 cas d'usage d'IA en production, Société Générale environ 700 cas d'usage data et IA en 2024, dont 60 % à base d'IA. [20][21]
  • D'après une enquête de l'ACPR de 2025, citée par le premier sous-gouverneur de la Banque de France, la quasi-totalité des banques et des assureurs ont désormais des cas d'usage en production. [22]
  • Au Luxembourg, la revue CSSF et BCL recense 402 cas d'usage chez les établissements qui ont répondu, dont 54 % en production. [9]

Lundi matin

On vous paie pour chercher la faille dans le travail des autres. Excellente école : en deux ans, vous aurez vu tous les modèles de la maison.

Le piège

Les généraux se préparent toujours à la guerre précédente. Un modèle validé sur la dernière crise ne l'est pas pour la prochaine.

Et la loi dans tout ça ?

Question éclair

Lequel de ces trois systèmes est « à haut risque » au sens de l'AI Act ?

Si vous ne retenez que trois choses

  • Le seuil vient des coûts. Accuracy, recall ou euros : trois seuils différents.
  • L'essentiel du boulot est avant et après le modèle : data, leakage, drift. Le fit() prend une ligne.
  • Le régulateur lit tout. Autant apprendre à lui écrire maintenant.

Les sources

Chaque chiffre vient d'une source publique, relue le 3 octobre 2026. Lien mort, chiffre qui a bougé ? Dites-le-moi.

  1. [1]Upstart Holdings, rapport annuel 2025 (formulaire 10-K) · SEC, février 2026
  2. [2]Artificial Intelligence at the Heart of BNP Paribas Personal Finance's Transformation · BNP Paribas Personal Finance, lu en octobre 2026
  3. [3]Follow-up report on machine learning for IRB models · Autorité bancaire européenne (EBA), août 2023
  4. [4]Guide révisé des modèles internes, avec une section machine learning · BCE, supervision bancaire, juillet 2025
  5. [5]Visa prevents approximately $25 billion in fraud using artificial intelligence · Visa, juin 2019
  6. [6]Stripe Radar, page produit · Stripe, lue en octobre 2026
  7. [7]Artificial intelligence: a powerful ally in the fight against payment fraud · Febelfin et Worldline, novembre 2024
  8. [8]How HSBC fights money launderers with artificial intelligence · HSBC, sur le blog Google Cloud, novembre 2023
  9. [9]Revue thématique sur l'usage de l'IA dans le secteur financier luxembourgeois, 2e édition · CSSF et BCL, mai 2025
  10. [10]Empirical Asset Pricing via Machine Learning · Gu, Kelly et Xiu, Review of Financial Studies 33(5), 2020
  11. [11]Idiosyncrasies and challenges of data driven learning in electronic trading · Bacoyannis, Glukhov, Jin, Kochems et Song (J.P. Morgan), arXiv, novembre 2018
  12. [12]The Rise of Machine Learning · Man AHL, novembre 2016
  13. [13]Two Sigma, page d'accueil · Two Sigma, lue en octobre 2026
  14. [14]BlackRock, rapport annuel 2025 (formulaire 10-K) · SEC, février 2026
  15. [15]Shift Technology and AXA renew partnership across 15 countries · Coverager, repris par Shift Technology, mars 2026
  16. [16]Allianz develops machine learning tool to support fraud claims · Allianz UK, décembre 2023
  17. [17]Lemonade, rapport annuel 2025 (formulaire 10-K) · SEC, février 2026
  18. [18]Gouvernance des algorithmes d'intelligence artificielle dans le secteur financier (document de réflexion) · ACPR (Dupont, Fliche, Yang), juin 2020
  19. [19]SR 26-2, la lettre qui remplace SR 11-7 sur le risque de modèle · Réserve fédérale, avril 2026
  20. [20]Data et intelligence artificielle chez BNP Paribas · BNP Paribas, lu en octobre 2026
  21. [21]Applying data and AI: Societe Generale flagship use cases · Société Générale, février 2025
  22. [22]Intelligence artificielle : les nouvelles frontières du risque (discours de Denis Beau) · Banque de France, septembre 2026
  23. [23]AI Act, annexe III : les systèmes d'IA à haut risque · Commission européenne, AI Act Service Desk, lu en octobre 2026
  24. [24]Règlement (UE) 2026/1744 du 8 juillet 2026 · Journal officiel de l'Union européenne, juillet 2026
La suiteL'IA générative en finance : ce qui tourne pour de vrai

Page tenue par Sitraka Forler, enseignant vacataire à Centrale Marseille dans l'option DDEFI. Les entreprises citées le sont à partir de leurs propres publications, je ne parle pas en leur nom. Une erreur ? Signalez-la et je corrige.