Si un mot du cours vous fait hésiter, c'est ici. Chaque section tient en une idée et une scène à manipuler. C'est l'esprit des vidéos de 3Blue1Brown, que je vous recommande sans réserve : Grant Sanderson fabrique ses animations avec sa propre bibliothèque Python, manim. Ici c'est plus modeste, du SVG animé dans votre navigateur, mais c'est vous qui tenez la souris.
Un vecteur, c'est une flèche
Version gamin
Une flèche qui dit : « 2 pas à droite, 2 et demi vers le haut ». Peu importe d'où vous partez, c'est le déplacement qui compte.
Version ingénieur
Un élément de ℝⁿ : une liste de n nombres. Un client décrit par 40 variables est un point dans un espace à 40 dimensions. On ne sait pas le dessiner, mais l'intuition du plan reste vraie : longueur, direction, addition.
Attrapez la pointe orange
- Essayez. Attrapez la pointe orange et promenez-la : les coordonnées suivent. Puis cliquez sur « Additionner » : v glisse au bout de u, et la somme apparaît en vert.
- Où ça sert. Chaque ligne de votre tableau de données est un vecteur. Un portefeuille aussi : (30 % actions ; 50 % obligations ; 20 % cash).
Une matrice, c'est une transformation
Version gamin
Une machine à déformer l'espace. Elle prend toute la feuille quadrillée et la tourne, l'étire ou l'écrase, sans jamais plier les lignes : les droites restent droites, et le centre ne bouge pas.
Version ingénieur
Une application linéaire. Les colonnes de la matrice sont les images des vecteurs de base : la première dit où atterrit î, la seconde où atterrit ĵ. Tout le reste suit, parce que M(a·î + b·ĵ) = a·M(î) + b·M(ĵ).
Attrapez î ou ĵ, ou choisissez une transformation
- Essayez. Cliquez sur « Écrasement ». Le déterminant tombe à zéro, le carré jaune devient un trait : la matrice n'est plus inversible. C'est ce qui arrive à XᵀX quand deux variables racontent la même chose (la colinéarité).
- Essayez encore. Attrapez î et ĵ à la main, et regardez les deux colonnes de la matrice changer. Vous venez de lire une matrice : colonne 1 pour î, colonne 2 pour ĵ.
- Où ça sert. La régression linéaire (ŷ = Xβ), une couche de réseau de neurones (Wx + b), une matrice de covariance. À chaque fois, une grille qu'on déforme.
Question éclair
Une matrice 2 × 2 a un déterminant nul. Que fait-elle au plan ?
Le produit scalaire : vont-ils dans le même sens ?
Version gamin
Deux flèches, une seule question : est-ce qu'elles tirent dans le même sens ? Très positif : oui. Zéro : elles s'ignorent. Négatif : elles se contredisent.
Version ingénieur
a · b = ‖a‖ ‖b‖ cos θ. La projection de b sur a est la meilleure approximation de b par un multiple de a. La régression par moindres carrés, c'est cette projection, en grande dimension.
Déplacez a et b
- Essayez. Tournez b jusqu'à ce qu'il soit perpendiculaire à a : le produit scalaire passe par zéro et la projection disparaît.
- Où ça sert. La corrélation entre deux séries de rendements centrées, c'est le cosinus de l'angle entre elles. Et en IA générative, la « similarité » entre une question et un document, c'est encore un cosinus (voir le RAG).
La dérivée : ça monte ou ça descend ?
Version gamin
Vous êtes à vélo. La dérivée, c'est ce que sentent vos jambes : ça monte, ça descend, ou c'est plat.
Version ingénieur
f′(x) = lim (f(x + h) − f(x)) / h quand h tend vers 0 : la pente de la tangente. Là où f′(x) = 0, la courbe est à plat : un minimum, un maximum, ou un faux plat.
Faites glisser le point le long de la courbe
- Essayez. Faites glisser le point. La tangente devient verte quand la pente s'annule. Comptez : deux creux et une bosse. Un seul des deux creux est le plus bas, et rien dans la pente locale ne vous dit lequel.
- Où ça sert. Entraîner un modèle, c'est chercher le creux d'une fonction de coût. Et la sensibilité du prix d'une option au prix du sous-jacent, le delta, c'est une dérivée.
Optimiser, c'est descendre dans le brouillard
Version gamin
Vous êtes en montagne, dans le brouillard, et vous voulez descendre. Vous tâtez le sol avec le pied, vous faites un pas dans la direction qui descend le plus. Et vous recommencez.
Version ingénieur
Le gradient ∇f rassemble les dérivées partielles : il pointe vers la montée la plus raide. On avance donc dans l'autre sens, d'un pas de taille η. Les ellipses bleues sont les lignes de niveau du coût, comme sur une carte de randonnée.
Déplacez le point de départ
- Essayez. Lancez la descente avec η = 0,10. Puis montez η au-dessus de 0,33 et relancez : la bille saute d'un versant à l'autre, de plus en plus haut. Sur cette vallée la limite est η < 2/6, au-delà chaque pas dépasse le fond de plus qu'il ne rattrape.
- Essayez encore. Mettez η à 0,02 : ça marche, mais c'est interminable dans le sens plat. C'est pour ça qu'on normalise les variables avant d'entraîner : une vallée ronde se descend d'une traite.
- Où ça sert. Tout l'apprentissage automatique. Une régression logistique, un réseau de neurones, un LLM à des milliards de paramètres : la même boucle, avec plus de dimensions.
Question éclair
Pendant l'entraînement, le coût augmente à chaque étape. Que faites-vous ?
Bayes : l'alarme qui sonne pour rien
Version gamin
Le détecteur de fumée sonne. Y a-t-il le feu ? Presque jamais : il sonne surtout pour des tartines grillées. Il n'est pas mauvais pour autant. Les incendies sont rares, c'est tout.
Version ingénieur
P(défaut | alerte) = P(alerte | défaut) · P(défaut) / P(alerte). Quand l'événement est rare, les fausses alertes sur la masse des cas normaux écrasent les vraies.
Une alerte, c'est tout ce qui est en haut : le vert (vrais défauts) et le jaune (fausses alertes). La probabilité cherchée, c'est la part de vert dans cette bande.
- Essayez. Avec 2 % de défauts, 65 % de détection et 5 % de fausses alertes, une alerte n'a qu'environ une chance sur cinq d'être un vrai défaut. Montez la part de défauts à 30 % : le même modèle devient soudain « précis ».
- Où ça sert. Le crédit, la fraude, le blanchiment : partout où ce qu'on cherche est rare. C'est pour ça qu'on ne juge jamais ces modèles à l'accuracy (le simulateur de seuil le montre avec des euros).
Question éclair
Un modèle détecte 99 % des fraudes et se trompe sur 1 % des paiements honnêtes. Un paiement sur 1 000 est frauduleux. Une alerte sonne : quelle est la probabilité que ce soit une vraie fraude ?
Et maintenant ?
- Vous avez les six briques. Le cours les assemble : une matrice de données, un coût, une descente, et Bayes pour lire le résultat.
- Pour voir à quoi ça sert chez de vrais employeurs : le ML en finance, puis l'IA générative.
- Pour mettre les mains dans le code, sans rien installer : le parcours Machine Learning.
Page tenue par Sitraka Forler, enseignant vacataire à Centrale Marseille dans l'option DDEFI. Les entreprises citées le sont à partir de leurs propres publications, je ne parle pas en leur nom. Une erreur ? Signalez-la et je corrige.

