Aller au contenu principal

Apprentissage profond : de l’approximation de fonctions aux modèles de séquence

L’apprentissage profond représente des fonctions par des couches entraînables. Ces notes relient le calcul du modèle à son objectif, ses gradients et son utilisation, sans présenter les architectures comme une échelle de remplacements. Dive into Deep Learning et Deep Learning offrent un traitement plus large.

Fondements communs

La régression linéaire relie paramètres, résidus et mises à jour par gradient. La régression softmax explique logits, scores normalisés et perte de classification. Le MLP ajoute des représentations cachées non linéaires ; les activations et FFN à portes détaillent les opérations de ces couches. La règle de chaîne qui les relie est développée dans la différentiation automatique.

Plusieurs façons de représenter la structure

NoteQuestion traitée
CNNChamps réceptifs locaux, noyaux partagés et limites de l’équivariance par translation.
RNNMise à jour d’un état au fil d’une séquence ; la note présente aussi S4, Mamba et xLSTM comme approches à état.
AttentionProduits scalaires et poids Softmax mélangent les valeurs selon leur contenu. La récurrence est une application historique, pas un prérequis.
TransformersAssociation de l’attention, des positions, des résidus, de la normalisation et des couches feed-forward.

CNN et RNN constituent des branches parallèles, pas des étapes obligatoires avant l’attention. Les MLP restent présents dans les blocs Transformer ; l’attention peut se combiner à la récurrence ou à la convolution. ReLU n’est pas universellement remplacé par GELU, SiLU ou des portes : le choix dépend du modèle et de l’objectif.

Du modèle à l’entraînement et à la génération

Le cache KV prolonge l’explication du Transformer vers l’inférence autorégressive : quand réutiliser un préfixe causal inchangé et comment la mémoire croît. La carte des modèles génératifs distingue objectifs à variables latentes et objectifs de diffusion.

La perte d’entraînement mesure l’objectif ajusté, pas l’utilité générale. Les découpages et fuites de données définissent l’information disponible au moment de prédire ; l’évaluation sous changement de distribution relie les résultats à la population, à la période et aux coûts des erreurs. Preuves et biais distingue affirmations des articles, reproductions et inférences. Un découpage aléatoire peut laisser fuiter des utilisateurs ou des données futures ; ajuster sans cesse sur le jeu de test affaiblit aussi l’interprétation du score.

Cette carte couvre surtout l’entraînement supervisé par gradient et les modèles de séquence, pas l’ensemble de l’apprentissage par renforcement, de l’inférence causale ou des familles d’architectures.

Explorer les liensOuvrir le réseau