Activations et réseaux feed-forward à portes
Distinguer ReLU, GELU, SiLU/Swish et les variantes GLU, puis sélectionner les non-linéarités via des expériences contrôlées sur réseaux modernes.
Distinguer ReLU, GELU, SiLU/Swish et les variantes GLU, puis sélectionner les non-linéarités via des expériences contrôlées sur réseaux modernes.
Propagation avant, rétropropagation et mise à jour des paramètres dans un classificateur à une couche cachée.
Classification binaire avec score linéaire, probabilité sigmoïde, perte logarithmique et gradients de paramètres obtenus par la règle de la chaîne.
Comprendre l'adressage par le contenu, Q/K/V, les masques, les variantes multi-têtes, les implémentations efficaces et les limites d'interprétation à travers un exemple numérique.
Comprendre la capacité du MLP, la rétropropagation, les échecs d'optimisation et le biais inductif à travers les dimensions tensorielles et une construction du XOR.
Une unité linéaire unique pour la régression, avec perte quadratique, gradients issus de la règle de chaîne et mise à jour des paramètres.