Activations et réseaux feed-forward à portes
Distinguer ReLU, GELU, SiLU/Swish et les variantes GLU, puis sélectionner les non-linéarités via des expériences contrôlées sur réseaux modernes.
Distinguer ReLU, GELU, SiLU/Swish et les variantes GLU, puis sélectionner les non-linéarités via des expériences contrôlées sur réseaux modernes.
Distinguer les familles par leur contexte visible, objectif d’apprentissage et tête de sortie, du classifieur BERT au générateur de séquences.
Passer des distributions du prochain token à une réponse complète : température, top-k, top-p, recherche, arrêt et sortie structurée.
Comprendre l'adressage par le contenu, Q/K/V, les masques, les variantes multi-têtes, les implémentations efficaces et les limites d'interprétation à travers un exemple numérique.
Suivre un token dans le routage MoE pour distinguer paramètres totaux, paramètres actifs, mémoire, vitesse, équilibrage et communication.
Distinguer recherche image–texte et questions visuelles pour comprendre patches, connecteurs, pertes d’information et évaluation.
Comprendre la capacité du MLP, la rétropropagation, les échecs d'optimisation et le biais inductif à travers les dimensions tensorielles et une construction du XOR.
Biais inductif de la convolution, canaux, padding, pas, pooling et différence entre équivariance et invariance aux translations.
Comprendre la compression d'état récurrent, la rétropropagation à travers le temps, les portes LSTM et la frontière avec les modèles d'espace d'états séquentiels modernes.
Comment les architectures représentent-elles les entrées et produisent-elles les sorties ?
Suivre le texte jusqu’aux identifiants, plongements et états contextuels, en distinguant découpage, position, remplissage et vecteurs de recherche.
Distinguer l’encoder–decoder de 2017 des blocs courants en Pre-Norm, RMSNorm, RoPE, GQA et SwiGLU, ainsi que leurs coûts d’entraînement et d’inférence.