Activations et réseaux feed-forward à portes
« ReLU est obsolète » est trop général ; se limiter à ReLU, sigmoïde et tanh est daté. Le choix dépend de l’architecture, de l’échelle, de la précision, des kernels et du matériel. Les FFN à portes changent aussi le budget, pas uniquement une fonction élémentaire.
| Nom | Définition/rôle | Atout | Limite |
|---|---|---|---|
| ReLU | peu coûteux, zéros exacts | gradient nul côté négatif | |
| Leaky/PReLU | gradient négatif conservé | hypothèse/paramètre supplémentaire | |
| GELU | pondération lisse | approximations et kernels différents | |
| SiLU/Swish | lisse, petites valeurs négatives | non-monotonicité, quantification | |
| Sigmoïde | porte ou probabilité | saturation | |
| Tanh | état borné et centré | saturation aux extrêmes |
GELU peut utiliser des approximations erf ou tanh. Swish peut apprendre ; SiLU fixe souvent . Il faut enregistrer l’implémentation.
La douceur n’est pas un progrès universel
Les gains interagissent avec initialisation, normalisation, largeur, données, optimiseur et fusion des kernels. ReLU reste pertinent quand coût, zéros exacts, quantification ou petite taille dominent. Une baseline ReLU stable permet aussi de voir si une porte n’a gagné qu’en ajoutant des paramètres.
GLU, GEGLU et SwiGLU
Une couche à portes possède trois projections principales au lieu de deux. À nombre de paramètres égal, sa largeur intermédiaire doit donc être réduite ; aucun ratio n’est universel.
BERT utilisait GELU ; PaLM rapportait SwiGLU ; Llama 3 combine SwiGLU, RMSNorm, RoPE et GQA ; ConvNeXt montre GELU dans un ConvNet moderne. Ces exemples établissent des choix datés, pas une supériorité générale, et plusieurs changements simultanés empêchent d’attribuer le gain à l’activation seule.
Les activations de sortie relèvent d’une autre décision : logits binaires, Softmax exclusif, sigmoïdes multilabel ou support de régression. Pour la stabilité, les pertes consomment souvent directement les logits.
Échecs et protocole
Surveiller unités mortes, saturation, portes effondrées, NaN en précision mixte, kernel non fusionné et dégradation après quantification. Fixer split, initialisation, optimiseur, étapes et arrêt ; déclarer largeur, paramètres, FLOPs, mémoire et débit cible ; répéter les seeds ; définir avant le test les seuils de qualité, latence et stabilité.
Cette note favorise les Transformers denses sur GPU. Activations périodiques, splines, réseaux implicites, modèles impulsionnels et accélérateurs spécialisés demandent d’autres critères.