Régression avec une unité linéaire
Une unité linéaire prédit un nombre réel par une combinaison affine des entrées. Cette note dérive ses gradients de perte quadratique ; elle n’utilise ni l’activation à seuil ni la mise à jour déclenchée par les erreurs du perceptron classique.
Une unité linéaire pour la régression
L’entraînement ajuste poids et biais pour minimiser la perte choisie. C’est exactement la régression linéaire, pas un modèle biologique du neurone. Le manuel Dive into Deep Learning emploie la même sortie linéaire et la même convention de demi-perte quadratique.
Représentation mathématique
Étant données des entrées avec les poids correspondants et un terme de biais , la sortie de l’unité linéaire est donnée par :
Cette sortie peut être utilisée pour des prédictions dans des problèmes de régression linéaire, où peut représenter la valeur prédite d'une variable dépendante, telle que le prix d'une maison.
Fonction de perte
Une perte courante en régression est l’erreur quadratique moyenne (MSE). Nous en utilisons ici la moitié pour simplifier les dérivées :
où est la valeur réelle, est la valeur prédite, et est le nombre d'échantillons.
Descente de gradient
Algorithme de descente de gradient
Pour minimiser la fonction de perte, la descente de gradient met à jour les paramètres comme suit :
Où représente le taux d'apprentissage, un hyperparamètre qui contrôle la taille des pas au cours du processus d'optimisation.
Calcul des dérivées
Les règles de mise à jour reposent sur le calcul des dérivées de la fonction de perte par rapport à chaque paramètre. Ces dérivées sont obtenues à l'aide de la règle de la chaîne pour la dérivation. Pour un modèle avec une fonction de perte quadratique simple (), les dérivées sont les suivantes :
Dérivée de la fonction de perte par rapport aux prédictions
Dérivées partielles des prédictions
- Par rapport au biais () :
- Par rapport au poids () :
- Par rapport au poids () :
Application de la règle de la chaîne
La règle de la chaîne est appliquée pour calculer le gradient de la fonction de perte par rapport à chaque paramètre :
- Pour le biais () :
- Pour le poids () :
- Pour le poids () :
Règles de mise à jour
En réintégrant les dérivées dans la formule de descente de gradient, les paramètres sont mis à jour de manière itérative :
Par l'application répétée de ces mises à jour, la descente de gradient vise à converger vers les valeurs optimales de et qui minimisent la fonction de perte, conduisant à un modèle avec une erreur de prédiction minimisée.
Conclusion
La règle de la chaîne sépare la dérivée de la perte de celle de la prédiction. Ce schéma s’étend aux réseaux non linéaires, tandis que ce modèle reste affine en ses entrées.
D’un exemple à un lot
Le facteur fait de la perte affichée la moitié de la MSE ; il annule le provenant de la dérivée du carré. Pour un indice d’exemple et un indice de caractéristique , posons . Les gradients sur le lot complet sont
Les formules scalaires précédentes correspondent à . Avec , et tous les paramètres initialement nuls, , donc . Pour , la mise à jour simultanée donne . La prédiction devient et la demi-perte quadratique passe de à .
Pour un lot, moyenner les gradients calculés aux mêmes paramètres avant la mise à jour. À caractéristiques fixes, cet objectif quadratique est convexe, mais l’unicité des poids exige une matrice de conception de rang colonne plein. Un pas adapté reste nécessaire pour converger. Une unité linéaire seule ne représente pas des relations non linéaires arbitraires, et une faible perte d’entraînement ne prouve pas la qualité des prédictions sur de nouvelles données.