Classification avec une unité logistique
Régression logistique comme classifieur linéaire
Un score linéaire suivi d'une sigmoïde et entraîné avec une perte logarithmique constitue la régression logistique, parfois décrite comme un neurone logistique unique. Il ne s'agit pas du perceptron classique, qui utilise une règle de décision à seuil et un algorithme de mise à jour différent.
Formulation mathématique
Pour des entrées , des poids et un biais , le score linéaire est :
Cette équation représente la combinaison linéaire des entrées et de leurs poids respectifs, avec le terme de biais ajouté pour tenir compte des décalages. Pour la classification, la fonction sigmoïde, , est utilisée comme fonction d'activation, transformant en une probabilité entre 0 et 1 :
Cette fonction produit une valeur dans l'intervalle , ce qui la rend adaptée aux tâches de classification binaire.
Fonction sigmoïde
![]()
La fonction sigmoïde, notée , joue un rôle crucial en apprentissage automatique, en particulier dans la régression logistique et les réseaux de neurones, en raison de sa capacité à transformer tout nombre réel dans l'intervalle . Cette propriété est particulièrement utile pour modéliser des probabilités.
Définition
La fonction sigmoïde est définie par :
où est l'entrée de la fonction.
Propriétés
- Domaine et image : la fonction applique le domaine de tous les nombres réels sur l'intervalle .
- Asymptotes : elle possède des asymptotes horizontales en et , ce qui implique que tend vers lorsque et vers lorsque .
- Symétrie : l'identité rend le graphe symétrique par rapport au point , et non par rapport à l'origine.
- Sigmoïde de grandes valeurs positives et négatives : pour de grandes valeurs positives de , tend vers , et pour de grandes valeurs négatives, tend vers .
Dérivée de la fonction sigmoïde
La dérivée de la fonction sigmoïde est importante dans les algorithmes d'apprentissage automatique, en particulier dans le processus d'optimisation. Elle peut être calculée à l'aide de la règle de la chaîne du calcul différentiel et présente une forme simple qui est efficace sur le plan computationnel.
Calcul
Notons la dérivée de par rapport à par . Le calcul se déroule comme suit :
- Partons de la définition .
- En appliquant la règle de la chaîne, nous obtenons :
- En simplifiant, nous obtenons :
- En ajoutant et soustrayant au numérateur et en réarrangeant, nous trouvons :
- Enfin, en reconnaissant que les termes entre parenthèses représentent respectivement et , nous parvenons au résultat élégant :
Descente de gradient pour la régression logistique
La descente de gradient est employée pour minimiser l'erreur entre les classifications prédites et réelles. Elle ajuste les poids et le biais pour réduire la fonction de perte, calculée à l'aide de la perte logarithmique pour la classification :
où est l'étiquette observée et est la probabilité prédite par la sigmoïde. Une étiquette de classe n'est obtenue qu'après avoir choisi un seuil de décision. La fonction de perte mesure l'adéquation entre la probabilité prédite et l'étiquette observée. L'objectif de l'optimisation est de minimiser en ajustant les paramètres du modèle, spécifiquement les poids () et le biais ().
Pour comprendre comment les modifications de et affectent , nous calculons les dérivées partielles de par rapport à ces paramètres. Cela implique de comprendre comment est influencée par et, à son tour, comment dépend de chaque paramètre.
Application de la règle de la chaîne
Le calcul de et implique l'application de la règle de la chaîne du calcul différentiel, exprimée sous la forme :
Le terme est commun à ces expressions et est crucial pour comprendre la direction et l'amplitude du gradient.
Calculs des dérivées
Dérivée de par rapport à
Étant donnée la fonction de perte logarithmique, la dérivée de par rapport à est calculée comme suit :
Cette expression représente la manière dont le gradient de la fonction de perte dépend de la différence entre les valeurs réelles et prédites.
Dérivée de par rapport à et
La probabilité prédite est la sigmoïde du score linéaire. Les dérivées de par rapport à , et s'appuient sur la dérivée de la fonction sigmoïde :
Expressions finales des gradients
Les expressions finales des dérivées partielles de la fonction de perte par rapport aux paramètres sont :
Ces gradients guident les étapes de mise à jour dans l'algorithme de descente de gradient, indiquant la direction et l'amplitude selon lesquelles les paramètres doivent être ajustés pour réduire la perte.
Règle de mise à jour par descente de gradient
Les règles de mise à jour par descente de gradient pour les poids et le biais sont les suivantes, où est le taux d'apprentissage :
Avec un pas adapté, ces mises à jour cherchent une perte plus faible ; la convergence vers des paramètres finis dépend aussi des données, comme l’illustre le cas séparable ci-dessous.
Conclusion
Un score linéaire, une probabilité sigmoïde et une perte logarithmique forment la régression logistique. La descente de gradient utilise les gradients compacts ci-dessus pour ajuster ses poids. Conserver cette terminologie distincte du perceptron classique évite de confondre deux algorithmes proches mais distincts.
Une mise à jour et le cas sans optimum fini
Pour , et , le score est et la probabilité . Le gradient vaut . Avec , mettre simultanément les paramètres à ; alors , et la perte passe de à .
Pour plusieurs exemples, moyenner et aux paramètres courants avant la mise à jour. En posant et en incluant la coordonnée d’intercept dans , la Hessienne de la perte est
La régression logistique à caractéristiques fixes est donc convexe en ses paramètres. La convexité seule ne garantit pas un minimiseur fini : pour des données strictement linéairement séparables, amplifier un score séparateur fait tendre les probabilités des vraies classes vers un et la perte vers zéro, tandis que les poids divergent. Une pénalité quadratique sur tous les paramètres rend l’objectif coercif et strictement convexe ; en pratique, il faut préciser si l’intercept est pénalisé. Une petite variation de perte peut donc accompagner des poids croissants, sans convergence vers des paramètres optimaux finis.
Au seuil , prédire la classe lorsque ; la frontière est linéaire dans les caractéristiques d’entrée. Si les coûts de décision l’exigent, changer le seuil plutôt que les formules du gradient. Calculer la perte directement à partir des logits avec la formule stable de Perte logarithmique, sans prendre le logarithme de probabilités arrondies à ou .