Concepts généraux de l’apprentissage automatique
Modèle, paramètres et hyperparamètres
Un modèle associe une entrée à une prédiction au moyen de paramètres appris . Une classe d’hypothèses est l’ensemble des fonctions accessibles avec la représentation choisie. Les hyperparamètres — comme l’intensité de la régularisation, la profondeur d’un arbre ou la largeur d’une architecture — contrôlent la procédure d’apprentissage ou la classe d’hypothèses au lieu d’être ajustés au cours de la même optimisation interne.
Perte et risque empirique
Une perte par exemple mesure l’écart entre une prédiction et sa cible :
L’entraînement minimise généralement le risque empirique auquel s’ajoute un terme de régularisation :
Ici, est le nombre d’exemples d’entraînement et la paire entrée–cible de l’exemple . La perte moyenne est le risque empirique : l’erreur mesurée sur ces observations. Le terme de régularisation pénalise certaines propriétés des paramètres, par exemple des coefficients élevés ; règle son poids par rapport à la perte moyenne. On appelle souvent le coût ou l’objectif. Pour comparer deux objectifs, vérifiez les données utilisées, la convention de moyenne et la pénalité plutôt que leur seul nom.
Les pertes courantes traduisent des hypothèses différentes :
Perte et métrique publiée
La perte guide l’ajustement ; une métrique juge un usage et un découpage précis. Elles peuvent coïncider, sans que ce soit obligatoire. Pour les cibles , comparons ces probabilités de classe positive :
La perte vaut ici , avec des logarithmes naturels. L’exactitude masque les probabilités moins convaincantes de B sur les deux cas centraux. Inversement, une perte logarithmique plus faible ne garantit pas un coût opérationnel inférieur à capacité d’examen fixée. Le guide des métriques de scikit-learn distingue ces objectifs d’évaluation.
Sans variables utiles, la moyenne d’entraînement minimise l’erreur quadratique parmi les constantes, une médiane minimise l’erreur absolue et la classe majoritaire fournit une référence d’exactitude. Estimez ces constantes sur l’entraînement, puis comparez tous les modèles sur les mêmes cas réservés.
Vraisemblance
Pour un modèle probabiliste , le maximum de vraisemblance choisit les paramètres qui rendent les observations probables :
Minimiser la log-vraisemblance négative revient donc à maximiser la vraisemblance. La vraisemblance choisie détermine la perte correspondante ; elle doit découler du modèle d’observation et non être retenue simplement parce qu’une bibliothèque la propose.
Cette somme suppose les observations conditionnellement indépendantes étant donnés leurs entrées et les paramètres. Une séquence dépendante exige une vraisemblance jointe ou séquentielle. Des erreurs gaussiennes indépendantes de même variance fixe donnent la perte quadratique, à un facteur positif et une constante près ; des observations de Bernoulli donnent l’entropie croisée binaire.
L’inférence au moment de la prédiction consiste à évaluer le modèle ajusté sur de nouvelles entrées, sans modifier ses paramètres. L’inférence statistique tire des conclusions sur des quantités inconnues en quantifiant l’incertitude. L’optimisation, elle, est la recherche numérique des paramètres.
Optimisation
La descente de gradient met à jour les paramètres dans la direction opposée au gradient de l’objectif. Le taux d’apprentissage fixe le pas ; un pas trop grand peut augmenter l’objectif ou provoquer une divergence :
- La descente de gradient par lot utilise tout le jeu d’entraînement à chaque mise à jour.
- La descente de gradient stochastique utilise un seul exemple échantillonné.
- Les méthodes par minibatch estiment le gradient sur un petit lot et constituent le compromis de calcul habituel.
La méthode de Newton utilise la courbure locale :
Elle peut converger rapidement près d’un optimum bien conditionné, mais la construction de la Hessienne ou la résolution du système correspondant peuvent être coûteuses ou instables. Le fait qu’un optimiseur atteigne une faible valeur de l’objectif d’entraînement ne prouve pas que le modèle généralise bien.
Limites de la généralisation
Les erreurs d’entraînement, de validation et de test répondent à des questions différentes. Le choix des hyperparamètres consomme de l’information issue de la validation ; le jeu de test doit rester en dehors de cette boucle. L’évaluation doit aussi tenir compte du changement de distribution, des fuites de données, du comportement par sous-groupe, de l’incertitude et du coût des différentes erreurs.
Poursuivez avec la carte des modèles linéaires. Berkeley CS 189 fournit le principal parcours externe.