Autoencodeurs variationnels
Un autoencodeur variationnel (VAE) est un modèle génératif à variables latentes. Il définit un a priori et une vraisemblance de décodeur :
Pour une observation , la distribution a posteriori décrit les valeurs latentes susceptibles de l’expliquer sous le modèle. Cette distribution étant généralement difficile à calculer directement, un encodeur l’approche. Le même encodeur, aux paramètres partagés , fournit une distribution approchée pour chaque observation. Cette réutilisation entre observations s’appelle l’inférence amortie.
Borne inférieure de l’évidence
L’entraînement maximise la borne inférieure de l’évidence (ELBO) :
Il s’agit d’une borne inférieure car
Dans l’ELBO, l’espérance de la log-vraisemblance du décodeur favorise l’explication de l’observation. La pénalité KL par rapport à l’a priori maintient la distribution approchée près de celui-ci, pour que les tirages issus de l’a priori atteignent plus facilement les régions apprises par le décodeur ; cela ne garantit pas la qualité des générations. Réduire cette espérance à une simple « perte de reconstruction » masque un choix de modélisation essentiel : les vraisemblances de Bernoulli, gaussienne, catégorielle ou autres impliquent des objectifs et des hypothèses différents sur les données.
Gradients reparamétrés
Pour un encodeur gaussien diagonal,
on échantillonne au moyen d’un bruit indépendant des paramètres :
L’aléa est ainsi déplacé hors du chemin différentiable passant par et .
Pour un a priori normal standard, le terme KL possède une forme fermée :
Une observation, une perte d’entraînement
Ici mesure l’écart entre distributions ; elle est non négative, asymétrique et nulle seulement si elles coïncident presque partout. L’identité de l’ELBO suppose des densités et espérances bien définies. Elle découle de la substitution de Bayes, , dans cette définition de KL. L’écart s’annule quand l’encodeur égale le vrai posterior, pas simplement quand la reconstruction est bonne. C’est l’argument variationnel d’Auto-Encoding Variational Bayes.
Prenons un encodeur unidimensionnel avec , et un tirage fixé , donnant . Supposons et l’observation . La log-vraisemblance négative de ce tirage est . La KL analytique vers vaut . L’estimation de l’ELBO négative à un échantillon vaut donc . Elle estime une espérance ; un tirage Monte-Carlo particulier ne garantit pas à lui seul une borne de .
Pour un lot de observations et une largeur latente , l’encodeur produit moyenne et log-variance de forme [B, d_z]. Poser , tirer un bruit de même forme, sommer la log-vraisemblance de reconstruction sur les dimensions observées et la KL sur les dimensions latentes, puis moyenner sur le lot. Moyenner uniquement les dimensions de reconstruction au lieu de les sommer change implicitement son poids relatif à la KL. La génération utilise un tirage de l’a priori et le décodeur sans encodeur ; renvoyer la moyenne du décodeur fournit un résumé déterministe, pas un échantillon complet de la vraisemblance.
Génération et variantes
- Génération : échantillonner , puis échantillonner ou décoder .
- VAE conditionnel : conditionner l’encodeur et le décodeur sur une information supplémentaire .
- -VAE : pondérer le terme KL par pour modifier le compromis débit–distorsion. Un poids plus fort ne garantit pas une représentation uniquement désintriquée ou sémantiquement pertinente.
Modes d’échec
- Effondrement du posterior : un décodeur puissant peut ignorer , laissant proche de l’a priori.
- Écart d’approximation : la famille variationnelle choisie peut mal représenter le véritable posterior.
- Vraisemblance inadaptée : une distribution de décodage commode peut produire des échantillons ou reconstructions indésirables.
- Interprétation latente : une interpolation lisse ne prouve pas que les coordonnées latentes correspondent à des concepts humains indépendants.
- Détection d’anomalies : les scores de reconstruction ou de vraisemblance peuvent échouer sur des données inconnues et exigent une validation propre à la tâche.
La source canonique est Auto-Encoding Variational Bayes. Le code d’entraînement lié à un framework est volontairement omis : les hypothèses du modèle et l’ELBO constituent la partie durable.