Aller au contenu principal

Modèles de diffusion

Un modèle probabiliste de diffusion par débruitage définit un processus fixe qui corrompt progressivement les données, puis apprend un processus inverse qui reconstruit les échantillons étape par étape.

Processus direct

Pour un calendrier de variance βt\beta_t et αt=1βt\alpha_t=1-\beta_t,

q(xtxt1)=N ⁣(xt;αtxt1,(1αt)I).q(x_t\mid x_{t-1}) = \mathcal{N}\!\left( x_t;\sqrt{\alpha_t}\,x_{t-1}, (1-\alpha_t)I \right).

Soit αˉt=s=1tαs\bar{\alpha}_t=\prod_{s=1}^{t}\alpha_s. Toute étape peut être échantillonnée directement à partir des données propres :

xt=αˉtx0+1αˉtϵ,ϵN(0,I).x_t = \sqrt{\bar{\alpha}_t}\,x_0 + \sqrt{1-\bar{\alpha}_t}\,\epsilon, \qquad \epsilon\sim\mathcal{N}(0,I).

Cette forme fermée évite de simuler toutes les étapes de bruitage précédentes pendant l’entraînement.

Processus inverse appris

La génération nécessite la transition inverse

pθ(xt1xt)=N ⁣(xt1;μθ(xt,t),Σθ(xt,t)).p_{\theta}(x_{t-1}\mid x_t) = \mathcal{N}\!\left( x_{t-1};\mu_{\theta}(x_t,t), \Sigma_{\theta}(x_t,t) \right).

Une paramétrisation courante prédit le bruit ajouté à x0x_0. Un objectif simplifié très répandu est

Ex0,t,ϵ[ϵϵθ(αˉtx0+1αˉtϵ,t)22].\mathbb{E}_{x_0,t,\epsilon} \left[ \left\| \epsilon-\epsilon_{\theta} \left( \sqrt{\bar{\alpha}_t}x_0 +\sqrt{1-\bar{\alpha}_t}\epsilon, t \right) \right\|_2^2 \right].

Cette perte de prédiction du bruit est reliée à l’objectif variationnel, mais la pondération et la paramétrisation exactes comptent : « prédire le bruit par erreur quadratique » ne définit pas à elle seule tous les modèles de diffusion.

Échantillonnage

  1. Tirer xTx_T dans la distribution de bruit choisie.
  2. Pour t=T,,1t=T,\ldots,1, employer le modèle appris et l’échantillonneur pour obtenir xt1x_{t-1}.
  3. Renvoyer la représentation finale x0x_0.

Le conditionnement fournit au débruiteur une information supplémentaire, par exemple une classe, une représentation textuelle ou une mesure. Le guidage peut renforcer ce conditionnement au prix d’un autre compromis entre diversité, fidélité et calibration.

De la prédiction du bruit à une étape inverse

Pour le DDPM gaussien discret des algorithmes 1–2 de l’article original, prendre 0<βt<10<\beta_t<1 et αˉ0=1\bar\alpha_0=1. Choisir un calendrier tel que αˉT\bar\alpha_T soit proche de zéro pour obtenir une distribution terminale approximativement normale standard. Sinon, partir de N(0,I)\mathcal N(0,I) crée un décalage ; un grand nombre d’étapes ne suffit pas à le justifier.

Avec un réseau prédisant epsilon, la moyenne inverse vaut

μθ(xt,t)=1αt(xtβt1αˉtϵθ(xt,t)).\mu_\theta(x_t,t)=\frac{1}{\sqrt{\alpha_t}} \left(x_t-\frac{\beta_t}{\sqrt{1-\bar\alpha_t}}\epsilon_\theta(x_t,t)\right).

Un choix de variance fixe est β~t=βt(1αˉt1)/(1αˉt)\tilde\beta_t=\beta_t(1-\bar\alpha_{t-1})/(1-\bar\alpha_t). Tirer xt1=μθ+β~tξx_{t-1}=\mu_\theta+\sqrt{\tilde\beta_t}\,\xi avec un nouveau ξN(0,I)\xi\sim\mathcal N(0,I) pour t>1t>1 ; à t=1t=1, renvoyer la moyenne sans nouveau bruit. Ceci définit un échantillonneur, pas tous les solveurs de diffusion. Le posterior direct exact conditionné par xtx_t et x0x_0 est gaussien, mais la conditionnelle inverse sans x0x_0 connu ne l’est généralement pas : la transition gaussienne apprise est une approximation de modélisation.

Pour un exemple scalaire, soit αˉt=0.64\bar\alpha_t=0.64, x0=2x_0=2 et le bruit d’entraînement tiré ϵ=1\epsilon=1. Alors xt=0.8(2)+0.6(1)=2.2x_t=0.8(2)+0.6(1)=2.2. Prédire 0.50.5 donne une erreur quadratique de bruit de 0.250.25 et implique x^0=(2.20.6(0.5))/0.8=2.375\hat x_0=(2.2-0.6(0.5))/0.8=2.375. Prédire le bruit réellement tiré restituerait 22 dans cet exemple arithmétique ; à partir de xtx_t seul, ce bruit n’est pas identifiable de façon unique. La MSE apprend une moyenne conditionnelle, pas un inverse oracle de chaque tirage.

L’entraînement tire une observation, une étape (souvent uniformément de 11 à TT) et du bruit, puis effectue une évaluation du débruiteur et une mise à jour par gradient. La génération n’a pas de cible propre et évalue plusieurs fois le débruiteur à poids fixes. La cible de bruit et la sortie du réseau ont la forme de xtx_t ; le conditionnement temporel indique le niveau de bruit à traiter. Cette note couvre le DDPM gaussien discret, pas le flow matching ni tous les solveurs continus ou distillés.

Limites de conception et d’évaluation

  • Le calendrier de bruit, la cible de prédiction, l’architecture du modèle et l’échantillonneur sont des choix distincts.
  • L’échantillonnage standard est itératif et peut exiger de nombreuses évaluations du modèle ; les échantillonneurs plus rapides échangent du calcul contre un comportement d’approximation.
  • Un faible objectif de débruitage ne prouve à lui seul ni la qualité perceptuelle, ni la diversité, ni la qualité de la vraisemblance, ni l’utilité.
  • La génération conditionnelle peut reproduire des biais ou des structures mémorisées des données d’entraînement.
  • L’espace de sortie, le prétraitement et le décodeur peuvent compter autant que le débruiteur.
  • Les produits actuels d’image, d’audio ou d’API relèvent de la veille ; cette note couvre le processus probabiliste durable.

Le point de départ canonique est Denoising Diffusion Probabilistic Models. Les implémentations U-Net et d’échantillonnage propres aux frameworks sont laissées aux bibliothèques et articles maintenus.

Explorer les liens

À lire avant (1)

Citée par (1)

Sur les mêmes sujets (1)

Ouvrir le réseau