Préentraînement, ajustement supervisé et optimisation des préférences
L’architecture détermine comment circule l’information ; l’entraînement détermine les comportements acquis. Deux Transformers identiques peuvent se comporter différemment selon leurs données, objectifs et mises à jour. Pour comprendre une étape, demander d’où vient la cible et quelles sorties la perte récompense.
Le préentraînement exploite de nombreux exemples
Un modèle autorégressif prédit le prochain token à partir des précédents. Décaler le texte d’une position fournit les cibles. Sa log-vraisemblance négative est :
Avec la séquence fictive the / lamp / is / blue, prédire blue utilise the / lamp / is. Un masque causal permet de calculer plusieurs positions en parallèle pendant l’entraînement. À la génération, les futurs tokens n’existent pas encore : la séquence s’allonge progressivement. Voir la génération autorégressive.
Un encodeur peut reconstruire des tokens masqués à partir de leur contexte. L’article BERT décrit ce préentraînement puis l’adaptation aux tâches en aval. La représentation bidirectionnelle sert à classer ou extraire de l’information, sans constituer automatiquement un assistant suivant des instructions. Les familles encodeur et décodeur expliquent la différence architecturale.
L’auto-supervision réduit l’annotation manuelle, mais conserve cibles et signal d’erreur. Sources, doublons, équilibre linguistique et frontières documentaires influencent l’apprentissage. Une faible perte de prédiction textuelle ne prouve pas la justesse des citations ou des appels d’outils : ce sont d’autres critères.
L’ajustement supervisé précise la sortie souhaitée
L’ajustement supervisé, ou SFT, utilise des couples entrée–cible. Pour un assistant, la cible peut être une réponse acceptable ; pour un classifieur, une étiquette. SFT désigne une étape et une organisation des données, sans imposer une architecture conversationnelle.
En génération conditionnelle, on prédit souvent les tokens de réponse à partir de la consigne et des tokens cibles précédents. Un masque de perte peut exclure consigne et remplissage. Avec 80 tokens de consigne, 20 de réponse et 28 de remplissage, une perte moyenne limitée à la réponse se divise par 20, pas par 128. Confondre ces conventions change le poids relatif des réponses courtes et longues.
Imaginons un classifieur keep, summarize, discard. Associer « copie d’une note déjà enregistrée » à discard enseigne une décision particulière. Des doublons faciles ne suffisent pas à apprendre le traitement d’une note partiellement nouvelle. Recueillir cas limites et désaccords, puis garder les exemples apparentés dans la même partition.
L’article InstructGPT décrit un pipeline de démonstrations, comparaisons humaines, modèle de récompense et optimisation de politique. Ce pipeline documenté ne constitue pas une séquence obligatoire pour tous les modèles ultérieurs.
Les préférences comparent des réponses
Une démonstration demande de produire une réponse ; une paire de préférences indique que A est meilleur que B pour une même entrée. Deux réponses peuvent être exactes mais différer par leur format, ou être toutes deux fausses avec une différence de persuasion.
Dans un pipeline à modèle de récompense, les comparaisons entraînent un évaluateur, puis la politique cherche un score élevé, généralement sous une contrainte limitant l’écart à une politique de référence. DPO ajuste directement la politique sur les réponses préférées et rejetées dans sa formulation avec référence. Il évite alors l’entraînement séparé d’un modèle de récompense et la boucle d’optimisation de politique en ligne ; collecte des préférences et validation restent nécessaires.
Les paires fictives suivantes représentent des intentions d’annotation, pas des résultats mesurés :
Une majorité de paires du premier type peut améliorer le format sans améliorer le raisonnement factuel. Une préférence doit donc correspondre à une règle explicite, pas simplement à « meilleur ».
Voir l’image en grandDe gauche à droite : les démonstrations entraînent la politique SFT, les classements le modèle de récompense, puis ses scores guident PPO. Cette procédure d’InstructGPT intervient après le préentraînement. DPO, présenté plus haut, optimise les préférences autrement.
Ce que signifie une perte plus faible
Si la probabilité du bon token passe de à , sa perte logarithmique passe de à . L’objectif récompense une plus forte probabilité du token observé ; il ne vérifie pas séparément la vérité de la phrase entière.
De même, améliorer la probabilité relative d’une réponse préférée peut apprendre des raccourcis : longueur, ton assuré ou style d’un annotateur. Évaluer séparément factualité, réussite, format et coût lorsque l’usage les exige. Séparer familles de consignes et documents sources entre entraînement et test, comme l’explique la note sur les fuites de données.
Choisir une étape selon le problème
Une mauvaise représentation du vocabulaire spécialisé peut justifier un préentraînement continu. Une entrée comprise mais une sortie mal structurée peut appeler des démonstrations supervisées. Plusieurs réponses valides d’utilité différente peuvent justifier des préférences. Ce sont des hypothèses à comparer à une référence, pas un programme obligatoire d’entraînements coûteux.
Pour connaître le contenu d’un document mis à jour aujourd’hui, modifier les poids remplace mal la recherche d’une preuve actuelle. Pour un petit classifieur qui confond toujours la même catégorie, des étiquettes ciblées peuvent être plus adaptées qu’un grand générateur. Voir le pipeline de recherche et l’apprentissage par transfert.
Un objectif plus étroit peut aussi dégrader des compétences existantes. Évaluer les tâches à conserver et choisir le checkpoint sur la validation. Les mentions base, instruct ou aligned résument une histoire d’entraînement ; elles ne remplacent pas une évaluation de l’usage prévu.