Aller au contenu principal

Regroupement et réduction de dimension

Le regroupement cherche quelles observations rapprocher selon une similarité choisie. La réduction de dimension cherche une représentation avec moins de coordonnées. Ces opérations peuvent se combiner, mais une figure bien séparée ne donne pas automatiquement des catégories sémantiques correctes.

Regrouper des vecteurs documentaires aide par exemple à explorer des thèmes ; les réduire à deux coordonnées permet de les afficher. Les groupes visibles peuvent refléter la langue, la longueur, le site source ou le thème recherché. Il faut consulter les documents pour le savoir.

La distance fait partie du modèle

Avec une durée en secondes et une note de un à cinq, un écart de 100 secondes peut dominer deux points de note dans la distance euclidienne brute. Standardiser change cette géométrie sans révéler une distance universellement correcte. Choisir l’échelle selon la comparaison visée et estimer ses statistiques sur les données d’ajustement.

Pour deux vecteurs de norme un :

uv22=22uv.\|u-v\|_2^2=2-2u^\top v.

L’ordre des voisins euclidiens coïncide alors avec celui de la similarité cosinus. Sans normalisation, cette équivalence disparaît. Elle ne rend pas non plus tous les regroupements identiques : position et normalisation des centres comptent. Voir embeddings, rerankers et classifieurs.

K-means alterne affectation et moyenne

K-means minimise les distances quadratiques aux KK centres. Une itération affecte chaque point au centre le plus proche, puis remplace chaque centre par la moyenne du groupe. La convergence peut être locale, donc l’initialisation importe.

Pour les données fictives (0,1,9,10)(0,1,9,10) et les centres initiaux 0 et 10, les groupes sont (0,1)(0,1) et (9,10)(9,10). Les centres deviennent 0.50.5 et 9.59.5, avec une somme quadratique de 4×0.52=14\times0.5^2=1. Un seul groupe aurait pour centre 5 et pour somme 25+16+16+25=8225+16+16+25=82. Ajouter des groupes réduit l’objectif sans nécessairement enrichir l’interprétation.

points = [0.0, 1.0, 9.0, 10.0]
centers = [0.0, 10.0]
for _ in range(5):
groups = [[] for _ in centers]
for value in points:
nearest = min(range(len(centers)), key=lambda j: (value - centers[j]) ** 2)
groups[nearest].append(value)
centers = [sum(group) / len(group) if group else old
for group, old in zip(groups, centers)]
assert centers == [0.5, 9.5]
print(centers)

Cet exemple conserve l’ancien centre d’un groupe vide. Une implémentation réelle doit définir sa politique de traitement des groupes vides ; le code illustre seulement l’itération.

K-means préfère des groupes compacts autour de moyennes et demande KK à l’avance. Densités inégales, formes allongées, valeurs aberrantes et mauvaise distance peuvent tromper. DBSCAN relie plutôt des voisinages denses et peut laisser des points comme bruit, mais son échelle de voisinage reste un choix important. Le regroupement hiérarchique produit des fusions imbriquées dont la règle de liaison définit la proximité entre groupes.

Quatre exemples illustrent les difficultés liées au nombre de groupes, à leur allongement, à leurs variances et à leurs tailles.Voir l’image en grand

Les couleurs indiquent les groupes trouvés par K-means. L’allongement, la dispersion et les tailles inégales peuvent conduire le critère de distance à couper les groupes attendus. Les panneaux montrent des cas distincts, pas quatre vues du même jeu de données.

L’ACP conserve la variation, pas les étiquettes

L’analyse en composantes principales (ACP, ou PCA) trouve des directions orthogonales de variation dans les données centrées. Conserver les premières fournit une représentation linéaire réduite et une reconstruction des coordonnées initiales, sans consulter les classes.

Pour (1,1),(2,2),(3,3)(1,1),(2,2),(3,3), la moyenne est (2,2)(2,2) et les points centrés sont (1,1),(0,0),(1,1)(-1,-1),(0,0),(1,1). La direction principale est :

v1=12(1,1).v_1=\frac{1}{\sqrt2}(1,1).

Les projections sont (2,0,2)(-\sqrt2,0,\sqrt2). Multiplier chaque scalaire par v1v_1 puis ajouter la moyenne reconstruit exactement les points. La direction perpendiculaire (1,1)/2(1,-1)/\sqrt2 ne varie pas. Une coordonnée suffit ici parce que les données construites sont alignées.

Imaginons maintenant une forte variation de longueur documentaire et une faible variation distinguant original et doublon. L’ACP peut supprimer la seconde, pourtant déterminante pour la classification. Une forte variance expliquée ne prouve donc pas la conservation de la qualité de la tâche. Comparer le modèle final avec et sans réduction sur les mêmes exemples réservés.

Une figure en deux dimensions reste une vue

Des méthodes non linéaires comme t-SNE privilégient certaines relations de voisinage plutôt que toutes les distances globales. Un grand vide ou un petit groupe apparent peut dépendre des réglages et de l’initialisation. L’aire d’une classe sur la figure n’est pas une estimation de sa fréquence réelle.

Pour explorer, conserver les vecteurs et identifiants originaux, produire la vue, puis inspecter des points au centre et aux frontières des groupes. Vérifier la stabilité face à des changements raisonnables de prétraitement ou d’échantillonnage. Si les couleurs viennent d’étiquettes connues, préciser qu’elles ont été ajoutées pour l’inspection.

Évaluer sans étiquettes

Un score interne comme la silhouette compare distances internes et externes avec la métrique choisie. Il peut favoriser une géométrie sans intérêt pour l’usage. Pour une collection documentaire, vérifier aussi si les lecteurs trouvent mieux les contenus et si des exemples représentatifs expliquent les groupes.

Avec des labels de référence, des mesures d’accord externes comparent les partitions indépendamment de la permutation des numéros de groupes. Un désaccord peut toutefois correspondre à une autre partition utile : langue au lieu de thème. Définir la distinction recherchée avant de juger le résultat.

Pour une prédiction ultérieure, ajuster normalisation et ACP uniquement sur l’entraînement, puis transformer validation et test. Une ACP ajustée avant la séparation apprend déjà la distribution d’évaluation. Pour décrire toute une collection, l’utiliser entière peut être intentionnel ; la figure ne constitue alors pas un test prédictif indépendant.

Une fois des étiquettes fiables obtenues, un classifieur supervisé ou un arbre peut apprendre directement la distinction. Attribuer un numéro à un groupe ne suffit pas à valider une étiquette décisionnelle.

Dans How to Use t-SNE Effectively, faire varier la perplexité et le nombre d’itérations sur les mêmes données. Comparer la taille et l’écart des groupes avant d’interpréter une projection : un îlot visuellement distinct ne correspond pas nécessairement à un groupe stable et séparé dans l’espace initial.

Explorer les liensOuvrir le réseau