Aller au contenu principal

Vocabulaire de travail en science des données

Ces termes décrivent le raisonnement. Les noms d’outils ont leur place dans les guides d’implémentation.

TermeSens pratique
QuestionLa décision, la comparaison, l’estimation ou l’explication que l’analyse doit éclairer.
ObservationUne unité, un événement ou une mesure enregistrés dans un jeu de données.
Variable explicativeUne variable mesurée ou dérivée utilisée comme entrée d’un modèle.
Cible / étiquetteLe résultat qu’un modèle supervisé doit prédire.
PopulationL’ensemble complet des cas que la conclusion vise à décrire.
ÉchantillonLe sous-ensemble observé qui sert à étudier cette population.
SchémaLes noms, types, contraintes et relations qui définissent la structure des données stockées.
ProvenanceL’origine des données, leur mode de collecte ou de transformation et leur responsable.
BaselineUne méthode de référence simple qu’une analyse plus complexe devrait dépasser.
MétriqueUne règle explicite pour mesurer l’erreur, l’utilité, l’ajustement ou une autre propriété d’intérêt.
Jeu d’entraînementLes données utilisées pour estimer les paramètres du modèle.
Jeu de validationLes données utilisées pendant le développement pour comparer des choix sans ajuster le modèle sur le jeu de test final.
Jeu de testLes données mises de côté pour estimer finalement la généralisation dans le cadre d’évaluation choisi.
Fuite de donnéesUne information atteint l’entraînement ou la construction des variables alors qu’elle ne serait pas légitimement disponible à l’usage du modèle.
Facteur de confusionUne variable liée à la fois à une variable explicative et au résultat, susceptible de fausser une interprétation causale.
CalibrationL’accord entre probabilités prédites et fréquences observées dans un cadre d’évaluation donné.
ReproductibilitéUne autre exécution peut retrouver l’analyse à partir des données, du code, de l’environnement, des paramètres et des étapes consignés.

Perte, objectif et métrique désignent des rôles, pas nécessairement des formules différentes. Une perte évalue une prédiction ; l’objectif d’entraînement agrège les pertes et peut ajouter une pénalité ; une métrique résume une propriété pour une population et un découpage donnés. Un classifieur peut ainsi minimiser la perte logarithmique, mais être évalué par le rappel à capacité d’examen fixée. Les paramètres sont ajustés dans l’entraînement ; les hyperparamètres contrôlent cette procédure et sont choisis par validation. Voir les concepts généraux de l’apprentissage automatique pour des exemples.

Mots à qualifier

  • Moyenne : nommez la statistique — moyenne arithmétique, médiane, moyenne pondérée ou autre.
  • Exactitude : précisez la métrique et la distribution des classes ; l’exactitude seule peut masquer des erreurs importantes.
  • Représentatif : indiquez la population et le mécanisme d’échantillonnage qui justifient cette affirmation.
  • Significatif : distinguez les preuves statistiques de l’importance pratique.
  • Corrélation : ne transformez pas implicitement une association en conclusion causale.

Une phrase précise vaut mieux qu’un glossaire plus volumineux. Si un terme ne change ni la manière de travailler ni l’interprétation, il n’a probablement pas besoin d’une définition canonique.

Explorer les liensOuvrir le réseau