Science des données
La science des données est une chaîne de preuves allant d'une question et d'observations jusqu'à une action. Un modèle peut optimiser un nombre ; il ne peut pas décider à lui seul qui un échantillon représente, comment les étiquettes ont été produites ou ce que coûtent les erreurs.
Parcours de travail
- Définir la question et l'action : quelle décision, estimation ou explication le résultat soutiendra-t-il ?
- Cartographier le processus générateur de données : qui est observé, quand, qu'est-ce qui manque, et comment les étiquettes émergent-elles ?
- Examiner le jeu de données : enregistrer la provenance, l'unité, la licence, la sensibilité, la version et les transformations dans la carte des jeux de données.
- Choisir le découpage avant la modélisation : le moment de prédiction, les entités et le déploiement déterminent des découpages aléatoires, par groupe, temporels ou externes ; voir Découpages des données et fuites d'information.
- Construire une référence simple : des constantes, des règles, des modèles linéaires ou la pratique actuelle établissent la valeur incrémentale.
- Entraîner et sélectionner : ajuster chaque étape de prétraitement apprise sur les plis d'entraînement ; la validation sélectionne, le test reste en dehors de cette boucle.
- Évaluer l'usage, pas un classement : inclure les seuils, les coûts, la calibration, les sous-groupes et l'incertitude ; voir Évaluation sous dérive de distribution.
- Communiquer des conclusions bornées : rapporter les échecs, les exclusions, les limites des données et les conditions qui ne permettent pas l'extrapolation.
- Surveiller après le déploiement : les entrées, les étiquettes retardées, les retours d'information et les processus humains modifient la distribution.
L'exploration et la confirmation ne peuvent utiliser les mêmes données qu'avec une comptabilisation explicite. Dès lors que les résultats de test influencent les caractéristiques, les seuils ou les exclusions, le test est devenu une information de développement ; il faut alors obtenir de nouvelles données, imbriquer l'évaluation ou qualifier le résultat d'exploratoire.
Lignes de lecture
question.md question, prediction time, action, and loss
provenance.yaml source, version, license, unit, and transformations
split.py executable, tested partition rule
pipeline.* train-only preprocessing and model
results/ every run, seed, metric, slice, and failure
report.md conclusion, interval, limitation, and monitoring
Ce parcours privilégie les tâches supervisées tabulaires, les métriques calculables et les expériences reproductibles. L'identification causale, la recherche qualitative, la conception participative, la vie privée, la gouvernance et les rapports de force ne peuvent être réduits à une métrique supplémentaire. Une donnée publique, officielle ou volumineuse n'est pas automatiquement valide ou équitable.
Berkeley Data 100 propose un cours associant calcul et statistiques. Les Datasheets et Model Cards aident à documenter les limites des données et des modèles ; elles ne remplacent pas l’examen par le domaine concerné.