Bases de R
Expressions R, indexation vectorielle, valeurs manquantes, structures de données, contrôle de flux, fonctions et paquets.
Expressions R, indexation vectorielle, valeurs manquantes, structures de données, contrôle de flux, fonctions et paquets.
Un processus d'ingestion défensif pour les fichiers tabulaires et les données externes.
Jointures et concaténations sûres, contrôle de cardinalité et diagnostic des clés sans correspondance.
Analyse, fuseaux horaires, périodes, décalages, rééchantillonnage et fenêtres glissantes dans pandas.
Bloquer les fuites de cible, de groupe, temporelles et de prétraitement en définissant l'instant de prédiction, les entités et des pipelines réservés à l'entraînement.
Catégories ordonnées, vocabulaires finis, discrétisation et choix d'encodage.
Partir de la distribution de déploiement, des splits, des métriques, des seuils et de l’incertitude plutôt que de traiter un score de test comme une capacité universelle.
Un parcours dans les fondements de l’apprentissage automatique, profond et des données, reliant hypothèses, exemples et évaluation.
Motifs vectorisés et composables, avec un guide de choix entre map, apply, agg, transform et pipe.
Des méthodes pratiques pour importer du texte délimité, des feuilles de calcul, du JSON et des données R natives, tout en traitant les problèmes d’analyse courants.
Sélection par étiquette, position et MultiIndex sans ambiguïté sémantique.
Filtrage booléen et prédicats lisibles pour les DataFrames.
Une carte reliant les processus générateurs de données et la provenance aux découpages résistants aux fuites, à l'évaluation sous décalage de distribution et aux sources publiques de référence.
Explorer tailles d’échantillon et distributions avec les exemples Python du site dans Jupyter, puis les réexécuter sans état caché.
Un processus reproductible pour normaliser, analyser, valider et documenter des données tabulaires.
Une référence pratique de NumPy couvrant la création de tableaux, l’indexation, les formes, les opérations vectorisées, l’agrégation et la comparaison de tableaux.
Une carte orientée tâches pour travailler avec des données tabulaires dans pandas.
Une courte carte pour apprendre R par les structures de données, l’importation, la transformation, la visualisation et le travail statistique.
Séparer, appliquer et combiner en décidant explicitement de la forme de sortie et des clés manquantes.
Guide de pivot, pivot_table, melt, stack, unstack et explode.
Un parcours allant des questions et processus générateurs de données aux transformations reproductibles, découpages résistants aux fuites, évaluation sous dérive de distribution et conclusions bornées.
Sélection explicite, opérations vectorisées, mappage et alignement des Series.
La table bidimensionnelle étiquetée et ses invariants fondamentaux.
Le tableau unidimensionnel étiqueté au cœur de pandas.
Une approche guidée par des règles pour détecter, interpréter et traiter les données manquantes.
Un vocabulaire concis pour parler des jeux de données, des choix de modélisation, de l’évaluation et de la reproductibilité sans jargon propre à un produit.