Pandas
Pandas est une bibliothèque Python pour charger, sélectionner, nettoyer et résumer des tables qui tiennent en mémoire. Les lignes et les colonnes portent des étiquettes, et les colonnes peuvent contenir des types différents : texte, nombres ou dates. Utilisez le tableau ci-dessous pour trouver une opération, ou commencez par Series et DataFrame pour comprendre ces objets. Ces notes présentent les opérations courantes ; la documentation officielle détaille l’API complète et les limites du traitement en mémoire.
Parcours de travail
Règles de travail
- Rendez explicites les étiquettes, types, unités, fuseaux horaires et règles sur les valeurs manquantes.
- Utilisez
.locpour les étiquettes et.ilocpour les positions ; ne dépendez pas du comportement ambigu de[]. - Préférez les opérations vectorisées,
aggettransformavant unapplyligne par ligne. - Validez la cardinalité des fusions et examinez les clés sans correspondance.
- Traitez un DataFrame comme un objet analytique intermédiaire, non comme une base de données ou un moteur distribué.
Périmètre et versions
Ces notes couvrent les petites tables en mémoire : construction, lecture CSV, sélection, nettoyage, jointures, résumés, remodelage et temps. Elles supposent les listes, dictionnaires, tranches et fonctions Python, sans traiter l’exécution distribuée ni tous les stockages. Les exemples utilisent import pandas as pd et des données locales sur les pages d’opérations. Vérifiez pd.__version__ pour reproduire un ancien notebook.
Les exemples utilisent les API pandas 2.2+ et conviennent aussi à pandas 3.x avec les types et paramètres précisés. La copie à l’écriture est le seul mode de pandas 3.0 : modifier un objet sélectionné séparément ne modifie pas son parent. Ce comportement est optionnel dans pandas 2.x ; les notes affectent donc explicitement l’objet voulu plutôt que de dépendre d’une mutation de vue. Dans les deux versions, alias = df désigne toujours le même objet : ce n’est ni une sélection ni une copie.