Pandas
Pandas 是用于读取、筛选、清洗和汇总表格数据的 Python 库,适合处理能放入内存的数据。行和列都有标签,不同列可以分别存放文本、数值或日期。可以按下表查找具体操作,也可以先读 Series 和 DataFrame,了解两种基本数据结构。这里介绍常用操作,完整 API 和内存处理的限制可查阅官方文档。
工作路径
核心准则
- 显式定义元数据:明确标签、数据类型、单位、时区及缺失值处理策略。
- 索引方式分离:基于标签用
.loc,基于位置用.iloc;避免依赖行为模糊的[]索引。 - 直接表达操作:优先使用向量化操作、
agg和transform,再考虑逐行apply。 - 合并校验:验证合并后的基数(cardinality),并检查未匹配的键。
- 定位清晰:将 DataFrame 视为分析过程中的中间对象,而非数据库或分布式计算引擎。
范围与版本
这些笔记面向可装入内存的小型表格,涵盖构造、CSV 读取、选择、清洗、连接、汇总、重塑与时间处理。阅读前需了解 Python 列表、字典、切片和函数;分布式执行及各种存储后端不在范围内。示例用 import pandas as pd,具体操作页提供本地样例数据。复现旧 notebook 时,先检查 pd.__version__。
示例使用 pandas 2.2+ API,明确指定的数据类型与参数也适用于 pandas 3.x。写时复制是 pandas 3.0 唯一模式:修改独立选出的对象不会更新父对象。pandas 2.x 中该行为可选,因此笔记始终明确向目标对象赋值,不依赖视图修改。两个版本中,alias = df 都只是给同一对象再绑定一个名称,不是选择或复制。