AI 与数据基础
机器学习、深度学习与数据基础的阅读路径,连接模型假设、计算示例与实际评估。
机器学习、深度学习与数据基础的阅读路径,连接模型假设、计算示例与实际评估。
针对表格文件与外部数据的防御性读取流程。
掌握 merge 与 concat 的核心逻辑,包括基数校验、未匹配键诊断及时间序列连接。
带标签的二维表格及其核心约束。
掌握 DataFrame 的布尔筛选逻辑与 query 方法。
掌握 pandas 中基于标签、位置及 MultiIndex 的无歧义数据选取方法。
用本站 Python 算例探索样本量和分布变化,并在 Jupyter 中从头重跑计算。
NumPy 实战参考:数组创建、索引切片、向量化运算、聚合及内存视图机制。
Pandas 表格数据处理实战导航。
pandas 的核心一维结构:带标签的数组,支持自动对齐。
掌握 map、apply、agg、transform 和 pipe 的选型指南,写出可组合、高性能的向量化代码。
一套可复现的表格数据清洗流程:从规范化、解析到验证与质量报告。
掌握 pivot、melt、stack 等核心操作,理清长宽表转换逻辑与粒度检查。
涵盖数据结构、数据导入、转换、可视化及统计建模的 R 语言学习地图。
涵盖 CSV、Excel、JSON 及 R 原生格式的导入技巧,附常见解析问题解决方案。
R 语言入门指南,涵盖核心数据结构、控制流、函数定义及常用包管理。
掌握 Series 的显式索引、向量化运算、映射及对齐技巧。
从部署分布、切分、指标、阈值和不确定性出发,避免把单一 test score 当作普遍能力。
处理有序类别、有限取值集合、分箱策略及模型编码的最佳实践。
明确输出形状与缺失键处理策略的 Split-Apply-Combine 实践。
明确预测时点、实体边界与训练专用 Pipeline,从根源上阻断目标、时间、实体及预处理层面的数据泄漏。
从问题、数据生成过程和可复现变换,走到防泄漏划分、分布偏移评估与有限结论。
一套用于讨论数据、建模、评估及复现性的通用术语,剥离特定产品行话。
从数据生成机制与溯源出发,梳理防泄漏切分、分布偏移评估及权威数据源的使用指南。
pandas 中处理日期解析、时区、周期、偏移、重采样及滚动窗口的核心概念。
基于策略的缺失数据检测、解释与处理方案。