最近整理了什么
从这里回到最近修订的解释、实用指南与实验说明。随笔按原始发表日期另行排列。
浏览随笔笔记修订
日期表示笔记修订时间,不代表每一条主张都重新核验过。这里列出的是文章当前版本,不是逐次改动日志。
智能体记忆与检索
选择 AI 助手应保留和检索的信息,分清笔记、搜索结果与操作依据。
AI 智能体的工具契约
定义工具的输入、权限、副作用及失败证据,确保模型与运维人员都能清晰理解。
数据划分与泄漏
明确预测时点、实体边界与训练专用 Pipeline,从根源上阻断目标、时间、实体及预处理层面的数据泄漏。
分布偏移下的模型评估
从部署分布、切分、指标、阈值和不确定性出发,避免把单一 test score 当作普遍能力。
数据科学核心术语表
一套用于讨论数据、建模、评估及复现性的通用术语,剥离特定产品行话。
激活函数与门控前馈网络
区分 ReLU、GELU、SiLU/Swish 与 GLU 变体,并用等预算实验选择现代神经网络的非线性。
注意力变体与 KV 缓存压缩
解析 MHA、GQA、MLA 架构差异及 SnapKV 等压缩策略,探讨内存、质量与实现复杂度的权衡。
注意力机制
从 Q/K/V、mask 和数值例子理解内容寻址、多头注意力、复杂度与解释边界。
卷积神经网络
解析 CNN 的归纳偏置、通道、填充、步幅、池化机制,厘清平移等变与平移不变的核心差异。
线性回归
线性预测模型、平方误差目标、求解方法,以及决定其系数含义的假设。
多层感知机
通过张量形状、反向传播推导及 XOR 实例,解析 MLP 的表达能力、优化陷阱与归纳偏置。
循环神经网络
从状态压缩、时间反向传播和 LSTM 门控理解 RNN 的优势、梯度失败与流式边界。