跳到主要内容

最近整理了什么

从这里回到最近修订的解释、实用指南与实验说明。随笔按原始发表日期另行排列。

浏览随笔

笔记修订

日期表示笔记修订时间,不代表每一条主张都重新核验过。这里列出的是文章当前版本,不是逐次改动日志。

  1. 智能体记忆与检索

    选择 AI 助手应保留和检索的信息,分清笔记、搜索结果与操作依据。

  2. AI 智能体的工具契约

    定义工具的输入、权限、副作用及失败证据,确保模型与运维人员都能清晰理解。

  3. 数据划分与泄漏

    明确预测时点、实体边界与训练专用 Pipeline,从根源上阻断目标、时间、实体及预处理层面的数据泄漏。

  4. 分布偏移下的模型评估

    从部署分布、切分、指标、阈值和不确定性出发,避免把单一 test score 当作普遍能力。

  5. 数据科学核心术语表

    一套用于讨论数据、建模、评估及复现性的通用术语,剥离特定产品行话。

  6. 激活函数与门控前馈网络

    区分 ReLU、GELU、SiLU/Swish 与 GLU 变体,并用等预算实验选择现代神经网络的非线性。

  7. 注意力变体与 KV 缓存压缩

    解析 MHA、GQA、MLA 架构差异及 SnapKV 等压缩策略,探讨内存、质量与实现复杂度的权衡。

  8. 注意力机制

    从 Q/K/V、mask 和数值例子理解内容寻址、多头注意力、复杂度与解释边界。

  9. 卷积神经网络

    解析 CNN 的归纳偏置、通道、填充、步幅、池化机制,厘清平移等变与平移不变的核心差异。

  10. 线性回归

    线性预测模型、平方误差目标、求解方法,以及决定其系数含义的假设。

  11. 多层感知机

    通过张量形状、反向传播推导及 XOR 实例,解析 MLP 的表达能力、优化陷阱与归纳偏置。

  12. 循环神经网络

    从状态压缩、时间反向传播和 LSTM 门控理解 RNN 的优势、梯度失败与流式边界。