跳到主要内容

本地部署与推理

本地推理首先是资源与运行服务的问题。权重能装进内存,不代表长上下文、多个请求和目标延迟也同时满足。

先估单卡资源预算,再选择兼容的运行时。量化解释存储和计算中的数值如何变化;KV Cache 解释随序列增长的内存。推理性能文章沿着加载、预填充和逐步生成跟踪一个请求。

阅读顺序

顺序文章解决的问题
1单卡部署:权重、显存与上下文预算基于显存预算,判断本地模型能否在单张消费级 GPU 上稳定运行并保持实用性能。
2本地推理运行时选型基于模型格式、硬件适配、延迟吞吐及安全性,选择本地推理引擎的实战指南。
3模型量化:精度、体积与速度理解低比特如何近似权重,区分权重、激活和 KV 缓存量化,并估算真实部署成本。
4注意力变体与 KV 缓存压缩解析 MHA、GQA、MLA 架构差异及 SnapKV 等压缩策略,探讨内存、质量与实现复杂度的权衡。
5推理性能:加载、首字延迟、解码与吞吐把一次模型请求拆成可测量阶段,解释并发、缓存、批处理与用户等待时间之间的关系。

怎样把这些内容用起来

记录模型版本、精度、上下文、并发与硬件,用评测协议同时比较任务质量和冷启动/预热后的性能。一次改变多个设置,会很难知道收益来自哪里。

需要接着学习其他环节时,回到AI 阅读路径选择相邻主题。

探索关联打开关联网络