把一次模型请求拆成可测量阶段,解释并发、缓存、批处理与用户等待时间之间的关系。
基于模型格式、硬件适配、延迟吞吐及安全性,选择本地推理引擎的实战指南。
沿着一个 token 的路由过程解释 MoE,区分总参数、激活参数、显存与速度,并分析负载均衡和通信。