Disaggregated LLM Serving:从 PD 分离到 Attention 卸载
梳理大模型推理系统的解耦架构演进:从 Continuous Batching 和 Chunked Prefill,到 DistServe 与 Mooncake 的 Prefill-Decoding 分离,再到 MegaScale-Infer 的 Attention-Expert 分离和 Adrenaline 的 Attention 卸载。
该论文是MobiSys 2021的最佳论文。该论文提出了nn-Meter。nn-Meter 是一个模型推理时间预测系统。该系统可高效、准确地预测 DNN 模型在不同边缘设备上的推理延迟,其关键思想是将整个模型划分为内核(kernel),即设备上的执行单元,然后执行内核级预测。