量化、KV Cache、并行与推理部署
旧专题 高级 重要度 5/5 知识骨架 理解阶段

大模型推理服务的延迟、吞吐与显存

把 Prefill、Decode、权重、KV Cache 和调度放进同一个容量模型,解释推理优化的真实权衡。

发布于 2026-08-31

本文目录

    Serving load pattern examples。不同请求到达模式会改变批处理机会、排队延迟和设备利用率。

    图:不同请求到达模式会改变批处理机会、排队延迟和设备利用率。 来源:Serving load pattern examples,作者 vLLM Project contributors,许可 Apache-2.0。

    问题边界

    讨论自回归 Transformer 在线服务。离线批处理、训练吞吐和扩散模型使用不同的资源模型。

    知识全貌

    请求先进行计算密集的 Prefill,再进入逐 token Decode。权重、激活、临时工作区与 KV Cache 共同占用设备内存,调度器在并发请求间分配批次。

    核心机制

    KV Cache 避免重复计算历史 token 的 K/V。Continuous Batching 在请求生成过程中动态加入或移除序列。量化减少权重或缓存体积,但引入反量化和误差。

    公式或数据流

    首 token 延迟主要受 Prefill 和排队影响;每 token 延迟主要受 Decode 批次、内存带宽和同步影响。吞吐提升可能增加单请求等待时间。

    方法比较

    张量并行拆单层计算,流水线并行拆层,数据并行复制模型。选择取决于模型是否能放入单卡、互联带宽和请求规模。

    工程约束

    容量测试必须固定模型、精度、上下文、输出长度、并发、硬件和服务参数,同时报告 TTFT、TPOT、吞吐和错误率。

    故障模式

    常见故障包括缓存碎片、长请求拖慢批次、OOM 重试放大流量、量化内核不匹配、跨卡通信瓶颈和超时后计算未取消。

    高频问题

    参考资料

    Distributed serving process architecture。分布式进程图用于把单机调度指标扩展到 TP、DP 与跨进程通信。

    图:分布式进程图用于把单机调度指标扩展到 TP、DP 与跨进程通信。 来源:Distributed serving process architecture,作者 vLLM Project contributors,许可 Apache-2.0。

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签