09 · 推理

量化、KV Cache、并行与推理部署

围绕延迟、吞吐、显存和可靠性理解量化、KV Cache、Continuous Batching、并行与模型服务。

1 / 4节点已达到面试就绪

返回总知识地图 →

Learning path

从理解到表达的三阶段路径

节点按学习阶段分栏;具体依赖关系进入节点后查看。

专题 问题
领域说明、结构图与复习边界+

vLLM engine architecture。vLLM 官方引擎图展示请求处理、调度、模型执行与输出链路。

图:vLLM 官方引擎图展示请求处理、调度、模型执行与输出链路。 来源:vLLM engine architecture,作者 vLLM Project contributors,许可 Apache-2.0。

知识范围

覆盖模型权重与运行时内存、KV Cache、量化误差、批处理、PagedAttention、张量/流水线并行和服务级故障处理。

学习路线

先拆解单请求的显存与延迟,再进入并发调度,最后学习多卡拓扑、容量规划和线上观测。

核心问题

  • KV Cache 节省了什么,又增加了什么?
  • INT8/INT4 量化的误差来自哪里?
  • Continuous Batching 如何提高吞吐?

参考资料

Learning flow

先理解,再练习,最后闭卷回答

01

理解知识

概念、机制与方法比较

02

练习迁移

估算、实现、案例与算法

    03

    闭卷提取

    面试问题与复习卡片

    Domain index

    领域知识检索

    正在索引 4 个节点

    LOCAL INDEX

      输入关键词,查找全部技术文章。

        搜索范围:正文、标题、分类和标签