量化、KV Cache、并行与推理部署
面试问题 高级 重要度 4/5 知识骨架 提取阶段

INT8 与 INT4 量化如何影响推理?

从数值映射、粒度、异常值和内核支持解释低比特权重的收益与精度风险。

发布于 2026-08-31 · 更新于 2026-09-07

当前显示参考答案
本文目录

    Neural network compression techniques。神经网络压缩方法谱系中量化与剪枝、蒸馏的关系。

    图:神经网络压缩方法谱系中量化与剪枝、蒸馏的关系。 来源:Neural network compression techniques,作者 J6ancmvs,许可 CC BY-SA 4.0。

    考察意图

    确认候选人理解低比特表示、校准、内核和实际性能之间的关系。

    60–90 秒口述答案

    量化用更低位宽的整数或浮点格式近似权重、激活或 KV Cache。INT8 通常误差较小,INT4 进一步降低权重内存和带宽,但对分组、Scale、Zero Point、异常值和校准数据更敏感。理论体积下降不会自动等比例变成吞吐提升:实际还取决于硬件是否有匹配内核、反量化开销、计算瓶颈和批次。必须在目标模型、硬件、上下文与任务集上同时测质量、峰值显存、TTFT、TPOT 和吞吐。

    深入解释

    Per-channel 或 group-wise 量化用更多 Scale 换取局部动态范围。Weight-only 量化与 W8A8 的执行路径和约束不同。

    工程权衡

    低比特提升部署密度,但模型准备、校准与兼容矩阵更复杂。部分算子可能回退到高精度,形成性能断点。

    完整复习答案

    先拆开一次请求

    说明 per-tensor/per-channel/per-group、对称/非对称、weight-only 与 W8A8 的尺度和零点。

    用数量级定位瓶颈

    精度不是唯一指标:反量化 kernel、校准分布、离群值、KV Cache 与硬件支持决定真实收益。

    一组权重用 INT4 表示时,每组还需保存 scale,某些方案还需 zero-point。group size 越小通常拟合局部分布更好,但元数据和反量化开销更大。真实比较应同时报告模型文件、常驻显存、峰值显存、tokens/s 和任务精度。

    这个估算给出量级。代入项目参数时需要写明忽略项,并保持单位一致。

    压测应回答什么

    围绕“INT8 与 INT4 量化如何影响推理”,压测写明模型、dtype、并行度、硬件、输入输出长度分布和到达方式,同时报告 TTFT、TPOT、端到端尾延迟、tokens/s 与显存水位。容量取满足 SLO 的安全点。

    追问参考

    吞吐提升但 P99 变差,调度器可能做了什么?

    对“INT8 与 INT4 量化如何影响推理”而言,吞吐提高而 P99 变差通常来自更大批次、更长等待窗口或 Prefill 抢占 Decode;查看 queue time、batch token 数和每阶段时间即可区分。

    OOM 是权重、激活、临时 workspace 还是 KV Cache 导致?

    回到“INT8 与 INT4 量化如何影响推理”,需要区分:OOM 要按权重、KV、激活、workspace 与碎片拆账,并用输入/输出长度、并发和块水位复现,不能只归因于“模型太大”。

    怎样判断方案已经达到上线条件?

    “INT8 与 INT4 量化如何影响推理”进入发布方案前,性能结论需绑定硬件、dtype、模型、并行度、长度分布、并发模型和 SLO;离线峰值不能直接当线上容量。

    常见错误回答

    把磁盘文件缩小当作运行显存和速度结论,或断言 INT4 一定比 INT8 快两倍。

    连续追问

    • 对称与非对称量化有何差别?
    • GPTQ、AWQ 各自优化什么?
    • KV Cache 量化为何需要单独评测?

    项目结合

    展示同一请求协议下的质量、显存和延迟表,并记录量化内核与框架版本。

    来源与关联知识

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签