大模型应用与平台系统设计
面试问题 高级 重要度 5/5 知识骨架 提取阶段

怎样平衡大模型系统的质量、成本与可靠性?

用任务分级、模型路由、缓存、预算、SLO 与降级路径共同管理质量、成本和可靠性。

发布于 2026-08-31

当前显示参考答案
本文目录

    Serving load pattern examples。真实流量形态决定批处理收益、延迟尾部和容量成本。

    图:真实流量形态决定批处理收益、延迟尾部和容量成本。 来源:Serving load pattern examples,作者 vLLM Project contributors,许可 Apache-2.0。

    考察意图

    检查候选人能否把三个目标变成可测约束,而不是泛泛说“做权衡”。

    60–90 秒口述答案

    我先按任务定义最低质量、延迟 SLO、错误成本和单次预算,再选择方案。简单分类和抽取走小模型或规则,复杂推理才升级;缓存稳定前缀与可复用结果,控制上下文和 Agent 步数。可靠性用限流、超时、熔断、降级和人工兜底,重试必须考虑成本与幂等。每条路由都用同一业务评测集验证,并在线监控成功率、P95/P99、Token、工具调用和单位成功任务成本。目标是在质量门内最小化成本,不是始终调用最强模型。

    深入解释

    单位请求成本会掩盖重试和多步失败,应计算单位成功任务成本。降级也必须有质量定义。

    工程权衡

    激进缓存可能陈旧或越权;更长上下文提高信息覆盖也增加延迟;多模型路由降低成本却增加评测和运维复杂度。

    完整复习答案

    先从约束反推架构

    成本拆成输入、输出、缓存、检索、重排、工具、GPU 空闲与失败重试;按成功任务而非单请求核算。

    把估算代入真实负载

    降级顺序应预先设计:缩短上下文、减少候选、切小模型、关闭非关键工具或转异步,并监控质量护栏。

    把一次成功问答拆成输入 token、输出 token、检索、重排、缓存未命中和失败重试成本。小模型便宜 60% 但使一次解决率下降并增加重试时,按请求计费的优势可能在“每个成功任务成本”上消失。

    这个估算给出量级。代入项目参数时需要写明忽略项,并保持单位一致。

    故障发生时系统怎样退让

    围绕“怎样平衡大模型系统的质量、成本与可靠性”,单副本承载率取目标长度分布下满足 P99 的安全点,再计入 N+1、滚动发布和启动时间。每个外部依赖明确超时、有限重试、熔断、隔离和降级。

    追问参考

    流量突增三倍时,先保护什么、牺牲什么?

    对“怎样平衡大模型系统的质量、成本与可靠性”而言,流量突增时先用 admission control 保护已接收请求和高优先级业务,再按预案减少候选、缩短上下文、切备用模型或异步处理。

    如何从 SLO 反推副本数、队列上限和降级阈值?

    回到“怎样平衡大模型系统的质量、成本与可靠性”,需要区分:从 SLO 压测得到单副本安全承载率,结合峰值、N+1、发布余量和启动时间计算副本;队列上限由最大等待预算反推。

    怎样判断方案已经达到上线条件?

    “怎样平衡大模型系统的质量、成本与可靠性”进入发布方案前,所有依赖都要说明超时、有限重试、熔断、隔离、降级和观测;重试预算必须小于上游截止时间。

    常见错误回答

    只比较 Token 单价,忽略检索、重排、工具、重试、存储、人工复核和失败成本。

    连续追问

    • 路由器本身怎样评测?
    • 缓存键应包含哪些权限信息?
    • 降级到小模型时如何提示用户?

    项目结合

    准备一个质量门和成本表,说明某项优化如何改变单位成功任务成本及尾延迟。

    来源与关联知识

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签