模型网关应承担哪些职责?
定义统一模型接口背后的认证、路由、限流、重试、观测、版本与成本职责。
发布于 2026-08-31
本文目录

图:多个客户端入口通过统一服务层访问推理引擎,可用于界定模型网关职责。 来源:vLLM entrypoints architecture,作者 vLLM Project contributors,许可 Apache-2.0。
考察意图
考察候选人如何把多供应商模型变成可治理的平台能力。
60–90 秒口述答案
模型网关提供统一请求接口和能力声明,负责身份、租户、配额、限流、模型与区域路由、超时、可控重试、熔断和降级;同时标准化 Token、延迟、错误、版本和成本日志。它还管理密钥、数据策略和审计,并通过评测结果决定哪些任务可路由到哪些模型。网关不应吞掉供应商差异:上下文、工具、结构化输出和内容策略要显式建模。流式请求失败和非幂等工具动作也不能按普通 HTTP 请求盲目重试。
深入解释
统一接口应保留原始错误与请求关联 ID。能力注册比“所有模型都支持同一参数”更可靠。
工程权衡
集中治理提高一致性,却会成为关键故障域;需要无状态扩展、配置版本、旁路和区域容灾。
完整复习答案
先从约束反推架构
网关负责认证、配额、路由、协议适配、审计和策略,不应吞掉业务编排或长期状态。
把估算代入真实负载
路由键包括能力、上下文、区域、成本和健康度;重试需防重复计费及有副作用工具的重复执行。
主模型 P95 超时后,网关可根据请求是否幂等决定重试或切备用模型。若请求已触发工具写操作,盲目重试会重复副作用;因此网关只管理模型调用策略,业务事务状态应由编排层持有。
这个估算给出量级。代入项目参数时需要写明忽略项,并保持单位一致。
故障发生时系统怎样退让
围绕“模型网关应承担哪些职责”,单副本承载率取目标长度分布下满足 P99 的安全点,再计入 N+1、滚动发布和启动时间。每个外部依赖明确超时、有限重试、熔断、隔离和降级。
追问参考
流量突增三倍时,先保护什么、牺牲什么?
对“模型网关应承担哪些职责”而言,流量突增时先用 admission control 保护已接收请求和高优先级业务,再按预案减少候选、缩短上下文、切备用模型或异步处理。
如何从 SLO 反推副本数、队列上限和降级阈值?
回到“模型网关应承担哪些职责”,需要区分:从 SLO 压测得到单副本安全承载率,结合峰值、N+1、发布余量和启动时间计算副本;队列上限由最大等待预算反推。
怎样判断方案已经达到上线条件?
“模型网关应承担哪些职责”进入发布方案前,所有依赖都要说明超时、有限重试、熔断、隔离、降级和观测;重试预算必须小于上游截止时间。
常见错误回答
把模型网关等同于反向代理,只谈转发和负载均衡。
连续追问
- 流式请求如何超时和取消?
- 模型路由依据什么?
- 怎样避免重试放大成本?
项目结合
给出一次供应商故障时的路由、降级、告警和用户可见行为,并说明质量回归如何控制。