大模型应用与平台系统设计
旧专题 高级 重要度 5/5 知识骨架 理解阶段

大模型应用的端到端系统设计

用一次请求的数据流组织模型网关、RAG、Agent、权限、缓存、可靠性、评测与成本治理。

发布于 2026-08-31

本文目录

    vLLM entrypoints architecture。vLLM 官方入口架构展示离线 API、服务 API 与核心引擎之间的边界。

    图:vLLM 官方入口架构展示离线 API、服务 API 与核心引擎之间的边界。 来源:vLLM entrypoints architecture,作者 vLLM Project contributors,许可 Apache-2.0。

    问题边界

    系统设计题考察需求澄清、组件职责、数据边界和权衡。答案应先锁定用户量、延迟、质量、数据敏感度与错误成本。

    知识全貌

    典型链路包含入口鉴权、模型网关、检索/工具编排、策略与权限、生成、结果校验、日志评测和反馈。离线侧维护数据摄取、索引和回归集。

    核心机制

    概率模型负责非结构化判断,确定性程序负责权限、金额、状态变更和 Schema。模型路由按任务与预算选择执行路径,可靠性层提供超时、重试、熔断和降级。

    公式或数据流

    request -> auth -> policy -> retrieve/tools -> model gateway
            -> validate -> response / approval -> logs -> evaluation

    方法比较

    单模型方案简单但成本与故障域集中;多模型路由提高弹性,却需要统一接口和持续评测。同步调用易理解,长任务需要队列、状态和取消。

    工程约束

    必须明确数据保留、租户隔离、区域、并发、配额、SLO、审计和灾难恢复。Token 单价只是成本的一部分。

    故障模式

    包括重试风暴、缓存越权、索引更新滞后、模型版本漂移、工具副作用重复、日志泄露和降级路径未测试。

    高频问题

    参考资料

    Serving load pattern examples。负载形态图补充静态架构,提醒容量设计必须绑定真实到达过程。

    图:负载形态图补充静态架构,提醒容量设计必须绑定真实到达过程。 来源:Serving load pattern examples,作者 vLLM Project contributors,许可 Apache-2.0。

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签