学术 / AI 技术 更新于 2026年7月24日 31 分钟阅读

商业化大模型的技术栈分层

沿着一次模型请求的执行路径,拆解基础设施、数据、模型、训练、推理、编排、平台与治理。

BigDog 技术札记
文章目录

一次模型请求看起来只有输入和输出,实际会经过认证、限流、路由、推理、检索、工具执行、内容检查和计费等多个环节。训练阶段还需要数据管道、分布式计算、检查点和模型评测。任何一层出现问题,都可能表现为回答错误、延迟升高、成本失控或数据越权。

把这些环节分层,可以明确每项技术解决什么问题,也能避免把模型能力、平台能力和应用能力混为一谈。

一次请求经过哪些层

成熟的大模型服务通常包含八层,治理与安全贯穿所有层次。

层次核心组件主要输出
基础设施GPU/TPU/NPU、网络、存储、调度、容错可用的训练与推理算力
数据预训练数据、指令数据、偏好数据、合成数据、企业数据可追踪、可治理的数据集
模型Dense Transformer、MoE、多模态、Embedding、Reranker具有特定能力边界的模型权重
训练与对齐预训练、持续预训练、SFT、偏好优化、强化学习可部署的模型版本
推理服务Serving Engine、KV Cache、批处理、量化、路由满足延迟和吞吐要求的模型接口
编排结构化输出、RAG、工具调用、Workflow、Agent、MCP可执行的多步任务流程
平台API、SDK、评测、监控、权限、计费可供团队和企业管理的服务
应用Chatbot、Copilot、搜索、客服、代码助手、行业系统面向用户的任务结果

治理与安全处理身份、权限、隐私、内容安全、审计和合规。它不能被放在最后补充,因为数据进入系统、模型调用工具和结果写回业务系统时都会产生风险。

一条典型的在线请求路径如下:

用户请求
  → 身份认证与配额检查
  → 任务识别与模型路由
  → 检索或工具准备
  → 模型推理
  → 工具执行与结果回传
  → 输出校验与安全检查
  → 日志、计费和响应

技术演进改变了系统瓶颈

Transformer 提供了可扩展的模型架构

Transformer 使用自注意力处理序列,训练时可以并行计算不同位置。2017 年之后,BERT、GPT、T5 等预训练模型验证了“先学习通用表示,再适配下游任务”的路线。

商业生成式模型主要采用 Decoder-only 架构。它可以把问答、摘要、代码、JSON 和工具参数统一为条件生成问题,接口相对一致,适合通过规模化训练扩展能力。

规模扩展把数据和计算变成共同约束

模型性能随参数量、数据量和计算量增加而改善,但三者不能独立扩张。Scaling Law 描述了规模与损失之间的经验关系,Chinchilla 进一步说明,在固定计算预算下,参数量和训练 Token 数需要保持更合理的配比。

这意味着训练系统的核心问题不是单纯堆叠参数,而是分配有限的计算预算:

  • 数据是否足够多且重复率可控;
  • 高质量数据和低质量数据如何配比;
  • 模型容量是否与训练 Token 匹配;
  • 训练任务能否稳定跨越数千张加速卡;
  • 检查点、故障恢复和实验追踪是否可靠。

对齐训练把基础模型转成可交互产品

预训练目标是预测 Token,它不会自然产生稳定的指令遵循。SFT 使用人工或合成的指令样本训练模型按照任务格式回答;RLHF、RLAIF、DPO 等方法利用偏好数据调整模型行为;推理强化学习则更多使用数学、代码和规则验证器提供可检查的奖励。

对齐改变的是输出分布,不会消除模型错误。偏好数据可能引入风格偏置,奖励模型可能被利用,安全训练也可能降低某些正常任务的召回率。部署前需要按业务样本测量这些取舍。

推理服务成为持续成本中心

训练是阶段性投入,在线推理会随请求量持续消耗算力。长上下文、多轮对话和 Agent 循环会增加 KV Cache、生成 Token 和工具调用次数。

FlashAttention、PagedAttention、连续批处理、量化和推测解码等技术,分别优化内存访问、缓存管理、并发调度、计算精度和生成过程。它们决定同一组模型权重能以多大吞吐、多少显存和什么延迟提供服务。

工具调用扩大了模型系统的责任边界

RAG 让模型使用参数之外的文档,Function Calling 让模型生成结构化工具请求,Agent 则把检索、推理和执行组织为多步循环。系统开始读取企业数据并修改外部状态,权限、审计和错误恢复随之成为核心问题。

模型本身并不执行工具。它输出工具名称和参数,宿主程序负责验证、执行并把结果返回给模型。这个边界决定了生产系统能否阻止越权和错误操作。

基础设施层:提供稳定算力

计算与网络

大模型训练和推理依赖 GPU、TPU、NPU 等加速器。单卡显存通常无法容纳完整训练状态,因此需要组合多种并行策略:

  • 数据并行:不同设备处理不同样本,再同步梯度;
  • 张量并行:把单层矩阵计算拆到多张卡;
  • 流水线并行:把不同层放在不同设备;
  • 专家并行:将 MoE 专家分布到不同设备;
  • 序列并行:拆分长序列相关计算。

并行规模增大后,互联带宽、网络拓扑和通信库会直接影响有效利用率。设备数量增加不代表训练速度线性增长,通信、负载不均和故障恢复会消耗部分算力。

存储与数据管道

训练集可能包含数十亿到数万亿 Token。数据系统需要完成抓取、许可检查、解析、去重、质量过滤、隐私处理、切分、混合和版本管理。

训练过程还会持续写入检查点、优化器状态和实验日志。检查点写入过慢会中断训练,保存间隔过长则会在故障后损失大量计算。对象存储、并行文件系统和本地高速缓存通常需要协同工作。

调度与容错

大规模任务运行数天或数周,硬件故障和网络抖动无法完全避免。调度系统需要处理资源分配、节点健康检查、任务重启和容量隔离。

在线推理面对的是另一类负载:请求长度和到达时间不规则,峰值流量明显。系统需要在吞吐、尾延迟和资源利用率之间取舍,并防止某类长请求占满服务。

数据层:决定模型学习什么

预训练数据

预训练语料通常来自网页、书籍、论文、代码、问答和多语言内容。数据处理需要同时考虑:

  • 内容质量与领域覆盖;
  • 重复样本和模板化页面;
  • 版权、许可和隐私信息;
  • 语言与主题分布;
  • 评测集污染;
  • 有害内容和攻击样本。

数据配比会改变模型能力。增加代码和数学数据可能提升相关任务表现,也会挤占其他领域的训练预算。所谓“数据质量”必须落到过滤规则、采样权重和评测结果上。

指令与偏好数据

指令数据描述“用户提出任务,模型应如何回答”。偏好数据则比较多个候选回答,用于训练奖励模型或直接进行偏好优化。

这两类数据规模通常小于预训练语料,但对产品行为影响很大。标注规范不一致会让模型输出摇摆;只奖励语言流畅度,可能得到措辞完整但事实错误的回答;过度依赖合成数据,则需要防止错误模式被重复放大。

企业数据

企业数据通常不进入基础模型训练,而是在持续预训练、微调或 RAG 阶段使用。选择哪条路线取决于目标:

  • 需要补充频繁变化的事实,优先使用 RAG;
  • 需要学习固定输出格式或任务行为,可以采用 SFT;
  • 需要补充领域语言分布,才考虑持续预训练;
  • 需要严格的数据隔离,应部署在满足边界要求的环境中。

文档进入知识库后仍需保留来源、版本、删除状态和访问权限。否则检索层可能提供过期内容,或把受限文档交给无权访问的用户。

模型层:提供不同能力组件

Dense Transformer 与 MoE

Dense 模型在每个 Token 上激活全部参数,执行路径规则,部署相对直接。MoE 模型通过路由器为每个 Token 选择少量专家,可以扩大总参数容量而不按相同比例增加计算量。

MoE 的代价是训练和推理更复杂:

  • 路由需要保持专家负载均衡;
  • 专家并行增加跨设备通信;
  • 批量较小时可能难以充分利用硬件;
  • 模型权重更大,对存储和加载提出更高要求。

“总参数更多、激活参数更少”描述的是计算结构,不代表实际服务一定更便宜。成本仍取决于硬件拓扑、批量、实现和流量形态。

推理模型

推理模型会为数学、代码、规划等任务分配更多测试时计算。训练常结合可验证任务、强化学习和工具反馈。服务时可以通过推理强度、Token 预算或模型路由控制成本。

更长的推理过程不会自动保证正确。模型可能沿错误前提继续展开,也可能消耗大量 Token 得到与轻量模型相同的结果。适用场景应由任务难度、可验证性和错误成本决定。

多模态模型

多模态系统需要把图像、音频、视频或其他输入映射到模型能够处理的表示。常见方案包括独立编码器加投影层、跨模态注意力以及更统一的 Token 化方式。

系统评测需要区分识别和推理。例如,模型可能正确读取图表中的数字,却在后续计算中出错;也可能因为图片缩放或文档解析丢失关键信息。输入预处理和结果校验与模型本身同样重要。

Embedding 与 Reranker

Embedding 模型把文本或多模态内容映射到向量空间,用于相似度检索、聚类和去重。Reranker 对候选结果进行更精细的相关性排序。

RAG 的效果经常受这两类模型影响。生成模型无法补回检索阶段没有召回的证据,也无法可靠识别所有看似相关但实际冲突的材料。

小模型与专用模型

分类、抽取、路由和固定格式生成不一定需要旗舰模型。小模型延迟更低,也更容易私有部署。通过蒸馏、量化和领域微调,可以在窄任务上获得较好的成本效果。

模型族的意义在于按任务分配资源,而不是让一个模型处理全部请求。

训练与对齐层:形成可部署版本

一个常见训练流程包含以下阶段:

数据准备
  → 预训练或持续预训练
  → 指令微调
  → 偏好优化或强化学习
  → 安全测试
  → 离线评测
  → 灰度部署

预训练与持续预训练

预训练让模型学习语言、知识和任务模式。持续预训练在已有模型上补充特定领域或新数据,可以改变模型的知识分布,但也可能造成遗忘和能力偏移。

训练过程需要记录数据版本、代码版本、超参数和检查点。缺少这些信息时,模型表现变化很难被复现。

SFT 与偏好优化

SFT 直接学习目标回答,适合训练指令格式、工具调用样例和领域任务。RLHF 先训练奖励模型,再用强化学习优化策略;DPO 等方法直接利用偏好对简化训练流程。

这些方法优化的是给定数据和目标函数。标注者偏好、奖励设计和样本覆盖都会进入模型行为,因此必须使用独立评测集检查副作用。

推理强化与可验证奖励

数学答案、代码测试和规则约束可以由程序验证,适合给强化学习提供相对明确的奖励。开放式写作、政策判断和事实解释缺少同等可靠的验证器,仍需要人工评测或更复杂的判定系统。

可验证奖励提高了某些推理能力,也可能让模型针对验证器投机。训练指标和真实任务之间必须保持隔离。

推理服务层:控制延迟、吞吐与成本

Prefill、Decode 与 KV Cache

自回归生成分为两个主要阶段:

  • Prefill 处理全部输入 Token,计算量较大且并行度较高;
  • Decode 每次生成一个或少量 Token,更受内存带宽和缓存访问影响。

注意力层会保存历史 Token 的 Key 和 Value,避免生成每个新 Token 时重复计算,这就是 KV Cache。上下文越长、并发越高,缓存占用越大。

PagedAttention 使用分页思想管理 KV Cache,减少连续显存分配造成的碎片。Prefix Cache 则复用相同系统提示或共享前缀的计算结果。它们优化的是服务效率,不改变模型权重。

批处理与调度

静态批处理等待一组请求同时完成,容易被最长请求拖慢。连续批处理会在生成过程中动态加入和移除请求,提高设备利用率。

调度器还需要处理:

  • 不同上下文长度;
  • 流式输出;
  • 请求优先级;
  • 最大 Token 限制;
  • 超时和取消;
  • 多租户资源隔离。

平均延迟不能代表用户体验,生产监控通常还要观察 P95、P99 和首 Token 延迟。

量化与推测解码

量化用更低精度表示权重、激活或 KV Cache,降低显存和计算成本。不同量化方法会对模型质量、吞吐和硬件兼容性产生不同影响,需要在目标任务上验证。

推测解码让较小模型先生成候选 Token,再由目标模型并行验证。如果候选接受率较高,就能减少目标模型的串行解码步骤。它的收益取决于草稿模型速度、接受率和实现开销。

模型路由

路由器根据任务类型、预算、延迟和风险选择模型。简单抽取可以交给小模型,复杂代码修改使用更强模型,高风险操作则增加验证或人工审批。

路由本身也是一个需要评测的组件。误判任务难度会降低质量,过度路由到旗舰模型则无法节约成本。

编排层:连接知识和工具

结构化输出

自由文本适合阅读,不适合直接驱动程序。结构化输出要求结果满足 JSON Schema 或其他格式约束,便于下游解析。

Schema 约束只保证结构,不保证字段事实正确。应用仍需执行类型检查、业务规则和权限检查。

RAG

一个完整的 RAG 链路通常包含:

文档解析
  → 切分与元数据处理
  → Embedding 与索引
  → 查询改写
  → 召回
  → Rerank
  → 上下文组装
  → 生成与引用

常见失败包括文档解析丢失、切分破坏语义、查询没有召回正确材料、权限过滤错误、上下文冲突和引用与结论不一致。只优化生成 Prompt 无法解决这些问题。

Function Calling 与工具执行

工具定义包含名称、说明和参数 Schema。模型根据上下文生成调用请求,宿主应用再决定是否执行。

安全的工具链需要:

  • 对参数做独立校验;
  • 根据当前用户检查权限;
  • 为写操作设置幂等键;
  • 限制网络、文件和数据库访问范围;
  • 对高风险动作要求人工确认;
  • 记录调用参数、结果和错误。

工具说明越清晰,模型越容易选择正确工具;权限边界则必须由程序实施,不能依赖提示词。

Workflow 与 Agent

Workflow 预先定义步骤和分支,适合流程稳定、风险较高的任务。Agent 允许模型动态决定下一步,适合路径难以提前穷举的探索性任务。

两者可以组合:外层 Workflow 控制状态和权限,局部步骤由 Agent 选择检索或工具。生产系统通常还需要限制最大迭代次数、Token 预算、执行时间和可用工具。

Agent 的关键指标不是生成文本质量,而是最终任务完成率、错误恢复能力、操作成本和风险事件。

Memory 与上下文管理

会话历史、用户偏好和任务状态不是同一种数据。全部塞入上下文会提高成本,也可能引入过期或不相关信息。

上下文管理需要决定:

  • 哪些信息保留原文;
  • 哪些历史压缩为摘要;
  • 哪些事实写入结构化存储;
  • 哪些数据只在当前任务有效;
  • 用户如何查看和删除长期记忆。

Memory 是数据系统,不应被理解为模型自然拥有的长期记忆。

MCP

MCP 使用客户端和服务器架构暴露工具、资源和提示模板,数据层基于 JSON-RPC,常见传输包括 Stdio 和 Streamable HTTP。它让不同 AI 应用以相对统一的方式发现并调用外部能力。

协议解决接口复用,宿主应用仍需处理认证、授权、用户确认、日志和不可信返回值。远程 MCP Server 还要面对普通网络服务具有的攻击面。

平台层:把能力变成可管理的服务

API、SDK 与版本

平台需要提供稳定的请求格式、流式响应、错误码、重试语义和版本策略。模型名称变化、默认参数调整和弃用计划都会影响调用方。

SDK 可以简化认证和流式处理,但不能替代接口契约。关键应用应记录实际模型版本和请求 ID,便于回溯问题。

评测与可观测性

大模型可观测性至少覆盖:

  • 请求量、Token、延迟和错误率;
  • 模型、Prompt、工具和知识库版本;
  • 检索结果与引用来源;
  • 工具调用轨迹;
  • 用户反馈和人工复核结果;
  • 单次任务及用户维度的成本。

日志不能无限保存原始输入输出。敏感数据应脱敏,并根据用途设置访问权限和保留期限。

评测要同时包含离线固定集和线上真实样本。离线集用于回归,线上数据用于发现分布变化和未覆盖的失败模式。

权限、计费与配额

平台需要识别组织、项目、用户和服务账号,并把它们映射到模型、数据源和工具权限。配额和限流用于控制成本,也防止单个租户耗尽共享资源。

计费可以按 Token、请求、实例、存储和附加服务计算。对 Agent 应用,还需要统计完整任务中的多次模型调用、检索和工具费用。

Guardrails

Guardrails 可以检查输入输出、敏感信息和禁止主题,也可以对特定工具设置策略。它是风险控制的一部分,不能代替访问控制和业务校验。

Prompt Injection 的危险在于不可信内容可能影响模型决策。处理外部网页、邮件和文档时,应隔离数据与指令,并限制模型能够调用的工具和参数范围。

应用层:以任务结果验收

Chatbot、Copilot、AI 搜索、客服和行业 Agent 使用相同的底层组件,但交互和验收标准不同:

应用关键技术主要验收指标
企业问答RAG、权限过滤、引用证据召回、回答正确率、越权率
代码助手仓库检索、工具调用、测试补丁通过率、回归率、任务完成时间
客服意图识别、知识库、工单工具一次解决率、转人工率、错误操作率
数据分析Schema、查询工具、计算执行查询正确率、数值准确率、可追溯性
内容处理多模态解析、抽取、生成字段准确率、人工修改量、处理成本

应用层必须定义失败时怎么处理。没有证据时拒绝回答、工具超时时转人工、写操作前要求确认,都是产品逻辑,不是模型参数。

层间依赖决定最终表现

用户看到的错误通常由多层共同造成:

表现可能原因
回答引用了错误文档查询改写、召回、Rerank、权限元数据或生成阶段出错
首 Token 很慢排队、模型加载、Prefill、跨区域网络或工具预处理耗时
Agent 反复调用同一工具工具描述不清、状态没有更新、停止条件缺失或模型能力不足
结构正确但业务数据错误Schema 只约束格式,缺少事实核验和业务规则
更换模型后成本激增输出变长、缓存失效、路由变化或工具循环增加
用户看到了无权访问的信息检索权限过滤、缓存隔离或日志访问控制失效

排查时应沿请求轨迹定位故障层,而不是把所有问题归因于“模型幻觉”。

结论

商业化大模型的完整链路可以概括为:

基础设施
  → 数据
  → 模型
  → 训练与对齐
  → 推理服务
  → 编排
  → 平台
  → 应用

模型决定能力边界,数据决定它学到什么,训练与对齐塑造行为,推理系统控制性能和成本,编排层连接知识与工具,平台层提供治理能力,应用层以真实任务验收结果。

选择模型或设计系统时,先确定任务的质量、延迟、成本和风险约束,再决定每一层需要什么组件。技术栈的目标不是堆齐名词,而是让一条请求在明确边界内稳定完成。

参考资料

输入关键词,查找全部技术文章。

    支持搜索正文、标题、分类和标签,匹配内容会在结果中标出