评测、幻觉、安全与可观测性
旧专题 高级 重要度 5/5 知识骨架 理解阶段

大模型系统的分层评测

从任务成功、组件质量、错误成本和线上分布建立可回归的大模型系统评测。

发布于 2026-08-31

本文目录

    Statistical significance。评测差异需要结合样本波动和统计显著性判断,避免只比较单个均值。

    图:评测差异需要结合样本波动和统计显著性判断,避免只比较单个均值。 来源:Statistical significance,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

    问题边界

    评测对象可以是基础模型、检索器、工具选择、生成答案或完整任务。不同层的分数不能互相替代。

    知识全貌

    建立离线固定集、人工标注准则、组件指标、端到端完成率、成本与延迟,再用线上样本回放和监控补充分布变化。

    核心机制

    错误分类把平均分拆成可行动的问题。高风险任务按错误成本加权,并保留人工复核。自动 Judge 需要用人工样本校准。

    公式或数据流

    task definition -> dataset -> human rubric -> baseline
    change -> component eval -> end-to-end eval -> online monitor -> regression set

    方法比较

    规则指标便宜且可重复,但覆盖有限;人工评测可靠但昂贵;LLM Judge 可扩展,却可能受位置、长度、风格和同源模型偏差影响。

    工程约束

    评测集需要版本、去重、污染检查、难度分层和失败样本维护。每次模型、Prompt、索引或工具变更都要记录可比较配置。

    故障模式

    常见问题是只看平均分、测试集泄漏、Judge 与目标同偏、线上指标没有任务语义,以及模型升级后只比较成功样本。

    高频问题

    参考资料

    Retrieval-augmented generation diagram。RAG 链路图用于练习把端到端错误拆成可独立评测的层级。

    图:RAG 链路图用于练习把端到端错误拆成可独立评测的层级。 来源:Retrieval-augmented generation diagram,作者 Turtlecrown,许可 CC BY-SA 4.0。

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签