评测、幻觉、安全与可观测性
面试问题 高级 重要度 5/5 面试就绪 提取阶段

业务大模型评测集怎样建立?

从真实任务、成功条件和错误成本构建分层样本,冻结测试集及链路版本。规则、人工和模型评审互相校准,发布同时看质量、风险、时延和成本。

发布于 2026-08-31 · 更新于 2026-09-07

当前显示参考答案
本文目录

    Machine learning lifecycle。业务失败样本通过评测集回流,持续更新训练和发布门槛。

    图:业务失败样本通过评测集回流,持续更新训练和发布门槛。 来源:Machine learning lifecycle,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

    考察意图

    考察候选人能否把模糊的“效果好”转成稳定、可复现的任务标准。

    回答前自测

    • 标注分歧怎么控?
    • 每次更模型要换测试集?
    • 离线好线上坏怎么办?

    30 秒回答

    从真实任务、成功条件和错误成本构建分层样本,冻结测试集及链路版本。规则、人工和模型评审互相校准,发布同时看质量、风险、时延和成本。

    评分点

    测试单位、数据切分、判定校准、版本发布。

    90 秒回答

    先定义用户任务、成功条件和错误成本,再从真实流量、历史失败与专家设计中抽样,覆盖常见、长尾、边界、无答案和高风险场景。为每类样本写标注规范和可接受答案,保留来源、权限和时间。用人工标注建立黄金集,再选择规则指标或 LLM Judge 扩展,但要对照人工一致性。评测集版本化,训练与调参集隔离;每次模型、Prompt、检索或工具变更都跑同一基线,并把线上新失败回收到回归集。

    深入解释

    单位与环境

    问答测试单位可为查询,Agent 通常为完整任务。同任务多步不是独立样本。保存身份、初始状态、允许动作和预期结果,每次运行重置环境。

    不把开发集当最终测试

    开发集支持调 Prompt,冻结测试集评价最终选择;固定回归集守已解决问题,滚动集纳入新分布。按文档、时间和用户分组,公开基准只提供补充视角。

    看配对变化

    同任务比较两个版本,检查错变对及对变错,按风险分组。总体提高 2 个百分点不自动足以上线,还需样本量、波动、评分一致性和关键切片。阈值由业务错误成本决定。

    工程权衡

    黄金集小而稳定便于回归,大规模动态集覆盖分布变化;两者承担不同职责。

    常见错误回答

    直接使用公开 Benchmark 代表业务效果,或只随机抽取正常请求。

    连续追问

    标注分歧怎么控?

    写规则和正反例,先双人试标、修订边界,再仲裁分歧。

    每次更模型要换测试集?

    保留冻结基线,新分布用有版本的滚动集补充。

    离线好线上坏怎么办?

    查分布、权限、新鲜度、真实长度与并发、泄漏及判定盲点,保存可重现失败。

    项目结合

    准备一个错误分类和对应样本数、指标、阈值,说明一次版本决策如何由评测结果驱动。

    关联知识

    延伸复习

    继续阅读完整机制与案例。完成后回到本页,在不看答案的情况下重述并回答三个追问。

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签