业务大模型评测集怎样建立?
从真实任务、成功条件和错误成本构建分层样本,冻结测试集及链路版本。规则、人工和模型评审互相校准,发布同时看质量、风险、时延和成本。
发布于 2026-08-31 · 更新于 2026-09-07
本文目录
图:业务失败样本通过评测集回流,持续更新训练和发布门槛。 来源:Machine learning lifecycle,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。
考察意图
考察候选人能否把模糊的“效果好”转成稳定、可复现的任务标准。
回答前自测
- 标注分歧怎么控?
- 每次更模型要换测试集?
- 离线好线上坏怎么办?
30 秒回答
从真实任务、成功条件和错误成本构建分层样本,冻结测试集及链路版本。规则、人工和模型评审互相校准,发布同时看质量、风险、时延和成本。
评分点
测试单位、数据切分、判定校准、版本发布。
90 秒回答
先定义用户任务、成功条件和错误成本,再从真实流量、历史失败与专家设计中抽样,覆盖常见、长尾、边界、无答案和高风险场景。为每类样本写标注规范和可接受答案,保留来源、权限和时间。用人工标注建立黄金集,再选择规则指标或 LLM Judge 扩展,但要对照人工一致性。评测集版本化,训练与调参集隔离;每次模型、Prompt、检索或工具变更都跑同一基线,并把线上新失败回收到回归集。
深入解释
单位与环境
问答测试单位可为查询,Agent 通常为完整任务。同任务多步不是独立样本。保存身份、初始状态、允许动作和预期结果,每次运行重置环境。
不把开发集当最终测试
开发集支持调 Prompt,冻结测试集评价最终选择;固定回归集守已解决问题,滚动集纳入新分布。按文档、时间和用户分组,公开基准只提供补充视角。
看配对变化
同任务比较两个版本,检查错变对及对变错,按风险分组。总体提高 2 个百分点不自动足以上线,还需样本量、波动、评分一致性和关键切片。阈值由业务错误成本决定。
工程权衡
黄金集小而稳定便于回归,大规模动态集覆盖分布变化;两者承担不同职责。
常见错误回答
直接使用公开 Benchmark 代表业务效果,或只随机抽取正常请求。
连续追问
标注分歧怎么控?
写规则和正反例,先双人试标、修订边界,再仲裁分歧。
每次更模型要换测试集?
保留冻结基线,新分布用有版本的滚动集补充。
离线好线上坏怎么办?
查分布、权限、新鲜度、真实长度与并发、泄漏及判定盲点,保存可重现失败。
项目结合
准备一个错误分类和对应样本数、指标、阈值,说明一次版本决策如何由评测结果驱动。
关联知识
延伸复习
继续阅读完整机制与案例。完成后回到本页,在不看答案的情况下重述并回答三个追问。