12 · 治理

评测、幻觉、安全与可观测性

把模型输出错误拆成可测量类别,并用离线集、线上观测、安全边界和回归流程控制风险。

4 / 6节点已达到面试就绪

返回总知识地图 →

Learning path

从理解到表达的三阶段路径

节点按学习阶段分栏;具体依赖关系进入节点后查看。

评测、幻觉、安全与可观测性学习关系图知识节点按建立模型、工程迁移和闭卷提取三个阶段排列,节点均可点击。从回答评分到任务成功:Agent 评测与发布决策案例从回答评分到任务成功:Agent 评测与发布决策业务大模型评测集怎样建立?问题业务大模型评测集怎样建立?LLM-as-a-Judge 有哪些系统性偏差?问题LLM-as-a-Judge有哪些系统性偏差?Prompt Injection 为什么不能只靠系统提示词防御?问题Prompt Injection 为什么不能只靠系统提示词…
  1. 从回答评分到任务成功:Agent 评测与发布决策
  2. 业务大模型评测集怎样建立?
  3. LLM-as-a-Judge 有哪些系统性偏差?
  4. Prompt Injection 为什么不能只靠系统提示词防御?
专题 案例 问题
领域说明、结构图与复习边界+

Machine learning lifecycle。评测贯穿训练、部署与反馈回流,并持续更新下一轮质量门槛。

图:评测贯穿训练、部署与反馈回流,并持续更新下一轮质量门槛。 来源:Machine learning lifecycle,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

知识范围

覆盖任务集构造、指标、人工评测、LLM-as-a-Judge、幻觉分类、Prompt Injection、权限与审计、线上监控和版本回归。

学习路线

先定义任务成功和错误成本,再建立固定样本与人工标注;随后增加自动评测和线上观测,并持续检查 Judge 偏差。

核心问题

  • 如何设计能指导迭代的业务评测集?
  • 幻觉应按什么层次分类和定位?
  • LLM-as-a-Judge 有哪些系统性偏差?

参考资料

应用岗复习重点

按 重要性清单安排先后;读完后做节点末尾的闭卷检查,再回到对应面试问题。

Learning flow

先理解,再练习,最后闭卷回答

Domain index

领域知识检索

正在索引 6 个节点

LOCAL INDEX

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签