04 · 模型

Tokenizer、Embedding 与位置编码

解释文本切分、词表、向量表示和位置编码怎样共同决定模型看到的序列。

1 / 1节点已达到面试就绪

返回总知识地图 →

Learning path

从理解到表达的三阶段路径

节点按学习阶段分栏;具体依赖关系进入节点后查看。

Tokenizer、Embedding 与位置编码学习关系图知识节点按建立模型、工程迁移和闭卷提取三个阶段排列,节点均可点击。Tokenizer、Embedding 与上下文预算概念Tokenizer、Embedding 与上下文预算
  1. Tokenizer、Embedding 与上下文预算
概念
领域说明、结构图与复习边界+

Language model data preparation。语言模型把连续文本整理为定长训练样本的数据准备过程。

图:语言模型把连续文本整理为定长训练样本的数据准备过程。 来源:Language model data preparation,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

知识范围

覆盖 BPE、Unigram、特殊 token、词表权衡、输入/输出 Embedding 共享、绝对位置、相对位置和 RoPE。

学习路线

先观察不同 Tokenizer 的切分与序列长度,再理解 Embedding 查表和输出概率,最后分析位置编码与长度外推。

核心问题

  • 词表变大为什么可能降低序列长度却增加参数?
  • Tokenizer 如何影响中文、代码和数字任务?
  • RoPE 把相对位置信息写到了哪里?

参考资料

应用岗复习重点

按 重要性清单安排先后;读完后做节点末尾的闭卷检查,再回到对应面试问题。

Learning flow

先理解,再练习,最后闭卷回答

01

理解知识

概念、机制与方法比较

02

练习迁移

估算、实现、案例与算法

    03

    闭卷提取

    面试问题与复习卡片

      Domain index

      领域知识检索

      正在索引 1 个节点

      LOCAL INDEX

        输入关键词,查找全部技术文章。

          搜索范围:正文、标题、分类和标签