05 · 训练

预训练、数据工程与 Scaling Law

理解预训练目标、数据清洗与配比、训练算力分配,以及规模规律能回答和不能回答的问题。

0 / 0节点已达到面试就绪

返回总知识地图 →

Learning path

从理解到表达的三阶段路径

节点按学习阶段分栏;具体依赖关系进入节点后查看。

预训练、数据工程与 Scaling Law学习关系图知识节点按建立模型、工程迁移和闭卷提取三个阶段排列,节点均可点击。
    领域说明、结构图与复习边界+

    Power-law scaling behavior。模型表现随数据、参数与计算规模呈幂律变化的经验关系。

    图:模型表现随数据、参数与计算规模呈幂律变化的经验关系。 来源:Power-law scaling behavior,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

    知识范围

    覆盖自回归目标、数据去重与质量、采样配比、训练稳定性、Checkpoint 和参数—数据—算力之间的经验规律。

    学习路线

    先理解 next-token prediction,再追踪数据进入训练批次的全过程,最后学习 Scaling Law 的实验条件和外推边界。

    核心问题

    • 数据去重为什么同时影响记忆、评测污染和有效 token?
    • Chinchilla 结论依赖什么训练预算假设?
    • 预训练 loss 下降怎样转化为下游能力?

    参考资料

    Learning flow

    先理解,再练习,最后闭卷回答

    01

    理解知识

    概念、机制与方法比较

      02

      练习迁移

      估算、实现、案例与算法

        03

        闭卷提取

        面试问题与复习卡片

          Domain index

          领域知识检索

          正在索引 0 个节点

          LOCAL INDEX

            输入关键词,查找全部技术文章。

              搜索范围:正文、标题、分类和标签