项目讲解、故障分析与行为面试
复习卡片 进阶 重要度 5/5 面试就绪 理解阶段 约 15 分钟

大模型应用岗复习顺序:32 项重点与过关标准

面向博士毕业求职的大模型应用、RAG 与 Agent 主线,按先修关系安排 25 项核心和 7 项加深,附六周安排与模拟面试验收。

发布于 2026-09-07 · 更新于 2026-09-09

本文目录

    每轮复习都包含提取、核对和修正;读过材料后还要验证能否独立解释与实现。

    图:每轮复习都包含提取、核对和修正;读过材料后还要验证能否独立解释与实现。 来源:Machine learning lifecycle,作者 Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola(D2L.ai),许可 CC BY-SA 4.0。

    提取问题

    这份顺序针对已经明确的大模型应用/RAG/Agent方向。毕业求职时,先证明能解释模型基本原理、独立实现检索和工具链、评估效果并处理失败;研究经历用实验设计与个人贡献支撑。是否走校招、博士专项或社招,需要按你的毕业时间和具体职位要求判断。

    截至 2026-09-07 查阅的百度与 Seed 官方招聘资料都包含机器学习基础、编程、模型或应用研究等要求,但岗位方向有明显差异。下面的 P0/P1 是结合当前知识库缺口与目标岗位做的复习建议,不是公司题频统计、统一面试标准或录用保证。

    P0 表示应先掌握的核心,站内重要度对应 5;P1 表示岗位加深,对应 4。顺序综合先修依赖和应用价值;通用编码与个人项目从第一周开始穿插,不必等读到第 23 项才动手。

    答案要点

    P0:先完成的 25 项

    1. 目标与方案选择:进入资料。过关要求:能用失败样本区分 Prompt、RAG、微调、工具,说明选择条件。

    2. 模型怎样学习:前向、反向与损失:从 一个权重是怎么学会的 开始,先算对梯度方向和两次更新。接着做 两层网络手算,通过有限差分检查;再读 概率、损失和泛化,推导交叉熵的 logits 梯度。基础薄弱时先复习这一项。

    3. Tokenizer 与上下文:进入资料。过关要求:算一次输入输出预算,解释模板、位置与 embedding 兼容性。

    4. Attention 原理:进入资料。过关要求:写出 Q/K/V 形状、缩放、mask、Softmax 和复杂度。

    5. Transformer 数据流:进入资料。过关要求:从 token 到 logits 逐层说明残差、归一化、FFN 与预测。

    6. Embedding 检索:进入资料。过关要求:解释双塔、对比学习、困难负例与假负例,算余弦。

    7. 文档切分:进入资料。过关要求:能用表格或条款反例说明结构切分、父子块和 overlap。

    8. 混合检索:进入资料。过关要求:手算 RRF,说明候选去重、两路互补和公平比较。

    9. 重排与向量索引:进入资料。过关要求:解释召回上限与联合编码;接着读 向量索引。

    10. 多轮与引用:进入资料。过关要求:还原指代而不补造实体,说明上下文排序与引用支持。

    11. RAG 故障定位:进入资料。过关要求:复算 100 题案例,设计 gold-context 对照并定位丢证据层。

    12. 权限与更新:进入资料。过关要求:说清撤权、缓存、删除、重建追平与版本切换。

    13. Workflow 与 Agent:进入资料。过关要求:用同任务对照选择自主性,解释停止条件和预算。

    14. 工具执行链路:进入资料。过关要求:完整解释 schema、业务校验、身份、确认与结果处理。

    15. 幂等与恢复:进入资料。过关要求:响应丢失后恢复不重复创建,讲清依赖和保证范围。

    16. 上下文与记忆:进入资料。过关要求:区分历史、状态和偏好,解释压缩损失、隔离及删除。

    17. 提示注入:进入资料。过关要求:说明不可信内容如何跨越边界,给出执行侧限制与攻击测试。

    18. 任务评测:进入资料。过关要求:以外部状态判成功,做配对比较并统计失败成本。

    19. 自动裁判:进入资料。过关要求:能设计 rubric、人工校准及顺序/长度偏差检查。

    20. 服务可靠性:进入资料。过关要求:讲清异步、SSE、取消、限流、重试和 deadline。

    21. 端到端系统设计:进入资料。过关要求:20 分钟讲完需求、入库、在线、权限、更新和故障。

    22. 检索代码:进入资料。过关要求:闭卷写 RRF 和至少两项指标,解释无相关题和重复候选。

    23. 通用算法:进入资料。过关要求:独立写六种模式并说明不变量、复杂度和反例。

    24. 研究与个人贡献:进入资料。过关要求:完成真实 2 分钟和 10 分钟讲解,所有数字能回查记录。

    25. 综合应用练习:进入资料。过关要求:实现或复盘带权限问答和幂等工具,提交评测与故障证据。

    P1:核心完成后继续加深

    1. 训练循环与排错:进入资料。过关要求:解释梯度累积、AdamW、eval、冻结和小样本过拟合检查。前向与反向的完整推导已属于第 2 项 P0 必修,不留到这里才学。

    2. SFT 与 LoRA:进入资料。过关要求:算参数节省,解释初始化、target modules、mask 和回归。

    3. KV Cache 与服务指标:进入资料。过关要求:手算 KV 量级,区分 prefill/decode、TTFT 和吞吐。

    4. 量化与批处理:进入资料。过关要求:解释量化对象、误差和显存构成,继续读 连续批处理。

    5. MCP 边界:进入资料。过关要求:区分协议、模型提议与执行层,不把协议当权限保证。

    6. 容量与成本:进入资料。过关要求:按真实长度分布估算副本、队列和每成功任务成本。

    7. 注意力与采样手写:进入资料。过关要求:解释 mask,验证未来位置不可见,再做 top-k/top-p。

    第 9 项的索引补充见 向量索引;第 29 项的调度补充见 Continuous Batching;第 32 项继续做 采样手写。SFT 数据细节见 SFT 数据,服务指标见 TTFT 与吞吐。

    暂缓内容与岗位分支

    P2 安排在当前方向的首轮复习之后:PPO/DPO 的完整推导、GRPO、预训练 Scaling Law、MoE 路由细节、CUDA kernel、复杂分布式训练、视觉生成与多模态。投偏算法、训练系统或多模态的职位时应重新提级。当前这些方向仍有未充分展开的领域,不用“已读完主线”代表整个大模型领域已经掌握。

    应用岗也不能只背框架。能解释框架下面的检索、状态、授权、超时和评测才是共同基础。SQL 查询、HTTP、线程/进程和数据库事务遇到薄弱项,结合 后端可靠性回补。

    六周复习安排

    以下是按每天约 2–3 小时提出的起始安排,不预设你已经投入或掌握。材料页上的分钟数是初读估计,不包含实现和项目时间。

    周次主任务当周可检查产物
    第 1 周01–06;基础薄弱先做第 02 项;每天一道编码;整理研究材料手算两层网络前向、反向和更新并做梯度检查,再手算 Attention;录制两分钟研究介绍
    第 2 周07–12;实现检索与指标一组有 gold evidence 的查询,三种召回对照和错误分类
    第 3 周13–17;工具与状态恢复丢响应后只创建一次的沙箱演示,权限与注入测试
    第 4 周18–21;评测与服务可重置任务集、版本结果表、时延分解和发布条件
    第 5 周22–25 深练;回补编码与真实项目六类编码复测、完整项目讲解、一条失败复盘
    第 6 周26–32;模拟面试与错题修补两轮闭卷模拟、薄弱项重测及岗位针对性材料

    如果两周内就有面试,优先 01、03–04、06–08、11–15、17–24,每天保留编码和项目讲解;这是一条应急顺序,省下的内容列成明确欠账。研究/项目证据要真实,不能为了追进度把训练规格写成已完成项目。

    易错点

    “看懂”与“能答”分开记录。建议用 0–3 自评分:0 是陌生,1 是看答案能理解,2 是闭卷能讲机制,3 是能算/写/定位失败并回答变化条件。这个分级用于个人复习,不代表招聘评分。

    网站的“面试就绪”是资料覆盖度,不代表你本人已掌握。达到以下条件才给自己标 3:

    • 90 秒讲清结论、机制、适用条件。
    • 三个追问有因果解释,至少一个反例。
    • 涉及公式或代码时能独立复算/运行,不照抄。
    • 能说明该知识在真实项目中的使用情况;没有实践就明确是设计或练习。

    不要把同一套“固定基线、观察指标”背到每个问题上。RRF 要会算排名,权限要会描述撤权传播,幂等要处理结果未知,评测要说明分母;各自有不同的核心动作。

    两轮模拟的题目与判分依据

    第一轮建议 45–60 分钟:研究开场、损失与 Attention、混合检索、一道窗口或堆题。判分看定义和推导是否准确、代码边界是否覆盖、个人贡献能否回查。

    第二轮建议 60 分钟:设计企业 RAG 与工单助手;追问撤权、响应丢失、成本上升和评测回退。参考要点依次是可信授权、幂等状态查询、分层耗时及每成功任务成本、配对任务和风险切片。答不出时记录到具体条目,不能只记“系统设计不熟”。

    下次复习

    每次学习先闭卷讲一次,再看正文纠错,最后用改变条件的题复测。隔天、数天后和一两周后安排提取练习;具体间隔随遗忘程度调整,不把固定的 1/3/7 天当成科学上唯一最优周期。提取练习与分散复习的有效性有学习研究支持,单纯重复阅读不足以检验能否独立提取。

    在 Obsidian 的本地复习字段记录 mastery、lastReviewed、nextReview,或另建个人错题笔记;这些字段不进入公开页面。每周只调整优先级和薄弱项,不为了好看把所有条目打勾。

    参考资料

    输入关键词,查找全部技术文章。

      搜索范围:正文、标题、分类和标签