大模型相关岗位、技术要求与求职准备指南
1. 先建立正确认识
“大模型岗位”不是一个单一岗位,而是一条从数据、训练、对齐、评测到推理部署、应用落地的完整技术链。不同岗位虽然都会写“熟悉 Transformer、PyTorch、LLM”,但真正考查的能力完全不同:
- 研究与训练岗看重模型原理、实验设计、论文和大规模训练经验;
- 推理与系统岗看重 C++/CUDA、计算机系统和性能优化;
- Agent、RAG 与应用岗看重系统设计、评测闭环和工程交付;
- 数据与评测岗看重数据治理、指标设计、统计分析与模型行为理解;
- AI 产品和解决方案岗看重场景判断、产品指标、沟通推动和技术边界认知。
当前企业官方招聘页面已经把大模型算法、多模态、智能体、AI 测试、AI 产品和 AI 全栈等岗位分别列出。例如,百度校招岗位同时覆盖预训练、SFT/RLHF、RAG、Agent、多模态数据管线、评测体系和产品落地;字节和腾讯的相关岗位则反复强调代码能力、机器学习基础、PyTorch、Python/C++、数据策略和工程经验。由此可以推断:仅“调用过大模型 API”通常不足以竞争算法岗,只有论文、没有工程闭环也会限制应用型岗位的竞争力。参考:百度校园招聘、字节跳动大语言模型校招岗位、腾讯招聘。
2. 岗位地图
2.1 核心算法与研究类
| 岗位 | 主要工作 | 核心要求 | 更看重的证明材料 |
|---|---|---|---|
| 大模型研究员 / Research Scientist | 新模型结构、训练方法、推理能力、Scaling、长上下文等研究 | 数学与深度学习基础,论文阅读与创新,严谨实验 | 顶会论文、技术报告、开源贡献、完整消融实验 |
| 预训练算法工程师 | 语料构建、Tokenizer、训练策略、分布式训练、稳定性和 Scaling | Transformer、优化器、并行训练、数据治理 | 多卡训练项目、训练曲线分析、故障定位、吞吐优化 |
| 后训练 / 对齐算法工程师 | SFT、偏好优化、Reward Model、RL、蒸馏和安全对齐 | SFT、DPO/PPO/GRPO 等原理,数据配比,评测与训练闭环 | 可复现实验、基线对比、数据策略和消融分析 |
| 多模态算法工程师 | 图文、视频、语音等理解或生成,跨模态对齐 | NLP/CV/语音至少一项扎实,多模态架构和数据管线 | 多模态项目、相关论文、模型训练与评测结果 |
| 搜索/推荐/广告大模型算法工程师 | 用 LLM 增强召回、排序、生成、用户理解或内容理解 | 搜推广基础、LLM、特征和大数据处理 | 业务指标、离线/在线实验、Spark 等经验 |
岗位特点:门槛最高,硕士及以上较常见。研究岗重“新方法”,算法工程岗重“把方法训出来并解释结果”。如果没有顶会论文,仍可通过高质量复现、可靠的消融实验、开源贡献和实习成果证明研究能力。
2.2 系统与基础设施类
| 岗位 | 主要工作 | 核心要求 | 更看重的证明材料 |
|---|---|---|---|
| 大模型推理优化工程师 | 提升吞吐、降低延迟和显存,量化、并行推理、服务化 | C++、CUDA、GPU 架构、算子、并行与推理框架 | 性能剖析报告、吞吐/延迟数据、CUDA 或框架贡献 |
| 分布式训练 / ML Systems 工程师 | 多机多卡训练、容错、调度、Checkpoint、通信优化 | OS、网络、分布式系统、NCCL、PyTorch Distributed | 集群实践、故障排查、扩展效率、系统项目 |
| AI 平台 / MLOps 工程师 | 数据、训练、评测、部署流水线,模型和实验管理 | 后端、容器、Kubernetes、工作流、可观测性 | 可部署平台、CI/CD、监控指标、稳定性设计 |
| AI Infra / 数据基础设施工程师 | 训练数据处理、检索索引、存储、任务调度 | Python/Java/Go/C++,数据库和大数据系统 | 大规模数据管道、可靠性与成本优化 |
岗位特点:算法论文不是必要条件,系统基本功和性能意识更重要。PyTorch 官方将 DDP、FSDP、Tensor/Pipeline Parallel 等作为分布式训练的重要组成;DeepSpeed 的 ZeRO 关注大模型训练的显存优化;vLLM 则覆盖连续批处理、KV Cache 管理、量化和分布式推理。参考:PyTorch Distributed、DeepSpeed 大模型训练、vLLM 官方文档。
2.3 应用、Agent 与知识工程类
| 岗位 | 主要工作 | 核心要求 | 更看重的证明材料 |
|---|---|---|---|
| LLM 应用算法工程师 | RAG、Prompt、结构化生成、领域适配和效果优化 | NLP、Embedding/Reranker、微调、评测 | 端到端项目、离线评测、线上指标和错误分析 |
| Agent 算法 / 工程师 | 规划、工具调用、记忆、多 Agent 协作和任务执行 | Agent 架构、工作流、状态管理、可靠性与评测 | 任务成功率、轨迹分析、失败恢复、成本/延迟优化 |
| AI 应用后端 / 全栈工程师 | 将模型接入业务,开发 API、前后端和异步任务 | 软件工程、后端/前端、数据库、并发和模型 API | 可运行产品、测试、部署、监控和用户反馈 |
| 知识工程 / RAG 工程师 | 文档处理、索引、召回、重排、引用和权限控制 | 信息检索、数据库、Embedding、数据清洗 | Recall@K、nDCG、答案正确率、可追溯性与权限设计 |
岗位特点:入门相对友好,但“做了一个聊天机器人”区分度很低。高质量项目必须有数据集、基线、评测指标、错误分类、系统架构、性能和成本数据。
2.4 数据、评测与安全类
| 岗位 | 主要工作 | 核心要求 | 更看重的证明材料 |
|---|---|---|---|
| 大模型数据工程师 / 数据算法工程师 | 采集、清洗、去重、分类、合成、配比和质量打分 | 数据工程、NLP、统计分析、隐私与版权意识 | 数据流水线、质量指标、去重与污染检测实验 |
| 大模型评测工程师 / 评测算法工程师 | 建立能力、安全、鲁棒性和业务评测体系 | 指标设计、统计检验、自动/人工评测、误差分析 | 自建 Benchmark、评测一致性、置信区间、分析报告 |
| AI 安全 / 对齐工程师 | 内容安全、越狱防护、红队、隐私与模型行为治理 | 安全攻防、对齐、政策理解、分类与评测 | 红队数据集、防护前后对比、误杀漏放分析 |
| AI 测试开发工程师 | 功能、性能、稳定性和模型专项测试 | 测试开发、自动化平台、LLM 评测和质量体系 | 测试框架、覆盖率、缺陷定位、稳定性指标 |
岗位特点:不是“人工标注”的同义词。成熟岗位强调数据策略、自动化、统计可靠性和对训练迭代的反馈闭环。当前官方招聘中,大模型评测已明确要求模型底层原理、评测方法和数据策略;AI 测试也覆盖逻辑推理、多轮一致性、内容安全、鲁棒性和性能稳定性。参考:字节跳动大模型评测岗位、百度校园招聘。
2.5 产品与业务类
| 岗位 | 主要工作 | 核心要求 | 更看重的证明材料 |
|---|---|---|---|
| AI 产品经理 | 场景定义、需求设计、模型选型、指标和产品迭代 | 产品分析、LLM 能力边界、数据意识、跨团队协作 | PRD、原型、用户研究、指标增长和迭代复盘 |
| AI 解决方案架构师 | 面向客户设计行业方案、PoC 和交付架构 | 云与软件架构、RAG/Agent、沟通和行业知识 | PoC、架构设计、交付结果、成本与安全方案 |
| AI 技术顾问 / 售前 | 需求澄清、方案演示、技术答疑、推动签约和落地 | 技术广度、表达、客户与商业意识 | Demo、行业方案、复杂问题拆解与协作经验 |
岗位特点:不要求训练底座模型,但必须能判断模型“能做什么、不能做什么、如何验证、成本是多少、风险在哪里”。
3. 技术能力要求
3.1 所有技术岗的共同基础
编程与工程
- 熟练使用 Python,能独立完成数据处理、训练、评测和服务开发;
- 掌握数据结构与算法:数组、链表、栈、队列、树、图、哈希、堆、排序、二分、动态规划、贪心;
- 熟悉 Linux、Git、Shell、环境管理、日志和基本性能排查;
- 掌握至少一种深度学习框架,求职中通常以 PyTorch 为主;
- 能写可复现代码:配置化、固定随机种子、记录依赖、单元测试、实验追踪;
- 应用与数据岗位通常还需要 SQL;系统岗通常还需要 C++,推理优化岗可能需要 CUDA。
数学与机器学习
- 线性代数:矩阵乘法、特征值、SVD、范数、低秩近似;
- 概率统计:条件概率、最大似然、期望方差、假设检验、置信区间;
- 微积分与优化:梯度、链式法则、SGD/AdamW、学习率、正则化;
- 机器学习:偏差—方差、过拟合、损失函数、分类/排序指标、数据泄漏;
- 深度学习:反向传播、初始化、归一化、残差、Dropout、混合精度。
LLM 核心知识
- Transformer:Self-Attention、Multi-Head Attention、FFN、Residual、LayerNorm/RMSNorm;
- Tokenization:BPE、WordPiece、SentencePiece,词表大小的影响;
- 位置编码:绝对位置、RoPE,以及长度外推的基本思路;
- 训练目标:Causal LM、Masked LM,多模态中的对比和生成目标;
- 解码:Greedy、Beam Search、Top-k、Top-p、Temperature、重复惩罚;
- 训练阶段:预训练、SFT、偏好对齐、蒸馏;
- 推理基础:KV Cache、Batching、量化、吞吐与首 Token/逐 Token 延迟;
- 评测基础:任务指标、LLM-as-a-Judge 的偏差、人工评测一致性、数据污染。
3.2 不同方向的能力深度
下面用 0~3 表示建议掌握程度:0=不要求,1=理解概念,2=能独立实现/使用,3=能优化、定位问题并解释原理。
| 能力 | 研究/训练 | 后训练/对齐 | 推理/系统 | Agent/RAG | 数据/评测 | 应用开发 |
|---|---|---|---|---|---|---|
| 数学、ML/DL 原理 | 3 | 3 | 2 | 2 | 2 | 1 |
| Transformer/LLM 原理 | 3 | 3 | 3 | 2 | 2 | 2 |
| PyTorch 训练 | 3 | 3 | 2 | 2 | 2 | 1 |
| 分布式训练 | 3 | 2~3 | 3 | 1 | 1 | 0~1 |
| C++/CUDA/系统 | 1~2 | 1 | 3 | 1 | 0~1 | 1~2 |
| SFT/偏好优化/RL | 2 | 3 | 1 | 2 | 2 | 1 |
| 信息检索/RAG | 1 | 1~2 | 1 | 3 | 2 | 2~3 |
| Agent/工具调用 | 1 | 2 | 1 | 3 | 2 | 3 |
| 数据治理 | 2~3 | 3 | 1 | 2 | 3 | 2 |
| 评测与统计 | 3 | 3 | 2 | 3 | 3 | 2 |
| 后端、部署、可观测性 | 1 | 1 | 3 | 2~3 | 2 | 3 |
3.3 常见工具栈
工具不是越多越好,简历上写出的工具必须能回答“为什么选、核心原理、踩过什么坑、如何验证”。
- 训练:PyTorch、Transformers、Accelerate、DeepSpeed、FSDP、Megatron-LM;
- 微调与对齐:PEFT/LoRA/QLoRA、TRL、LLaMA-Factory 等;
- 推理:vLLM、SGLang、TensorRT-LLM、llama.cpp、ONNX Runtime;
- RAG:FAISS/Milvus/Elasticsearch,Embedding、Reranker,文档解析与切分;
- Agent:原生工具调用和状态机,以及 LangGraph/LangChain/AutoGen 等框架;
- 工程:FastAPI、Docker、Kubernetes、Redis、消息队列、Prometheus/Grafana;
- 数据:Pandas、Polars、SQL、Spark、对象存储;
- 实验:Weights & Biases、MLflow 或自建实验记录。
Hugging Face TRL 当前直接覆盖 SFT、DPO、GRPO、Reward Modeling 等训练方式;PEFT 支持 LoRA/QLoRA 等参数高效微调。它们适合用于学习和项目复现,但面试重点应是训练目标、数据格式、显存开销、超参数影响和评测结论,而不是会调用某个 Trainer。参考:TRL、PEFT。
4. 如何选择岗位方向
可以用以下问题快速判断:
- 喜欢推公式、读论文、做消融吗?优先研究、预训练、后训练、多模态算法。
- 喜欢性能分析、系统底层、C++/CUDA 吗?优先推理优化、分布式训练、AI Infra。
- 喜欢把模型做成可用产品吗?优先 Agent/RAG、AI 应用后端或全栈。
- 对数据质量、指标、模型缺陷敏感吗?优先数据、评测、安全和 AI 测试。
- 擅长需求判断、沟通和业务抽象吗?可考虑 AI 产品或解决方案。
对硕士应届生,建议采用“一个主方向 + 一个邻接方向”:
- 主方向:决定简历标题、核心项目和 70% 的准备时间;
- 邻接方向:扩大投递面,占 30% 时间;
- 例:后训练 + 评测、RAG + 应用后端、推理优化 + 分布式训练、多模态 + 数据。
不要同时把自己定位为“预训练、RAG、Agent、CUDA、产品全都会”。招聘方更信任一条有证据的能力主线。
5. 简历准备
5.1 一页简历的推荐结构
应届生通常控制在一页,顺序可采用:
- 姓名、联系方式、GitHub/个人主页;
- 教育经历:学校、专业、时间、GPA/排名(有优势再写);
- 研究/实习经历;
- 2~3 个与目标岗位高度相关的项目;
- 论文、竞赛或开源贡献;
- 技能清单。
简历标题应直接对应岗位,例如:
求职方向:大模型后训练 / 对齐算法工程师
不要写“求职方向:人工智能相关岗位”。
5.2 每段经历的写法
推荐公式:
业务/研究问题 + 个人动作 + 关键技术 + 量化结果 + 验证方式
较弱写法:
使用 LangChain 和某大模型搭建 RAG 问答系统,提升了问答效果。
较强写法:
面向 2.3 万篇技术文档构建可追溯 RAG 系统;设计标题感知切分、混合召回与 Cross-Encoder 重排,在 600 条人工标注测试集上将 Recall@10 从 71.2% 提升至 87.6%,答案正确率由 64.8% 提升至 78.5%;通过缓存和并发请求将 P95 延迟从 4.1 s 降至 2.6 s。
较弱写法:
使用 LoRA 微调开源大模型,取得较好效果。
较强写法:
构建 4.8 万条领域指令数据并完成去重、质量打分与难例采样;基于 7B 模型进行 QLoRA SFT,对比全参数/不同 rank 和数据配比,在独立测试集上 Macro-F1 提升 6.3 个百分点,同时记录显存、吞吐和收敛曲线并完成消融分析。
5.3 简历中的量化指标
按方向选择真正有意义的指标:
| 方向 | 建议指标 |
|---|---|
| 训练/对齐 | Loss、Accuracy/F1、胜率、奖励、训练吞吐、显存、收敛时间 |
| RAG | Recall@K、MRR、nDCG、答案正确率、引用正确率、拒答准确率 |
| Agent | 任务成功率、步骤数、工具调用准确率、恢复率、成本、P95 延迟 |
| 推理 | TTFT、TPOT、吞吐、并发、显存、P50/P95/P99、单位请求成本 |
| 数据 | 去重率、有效率、覆盖度、污染率、人工一致性、处理吞吐 |
| 评测 | 指标相关性、判分一致性、置信区间、覆盖率、误判率 |
| 应用系统 | QPS、可用性、错误率、P95 延迟、成本、测试覆盖率 |
所有数字都要能解释:测试集如何构建、基线是什么、是否存在数据泄漏、重复实验几次、提升是否稳定。
5.4 技能栏写法
避免:
熟悉 Python、C++、Java、Go、PyTorch、TensorFlow、JAX、CUDA、Kubernetes、各种 Agent 框架……
推荐按熟练度和岗位相关性分组:
- 编程:熟练 Python/PyTorch;掌握 C++、SQL、Linux 与 Git。
- LLM:理解 Transformer、SFT、DPO、LoRA/QLoRA、RAG 与常用评测方法;完成 7B 模型微调和对比实验。
- 工程:使用 FastAPI、Docker、vLLM 完成模型服务部署;能进行吞吐、延迟和显存测试。
“熟练”意味着可以不依赖教程独立实现并排查问题;“了解”通常不值得占用简历空间。
5.5 项目组合建议
组合 A:后训练 / 对齐
- 从数据构建到 SFT/QLoRA 的完整项目;
- DPO/GRPO 或 Reward Model 对比实验;
- 自建评测集和误差分析工具。
组合 B:RAG / Agent
- 带混合召回、重排、引用和拒答的 RAG;
- 有真实工具、状态管理和失败恢复的 Agent;
- Agent/RAG 自动评测与线上观测面板。
组合 C:推理 / 系统
- vLLM/SGLang/TensorRT-LLM 基准测试;
- 量化、Batch、并发、KV Cache 等变量的消融;
- 一个 C++/CUDA 算子或推理框架开源贡献。
组合 D:研究
- 一篇高相关论文的高质量复现;
- 在新数据集或新设定上的扩展;
- 完整的假设、基线、消融、统计分析和技术报告。
GitHub 仓库至少包含:README、环境配置、数据说明、训练/评测命令、结果表格、关键曲线、已知限制。能让面试官在 3 分钟内理解并复现,比堆积多个半成品项目更有效。
5.6 简历常见问题
- 只列模型和框架,没有问题、指标、基线与个人贡献;
- 把团队成果全部写成个人成果;
- 写了“精通 Transformer”,却解释不清 Attention 复杂度;
- 只有公开数据上的单次微调,没有对照和错误分析;
- RAG/Agent 项目只有 Demo,没有评测;
- 使用测试集调参或数据集交叉污染;
- 为了“量化”而编造数字。无法复现的数字会在面试追问中迅速暴露。
6. 笔试准备
6.1 常见题型
编程题
重点通常包括:
- 哈希、双指针、滑动窗口;
- 二分查找、排序、堆;
- 树/图的 DFS、BFS、最短路、拓扑排序;
- 动态规划与贪心;
- 字符串、前缀和、并查集;
- 时间与空间复杂度分析。
准备标准不是“看懂题解”,而是 30~40 分钟内写出边界正确、复杂度合格、能通过测试的代码。算法岗建议至少系统完成一轮高频题,并定期参加限时模拟。
数学、机器学习与深度学习题
- 手推 Softmax + Cross-Entropy 梯度;
- 为什么要除以 (\sqrt{d_k});
- BatchNorm、LayerNorm、RMSNorm 的区别;
- Adam 与 AdamW、权重衰减和学习率调度;
- 过拟合识别与处理;
- Precision、Recall、F1、AUC 的适用场景;
- 不平衡数据、分布偏移、数据泄漏;
- Dropout、残差连接、梯度消失/爆炸。
LLM 专项题
- Transformer 前向过程与参数量/计算量估算;
- MHA、MQA、GQA 的区别;
- KV Cache 为什么能加速自回归推理,显存如何估算;
- SFT、DPO、PPO/GRPO 的训练信号和差异;
- LoRA 原理、rank 的影响、适合注入哪些层;
- 量化的基本思路,PTQ 与 QAT 的区别;
- 幻觉产生的原因,RAG/微调/Prompt 分别解决什么问题;
- RAG 中切分、召回、重排、生成和评测;
- Agent 的规划、工具调用、记忆、循环终止和失败恢复;
- LLM 评测中的污染、Judge 偏差和人工一致性。
系统题
- 进程、线程、协程;
- 虚拟内存、缓存、锁、死锁;
- TCP/HTTP、RPC、负载均衡;
- GPU 内存层次、Kernel、带宽与算力瓶颈;
- 数据并行、张量并行、流水线并行、专家并行;
- AllReduce、通信开销、扩展效率;
- 服务限流、批处理、缓存、容错和可观测性。
推理/Infra 岗的系统题权重会显著高于应用算法岗。
6.2 笔试复习方法
建立三本错题账:
- 算法题错题账:错误原因、正确模型、复杂度、相似题;
- 理论题卡片:每题用“定义—原理—优缺点—适用场景”回答;
- 项目问题账:训练失败、性能瓶颈、错误案例以及最终如何定位。
每周至少完成一次 90~120 分钟混合模拟:2 道代码题 + 10~20 道理论题,并在当天复盘。
7. 面试准备
7.1 常见面试流程
- 简历筛选:学历、方向匹配、实习/论文/项目证据;
- 一面:基础知识、编程题、项目真实性;
- 二面:专项深挖、系统/算法设计、开放问题;
- 三面或主管面:研究潜力、业务理解、协作与动机;
- HR 面:经历、选择、时间、地点和薪酬预期。
7.2 自我介绍模板
控制在 60~90 秒:
我是某校人工智能专业硕士,研究/求职方向是大模型后训练与评测。过去一年主要做了两项工作:第一,围绕某领域数据完成 7B 模型的 SFT 与 DPO,对数据配比和训练策略进行了消融;第二,建立包含某些能力的评测集和错误分析流程。前一项将核心指标从 X 提升到 Y,后一项用于定位了 A、B 两类主要错误。我在其中独立负责数据管线、训练和评测代码。希望应聘贵公司的后训练/对齐岗位,继续做数据—训练—评测闭环。
原则:只讲与目标岗位相关的主线,不按时间顺序朗读简历。
7.3 项目深挖的高频追问
每个项目都要能回答:
- 为什么要做,原问题是什么?
- 为什么选这个模型/方案,备选方案是什么?
- 数据来自哪里,如何清洗、切分和防止泄漏?
- Baseline 是什么,指标为什么合理?
- 你个人负责什么,最难的问题是什么?
- 失败过哪些方案,为什么失败?
- 提升来自哪个模块,是否做过消融?
- 结果是否有方差、置信区间或重复实验?
- 性能、成本和资源消耗是多少?
- 如果数据量/并发/模型规模扩大十倍,如何改?
- 上线后如何监控,遇到坏案例如何回流?
- 如果重做一次,会改变什么?
面试前为每个项目准备:一张架构图、一张结果表、一张错误分类表。即使不能展示,也能帮助自己形成稳定叙述。
7.4 典型专项问题与回答框架
“如何优化一个 RAG 系统?”
不要只回答“换更强 Embedding”。建议按链路回答:
- 明确业务指标与评测集;
- 将错误拆成解析、切分、召回、重排、上下文组织、生成和拒答;
- 分别建立检索指标与端到端指标;
- 用失败样本决定优化顺序;
- 做单变量/消融实验;
- 同时监控正确率、延迟和成本;
- 上线后建立反馈与数据回流。
“SFT 和 DPO 有什么区别?”
回答应覆盖:数据形式、优化目标、训练阶段、对参考模型的依赖、适用问题、稳定性和成本;最好结合自己项目中的数据和结果,而不是只背公式。
“为什么 KV Cache 占显存?”
回答应从自回归生成时每层需要保留历史 Token 的 Key/Value 出发,说明显存与层数、序列长度、KV Head 数、Head Dim、Batch 和数据类型的关系,并进一步谈 MQA/GQA、量化、分页管理和并发之间的权衡。
“如何评价一个 Agent?”
至少区分:最终任务成功率、子步骤/工具调用正确率、轨迹质量、失败恢复、幻觉动作、延迟、Token/工具成本和安全性;离线固定任务集与真实线上行为要分别评估。
7.5 代码面试
- 开始前复述输入输出和边界;
- 先给暴力解法,再说明优化思路;
- 边写边解释关键不变量;
- 主动测试空输入、单元素、重复值、极端大小;
- 写完分析时间/空间复杂度;
- 不要沉默十分钟后直接给代码。
训练/系统岗位还可能要求现场实现 Attention、LayerNorm、LoRA 层、简化版数据并行或推理服务组件。
7.6 行为面试
使用 STAR:Situation、Task、Action、Result。准备至少六个真实故事:
- 解决最困难的技术问题;
- 一个失败实验以及如何调整;
- 与他人意见不一致;
- 在时间压力下交付;
- 主动推动改进;
- 收到负面反馈并改变做法。
主管面尤其关注:是否诚实、能否把模糊问题变成可验证问题、是否能持续学习、能否和算法/工程/产品协作。
8. 十二周准备计划
下面以每周 20~25 小时为例,可按实际时间缩放。
| 周次 | 主要任务 | 可交付成果 |
|---|---|---|
| 第 1 周 | 收集 30 个目标 JD,归类岗位和关键词;选择主方向/邻接方向 | 岗位清单、能力差距表、简历初稿 |
| 第 2 周 | 复习 ML/DL、Transformer、PyTorch 基础 | 30 道理论题卡、手写 Attention/训练循环 |
| 第 3 周 | 根据方向补 SFT/RAG/推理等专项基础 | 可运行最小基线、实验计划 |
| 第 4 周 | 建数据管线与评测集,确定 Baseline | 数据说明、基线结果、评测脚本 |
| 第 5 周 | 完成第一次核心实验 | 训练日志、结果表、失败记录 |
| 第 6 周 | 做消融、误差分析和性能测试 | 消融表、错误分类、性能数据 |
| 第 7 周 | 完善工程化、测试、部署与 README | 可复现 GitHub 仓库和 Demo |
| 第 8 周 | 打磨第二个较小的邻接项目或开源贡献 | 第二份项目证据/PR |
| 第 9 周 | 按不同 JD 制作 2~3 个简历版本,开始投递 | 定向简历、投递跟踪表 |
| 第 10 周 | 代码题和理论笔试模拟 | 2 次限时模拟与错题复盘 |
| 第 11 周 | 项目深挖、专项面试和系统设计模拟 | 问答文档、3 次模拟面试 |
| 第 12 周 | 查漏补缺、高频复盘、继续投递 | 最终简历、面试速查表 |
建议每天的固定组合:
- 45~60 分钟算法题;
- 45 分钟理论复习;
- 1~2 小时项目/论文/开源;
- 15 分钟记录问题、结论和第二天任务。
准备过程中应尽早投递,不要等“全部学完”。真实笔试和面试反馈能更快暴露能力缺口。
9. JD 驱动的投递方法
9.1 建立岗位表
至少记录:公司、岗位、方向、城市、学历、必备技能、加分项、截止时间、投递状态、面试反馈。
9.2 从 JD 提取关键词
分成四类:
- 硬门槛:学历、专业、毕业时间、工作年限;
- 核心能力:如 SFT/RLHF、C++/CUDA、RAG/Agent;
- 业务场景:搜索、推荐、广告、金融、教育、多模态;
- 加分项:顶会、竞赛、开源、多卡训练、相关实习。
简历应覆盖核心能力的同义表达,但不能为了 ATS 关键词堆砌虚假技能。
9.3 投递优先级
可以简单打分:
[ Score = 0.4 \times 核心技能匹配 + 0.25 \times 项目证据 + 0.2 \times 兴趣 + 0.15 \times 地点/团队等现实因素 ]
优先投递高匹配岗位,同时保留一部分“冲刺岗位”和“保底岗位”。同一家公司不要无差别海投十几个方向,应保持一条可信的职业主线。
10. 不同背景的准备重点
有论文、工程较弱
- 把论文代码整理为可复现仓库;
- 补部署、评测、性能和代码质量;
- 能说明方法在真实数据、成本和延迟约束下如何落地。
工程较强、理论较弱
- 系统复习 Transformer、训练目标和优化;
- 不只会调用 API,要能解释错误来源与实验设计;
- 用一个对照充分的项目证明算法思维。
无论文、无相关实习
- 不要堆四五个教程项目;
- 选一个窄问题,完成数据—基线—实验—评测—部署—报告;
- 尝试给成熟开源项目提交文档、测试、Bug 修复或功能 PR;
- 优先寻找日常实习、实验室合作和真实用户场景。
从传统 NLP/CV/推荐转向 LLM
- 保留原领域优势,不要把过去经历全部删掉;
- 建立“原领域能力 + LLM”的桥梁,例如推荐大模型、多模态、领域 RAG;
- 清楚说明传统方法和 LLM 方法的边界与收益。
11. 面试前检查清单
简历
- 求职方向是否与 JD 一致?
- 每个核心技能是否有项目证据?
- 每段项目是否说明个人贡献、基线和指标?
- 所有数字是否可解释、可复现?
- 是否删掉无法经受追问的“精通/熟悉”?
- GitHub 链接、论文链接和联系方式是否可用?
笔试
- 是否能限时完成常见数据结构与算法题?
- 是否能手推常见损失和 Attention?
- 是否掌握目标方向的 50~100 个高频问题?
- 是否做过至少两次完整模拟?
面试
- 是否准备了 60~90 秒自我介绍?
- 每个项目能否连续讲 5 分钟并接受 20 分钟追问?
- 是否能讲清失败实验、误差分析和取舍?
- 是否了解目标团队的产品、论文或开源项目?
- 是否准备了 3~5 个反问问题?
推荐反问:
- 该岗位入职前三个月最重要的交付是什么?
- 团队目前最核心的技术瓶颈是效果、数据、推理成本还是工程稳定性?
- 该岗位如何评价工作成果?
- 训练、评测、工程和产品之间如何协作?
- 团队对新人有哪些代码、实验或论文分享机制?
12. 最务实的结论
- 先选方向,再学技术;用目标 JD 决定学习深度。
- 大模型岗位的共同门槛仍是编程、机器学习/深度学习、数据和实验能力。
- 一份优秀简历不是技术名词清单,而是一组“我解决过什么问题”的证据。
- 项目必须包含基线、指标、消融、错误分析和复现说明;应用项目还要包含延迟、成本与可靠性。
- 笔试靠系统训练,面试靠对项目和原理的深层理解,无法用临时背题完全替代。
- 对硕士生而言,最有竞争力的组合通常是:一项可深入追问的研究/工程成果 + 扎实基础 + 一段真实协作或实习经历。
参考资料
当前岗位样本
技术文档
- PyTorch Distributed Overview
- DeepSpeed:Training Your Large Model
- DeepSpeed ZeRO
- vLLM 官方文档
- Hugging Face TRL
- Hugging Face PEFT
注:框架版本与招聘要求会持续变化。准备时应重新阅读目标岗位的最新 JD,并以官方文档确认工具的当前能力。
留下评论