预训练工程师是什么岗位?

预训练工程师负责从零训练大模型的基座,工作重心在数据配比、训练稳定性与大规模算力调度。

技术研发 大模型训练 IT互联网 资深 LLM Pre-training Engineer 又叫 大模型预训练、预训练算法工程师、Pretrain工程师、基座模型工程师
岗位大类
技术研发
常见层级
资深
主要行业
IT互联网
薪资区间
暂无可核验来源

预训练工程师是什么

预训练(Pre-training)指用海量通用语料从头训练出一个大模型的基座,也就是还没经过指令微调、只学会「预测下一个词」的那个阶段。预训练工程师就是负责这件事的人。

这是整条大模型链路里门槛最高、岗位数量最少的位置。原因很直接:一次预训练动辄需要成百上千张高端计算卡连续跑数周,只有少数公司和研究机构具备这个条件。相应地,这个岗位的招聘要求普遍写到硕士博士,且看重相关论文或实际训练经验。

它和后面几个环节的分工要分清:预训练造基座;微调(SFT)教模型听指令;对齐(RLHF 等)调整模型的偏好与安全边界;再往后才是 RAG、Agent 这些应用层。求职时看到「大模型算法工程师」这类宽泛标题,务必问清楚具体在哪一段——四段的日常工作、所需背景和团队规模差别极大。

预训练工程师是干什么的·日常工作内容

预训练的日常不是写模型结构(那部分相对固定),而是围绕数据和训练过程:准备语料、跑小规模实验定配方、启动大规模训练、盯着曲线不让它崩。

主要职责

  • 数据工程:语料采集、清洗、去重、质量过滤,以及不同来源的配比设计。
  • 分词与词表:tokenizer 的训练与评估,直接影响训练效率和多语言表现。
  • 缩放实验:先在小模型上验证数据配方与超参,再外推到目标规模。
  • 分布式训练:数据并行、张量并行、流水线并行的配置与调优。
  • 训练稳定性:处理 loss 尖峰、梯度爆炸、数值溢出、节点故障后的续训。
  • 评测:在通用基准与内部评测集上跟踪基座能力。

这个岗位的压力有其特殊性:一次训练跑几周、成本高昂,中途发现配方有问题往往无法回头。

所以决策前的小规模验证做得是否扎实,比训练时的操作更关键。

展开看完整的工作内容与协作对象 →

预训练工程师技能树

  1. 阶段 1

    入门必备

    大致对应 0-12 个月经验
    • Transformer 与训练基础 结构、优化器、学习率调度、混合精度。
    • PyTorch 熟练使用 能独立实现并调试训练流程。
    • Linux 与集群操作 多机多卡环境的日常排障。
    • 严谨性 一个配置错误可能浪费数周算力。
  2. 阶段 2

    进阶

    大致对应 12-36 个月经验
    • 分布式并行策略 数据/张量/流水线并行的配置与取舍。
    • 大规模数据管线 TB 级语料的清洗、去重与质量过滤。
    • 性能剖析与调优 定位通信、显存与计算利用率瓶颈。
    • 缩放实验设计 用小模型实验回答大模型问题。
  3. 阶段 3

    资深

    大致对应 36+ 个月经验
    • 数据配方设计 不同来源语料的配比及其对能力的影响。
    • 训练稳定性攻坚 loss 尖峰、数值溢出、故障续训的处理。
    • 基座评测体系 建立能反映真实能力的内部评测。
    • 技术决策 在高成本不可回头的训练前做出取舍。

预训练要求的是「深度学习功底 + 系统工程能力」的组合,两者缺一都撑不住一次真实的大规模训练。

硬技能

  • 深度学习基础:Transformer 结构、优化器、学习率调度、混合精度训练。
  • 分布式训练框架:数据 / 张量 / 流水线并行的原理与实际配置。
  • 大规模数据处理:TB 级语料的清洗、去重与质量评估管线。
  • 性能剖析:定位通信瓶颈、显存瓶颈、计算利用率问题。
  • Linux 与集群操作:多机多卡环境的日常排障。

软技能与背景

  • 实验设计能力:用小规模实验回答大规模问题,这是这个岗位的核心方法论。
  • 严谨与耐心:一个配置错误可能浪费数周算力。
  • 学历背景:多数招聘要求硕士及以上,并看重相关论文或训练经验,具体以招聘公告为准。

这些能力里最难速成的是实验设计。

大规模训练不允许反复试错,所有关键决策都必须先在小模型上得到验证,再外推到目标规模。能不能设计出一组既省算力又能回答问题的实验,是资深与新手最直接的分野。

展开完整技能要求与学习顺序 →

预训练工程师发展前景与晋升路径

预训练是典型的「岗位少但不可替代」的位置。能做的人不多,做过完整基座训练的人更少,因此资深从业者在市场上相当稀缺。但也正因岗位集中在少数机构,选择面比应用层窄得多。

向上的路径

  • 预训练工程师 → 资深 / 技术专家 → 基座模型团队负责人。
  • 转研究方向:模型结构、训练方法本身的研究。

横向可转的方向

  • 转微调与对齐:同属训练链路,迁移成本最低。
  • 转推理优化 / AI Infra:分布式与性能调优经验直接可用。
  • 转应用层(RAG、Agent):技术上没有障碍,但会放弃稀缺性溢价。

需要正视的现实是行业集中度高:能持续做预训练的团队数量有限,团队方向调整时个人选择余地较小。

入行前建议了解清楚所在团队的算力保障与长期规划。

展开完整的晋升路径与转岗方向 →

预训练工程师面试常问什么

预训练岗的面试深度明显高于应用层,会追问原理细节和你实际踩过的坑。

高频问题

  • 训练中出现 loss 尖峰,你会怎么排查?
  • 数据配比怎么定?怎么验证一个配方比另一个好?
  • 张量并行和流水线并行分别解决什么问题?各自的代价是什么?
  • 你参与过的最大规模训练是多少卡、多少 token?

准备建议:最后一个问题几乎必问,如实回答规模并讲清楚你在其中负责哪一块。

没有大规模经验时,把小规模实验做扎实、能讲清楚方法论,同样有说服力。

关于预训练工程师,大家还会问

预训练工程师是什么岗位

预训练工程师负责用海量通用语料从零训练大模型的基座,也就是模型学会「预测下一个词」的那个阶段。日常工作包括语料清洗与配比设计、分词器训练、小规模缩放实验、分布式训练配置、训练稳定性处理和基座能力评测。

预训练和微调有什么区别

预训练造基座,用海量通用语料让模型获得基础语言与知识能力,成本极高;微调(SFT)在基座之上用指令数据教模型听懂并执行任务,成本低得多。再往后还有对齐阶段调整偏好与安全边界,然后才是 RAG、Agent 这些应用层。

做预训练需要什么条件

技术上需要深度学习功底加系统工程能力:Transformer 与训练原理、分布式并行策略、TB 级数据管线、性能剖析。现实条件上需要所在团队具备大规模算力——一次预训练往往需要成百上千张卡连续运行数周。多数招聘要求硕士及以上并看重训练经验。

预训练岗位好找吗

岗位数量少但从业者更少,资深者在市场上稀缺。代价是选择面窄:能持续做预训练的团队集中在少数公司和研究机构,团队方向调整时个人余地较小。入行前建议了解清楚团队的算力保障和长期规划。

看懂这个岗位之后,下一个问题是「我的简历对得上吗」

知道岗位做什么,和让 HR 从你的简历里看出你能做,是两件事。简历里的经历要按这个岗位的 JD(岗位要求)重新组织关键词,还得先过得了机器筛选。基础功能免费; 秋招冲刺包 ¥499:AI简历姬 1 年会员(简历诊断、JD 匹配优化、AI 模拟面试) + 1 次 1V1 深度语音求职指导 + 1 年微信答疑。

看秋招冲刺包 ¥499 只想先用 AI 工具?看会员方案

用于提升求职方向判断与准备效率,不承诺录用结果;不提供代投服务,不保证内推或 Offer。

内容说明:本页内容按公开资料整理并经人工复核,用于帮助了解岗位,不构成招聘承诺。薪资、行业数据只在能追溯到公开来源时展示,其余留空。具体岗位职责和要求,请以用人单位发布的招聘公告为准。

按岗位大类继续逛

同行业岗位