查看更多分享

小红书招聘大模型训练框架研发工程师/专家

招聘职位:

大模型训练框架研发工程师/专家 搜索同类职位
发布日期:
2026-08-02
工作地点:
职位类型:
全职
职位类别:
引擎
来源:
小红书官网
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!

工作职责:
RL 后训练框架研发: 负责 Relax RL 后训练框架的核心研发,支持 SFT、DPO、PPO、GRPO、RLVR 等主流后训练范式,持续追踪并落地前沿算法。
RL Pipeline 优化: 设计高效的 RL 训练 Pipeline,优化 Rollout、Reward Model、Actor、Reference Model 等模块间的资源调度与动态协同,提升端到端训练吞吐。
分布式训练优化: 基于 Megatron、DeepSpeed、veRL 等框架,针对 RL 场景调优 TP / PP / DP / ZeRO / Sequence Parallel 等并行策略,在性能、显存与稳定性之间取得最优平衡。
千卡训练稳定性建设: 攻克大规模训练中的显存管理、跨节点通信、弹性容错、任务调度与数据流转等核心挑战,提升训练成功率与集群资源利用率。
异构芯片训练适配: 负责训练框架在国产异构计算芯片(昇腾 / PPU 等)上的适配与优化,完成模型迁移、算子支持、框架适配、Profiling 与 Kernel 调优,推动国产算力在训练场景的规模化使用。
后训练工具链建设: 构建端到端后训练工具链,打通训练框架与 MLOps 平台,提供训练可视化、自动超参搜索、故障诊断等生产级能力,降低算法团队使用门槛。
业务协同与算法探索: 与算法团队紧密协作,支撑 LLM / MLLM / Agent 等业务方向在 SFT 与 RL 领域的算法探索与工程落地。
任职要求:
任职资格:
精通 PyTorch,具备训练框架源码级阅读与修改能力,有实际性能优化经验。
熟练掌握 Megatron、DeepSpeed、veRL、OpenRLHF、TRL、Llama-Factory 中至少一种框架的使用与二次开发。
理解分布式训练核心技术,包括 TP、PP、DP、ZeRO、序列并行、梯度累积、混合精度训练等。
熟悉 RLHF、DPO、PPO、GRPO 等大模型后训练流程,有实际训练调优或框架开发经验优先。
具备模型训练性能分析经验,能借助 Nsight Systems / Compute、nvprof、PyTorch Profiler 等工具定位训练性能瓶颈。
具备良好的工程实现能力、沟通协作能力和问题闭环意识。
加分项:
有千卡级大模型训练或后训练实战经验,成功解决过跨节点通信、容错训练、显存优化、训练稳定性等生产级问题。
熟悉 NCCL / RDMA / InfiniBand / RoCE 等高性能网络通信机制,能独立定位跨机通信瓶颈。
有 CUDA Kernel 开发经验,如 Fused Operator、FlashAttention、通信计算重叠(Overlap)等性能优化。
有国产异构芯片(昇腾 Ascend、平头哥 PPU)训练适配或 Kernel 开发经验,熟悉 CANN / ROCm 等基础软件栈;有大模型在国产芯片上规模化落地实战经验者优先。
深入理解 GPU / NPU 硬件架构(Tensor Core、内存层级、计算单元、通信拓扑),能结合硬件特性进行差异化训练优化方案设计。
参与过 Megatron、DeepSpeed、veRL、OpenRLHF、TRL 等开源项目的核心模块开发或贡献。
在大模型训练、分布式系统或 MLSys 方向有高水平学术论文发表。
免责声明:

此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!