查看更多分享

小红书(xiaohongshu)招聘【Dots】大模型算子优化工程师

招聘职位:

【Dots】大模型算子优化工程师 搜索同类职位
发布日期:
2026-07-28
工作地点:
职位类型:
全职
职位类别:
机器学习平台
来源:
小红书官网
岗位职责:
面向大模型训练/推理场景,开发和优化高性能 GPU 算子(Attention、GEMM、LayerNorm、MoE、Element-wise 等),逼近硬件理论峰值
针对新模型结构(长 context、MoE、线性 Attention 等)设计定制化 kernel,解决原生框架无法覆盖的性能瓶颈
深度优化访存效率、计算-访存重叠、算子融合(fusion),降低 kernel launch 开销与显存占用
参与推理引擎核心链路优化:KV Cache 管理、量化算子(INT8/FP8/INT4)、投机采样、continuous batching 等
与训练框架、模型算法团队紧密协作,将算法需求转化为高效的系统实现
探索新硬件(新一代 GPU / 国产算力)上的算子适配与性能调优
任职要求:
基础要求
扎实的 CUDA 编程能力,深入理解 GPU 体系结构(SM、warp、shared memory、tensor core、访存层级)
熟悉性能分析工具(Nsight Compute/Systems、nvprof),能定位并解决计算/访存瓶颈
熟悉至少一种主流训练或推理框架(Megatron-LM、vLLM、SGLang、TensorRT-LLM、FlashInfer 等)
理解 Transformer 结构及其在训练/推理中的计算特征

加分项:
有 FlashAttention / Fle Attention 等前沿算子的复现或改进经验
熟悉 Triton、CUTLASS,能高效开发模板化 kernel
有 FP8 / 低比特量化算子落地经验
有 MoE、长序列、投机解码等新场景的算子优化实战
熟悉 NCCL / 通信算子优化,理解计算-通信 overlap
有开源贡献(vLLM / SGLang / Triton / PyTorch 等)或顶会论文(MLSys、OSDI、ASPLOS 等)

我们看重的特质
对性能有极致追求,看到 GPU 利用率不满就浑身难受
系统性思维,能在算法、框架、硬件三层之间自由穿梭
主动性强,能从模型需求反推系统设计,而不是被动接需求
免责声明:

此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 小红书(xiaohongshu)招聘常见问答

小红书(xiaohongshu)招聘工作地点:
北京市,上海市,杭州市
小红书(xiaohongshu)招聘经验要求:
no_limit