哔哩哔哩(bilibili|b站)招聘bilibili-音视频理解算法工程师
招聘职位:
bilibili-音视频理解算法工程师 搜索同类职位
岗位介绍:
职位描述
工作职责:
1. 负责大规模GPU集群的管理与训练系统建设,包括任务调度、资源管理、训练框架适配与性能优化。
2. 解决超大规模训练任务中出现的稳定性、网络通讯、NCCL通讯、断点恢复等问题,构建训练全链路可观测体系。
3. 针对不同GPU型号,进行算子适配和算子调优,实现慢节点自动检测与故障自愈。
4. 针对不同训练场景、集群环境,设计自动化运维工具,持续优化训练方案与GPU有效利用率。
5. 与算法、数据、平台紧密配合,打造一套高效的训练生态,推动训练成本优化。
工作要求:
工作要求
1. 精通C++、Rust、Python等任意一门语言,C++更佳,具备良好的系统设计与工程实现能力。
2. 熟悉Megatron、DeepSpeed、PyTorch、FSDP等一种或者多种训练框架的底层原理。
3. 有真实GPU训练任务调优经验,解决过训练中出现过的慢节点、机器故障、网络拥塞等问题。
4. 在大规模训练任务中,有过算子调优、精度验证、CUDA优化、训练策略优化(ZeRO/TP/PP/DP/EP)等经验。
5. 有RDMA网络、高性能存储、NCCL通讯等方面的经验,熟悉Linux系统编程。
加分项
1. 社区开源训推框架贡献者,包括但不限于Megatron、DeepSpeed、SGLang、vLLM等;
2. 有大规模音视频生成与理解模型的训练/推理优化经验,如视频生成、多模态理解等方向;
3. 有大规模MoE(Mixture of Experts)与Diffusion Transformer(DiT)模型的训练性能优化、显存优化、通信优化等实战经验;
4. 有千卡/万卡GPU任务训推经验, 有H卡、B卡针对性调优经验
投递简历
职位描述
工作职责:
1. 负责大规模GPU集群的管理与训练系统建设,包括任务调度、资源管理、训练框架适配与性能优化。
2. 解决超大规模训练任务中出现的稳定性、网络通讯、NCCL通讯、断点恢复等问题,构建训练全链路可观测体系。
3. 针对不同GPU型号,进行算子适配和算子调优,实现慢节点自动检测与故障自愈。
4. 针对不同训练场景、集群环境,设计自动化运维工具,持续优化训练方案与GPU有效利用率。
5. 与算法、数据、平台紧密配合,打造一套高效的训练生态,推动训练成本优化。
工作要求:
工作要求
1. 精通C++、Rust、Python等任意一门语言,C++更佳,具备良好的系统设计与工程实现能力。
2. 熟悉Megatron、DeepSpeed、PyTorch、FSDP等一种或者多种训练框架的底层原理。
3. 有真实GPU训练任务调优经验,解决过训练中出现过的慢节点、机器故障、网络拥塞等问题。
4. 在大规模训练任务中,有过算子调优、精度验证、CUDA优化、训练策略优化(ZeRO/TP/PP/DP/EP)等经验。
5. 有RDMA网络、高性能存储、NCCL通讯等方面的经验,熟悉Linux系统编程。
加分项
1. 社区开源训推框架贡献者,包括但不限于Megatron、DeepSpeed、SGLang、vLLM等;
2. 有大规模音视频生成与理解模型的训练/推理优化经验,如视频生成、多模态理解等方向;
3. 有大规模MoE(Mixture of Experts)与Diffusion Transformer(DiT)模型的训练性能优化、显存优化、通信优化等实战经验;
4. 有千卡/万卡GPU任务训推经验, 有H卡、B卡针对性调优经验
投递简历
免责声明:
此信息由b站官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“b站官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!