查看更多分享

哔哩哔哩(bilibili|b站)招聘AIGC创作者运营

招聘职位:

AIGC创作者运营 搜索同类职位
发布日期:
2026-07-23
工作地点:
职位类型:
全职
职位类别:
全职
来源:
b站官网
岗位介绍:
职位描述

工作职责:
围绕自研大模型训推一体化平台,独立负责以下一个或多个方向的架构设计与落地:
1.大规模预训练资源调度 设计 GPU 万卡级集群调度系统,支持拓扑感知、跨机房调度与多租户配额; 基于 K8s/Volcano 等构建调度内核,训练任务排队、抢占、弹性调度,持续提升集群 GPU 利用率; 拓扑感知放置(NVLink/IB)与跨机房/跨可用区调度,最小化跨交换机通信开销; 通信与存储 IO 路径优化,配合训练框架提升端到端通信效率
2.自动故障检测与恢复:构建训练全链路健康监测与自愈闭环,最小化故障对训练进度的影响。训练全链路健康监测:NCCL hang、GPU Xid、网络抖动、存储异常的自动检测Checkpoint 自动管理 + 断点续训,故障迁移后快速恢复 故障自愈闭环:检测 → 诊断 → 迁移 → 恢复,沉淀故障知识库与回溯能力
3.模型训推 DevOps 打通"代码→镜像→训练→产物→上线"全流程,构建训推一体化交付闭环。 镜像与产物治理:训练/推理基础镜像标准化,模型权重与 Checkpoint 版本化 registry,统一 artifacts 生命周期管理 CI/CD 与发布:训练代码与推理服务持续集成(镜像构建/单测/自动评测),推理灰度发布、回滚、A-B 流量切换 可观测与稳定性:训练任务与推理服务的指标/日志/链路监控,SLI/SLO 与告警闭环,故障注入与应急演练
工作要求:
任职要求
1.本科及以上,5 年以上 Infra / 平台工程经验,能独立负责一个技术方向的架构与落地
2.精通 Go 或 Python,深入理解 K8s 生态与 Operator 模式
3.理解分布式训练(DDP/Pipeline/MoE)或大模型推理 Serving 架构
4.GPU 集群调度、训练框架、推理引擎至少其一有深度实战经验
5.熟悉 NCCL / IB / RDMA 等高性能网络

加分项
1.万卡级预训练平台或大规模推理平台 0→1 建设经验
2.拓扑感知调度、训练故障自愈、推理分离架构其一有落地经验
3.开源社区贡献(Megatron / Volcano / Ray / vLLM / SGLang 等)

投递简历
免责声明:

此信息由b站官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“b站官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 哔哩哔哩(bilibili|b站)招聘常见问答

哔哩哔哩(bilibili|b站)招聘工作地点:
上海