腾讯(tencent)招聘混元大模型中台研发负责人(北京/深圳)
招聘职位:
混元大模型中台研发负责人(北京/深圳) 搜索同类职位
岗位职责:
1.负责中台整体技术架构与技术方案规划落地,覆盖数据、预训练、后训练、评测四条核心链路,界定中台与底层算力调度、高性能网络、分布式存储的能力边界,推进技术栈收敛;负责团队组建与技术梯队建设,主导跨团队技术决策;
2.负责数据基座建设,包括训练数据流水线、数据集与元数据管理、支持数据发版机制、样本级血缘与去重、数据质检与合版流程;
3.协同负责分布式数据存储与计算体系,规划 Ceph、CFS、HDFS 多套存储的分层使用与冷热治理,优化并行文件系统在大规模并发训练下的读取路径与吞吐,基于 Spark、Ray Data 构建数据处理算子编排与跨地域数据搬迁链路;
4.负责大规模分布式训练的性能与稳定性工程,对有效训练时间占比负责。参与 DP/TP/PP/EP 并行切分方案设计与通信计算重叠优化,定位通信、数据读取、显存与算子层瓶颈;协同建设慢节点检测、GPU XID 与 SDC 识别、异步分片 checkpoint、弹性伸缩下的状态恢复与自动续训;
5.负责训练工程链路的抽象与平台化,包括任务建模与参数配置分离、镜像与依赖版本管理、作业生命周期管理、实验记录与产物版本管理、伴生任务;
6.负责后训练链路的工程支撑,包括 SFT、RL 等后训练的全流程平台化,包含但不限于 Rollout 与 Train 的资源编排与权重同步,Reward 与 Verifier 服务的吞吐与容错,工具沙箱与环境管理,长轨迹样本的存储与回放;
7.负责模型评测的整体工程链路,支持各类模型的部署与评测,包括评测集与集合的资产化管理、评测任务调度与结果溯源、多形态评估引擎(RM、多模态、Code、Function Call、Agent 轨迹)的工程接入;了解主流推理引擎的工程实现与适配;
8.制定技术规范与研发流程,建立工程设计评审、发布门禁、故障复盘与值班机制,为整体工程质量负责。
岗位要求:
1.计算机、软件工程、人工智能等相关专业本科及以上学历,5 年以上软件研发经验;
2.主导过大型 AI 平台、机器学习平台或数据平台从架构定义到规模化落地的完整过程,所建系统被平台之外的多个团队长期使用;
3.熟悉 Kubernetes 及云原生生态,理解 Volcano、Ray 等批量与 gang scheduling 系统的调度模型与适用边界;熟悉并行文件系统的 IO 特征与可观测性体系;
4.具备大规模数据存储与处理经验,熟悉对象存储、并行文件系统与 HDFS 的适用场景,掌握 Spark 或 Ray 的分布式数据处理机制,理解列式存储与训练样本格式转换的工程约束;
5.理解 GPU 服务器、NVLink/NVSwitch、具备多机通信排障与性能分析能力,熟练使用 PyTorch Profiler 等观测工具;
6.掌握 PyTorch 与 Megatron-LM、FSDP 等并行训练框架的实现机制,理解混合精度、重计算、序列并行、MoE 路由与专家并行的工程约束;
7.熟悉大模型研发全流程,理解各训练阶段的数据形态、资源特征与失败模式;具备在既有基础设施之上构建抽象层的经验,能说明能力边界的划分依据与取舍过程;
8.具备矩阵型组织中的技术决策与推动能力,以平台能力的实际使用规模与效率提升衡量交付成果。
加分项:
1.有万卡级训练集群建设或运营经验,或异构算力适配与统一调度经验;
2.有 RL 训练链路工程化经验,包括训推混部编排、权重同步、工具沙箱环境管理;
3.有大模型评测体系、数据血缘或元数据管理系统的建设经验;
4.主导过多平台整合、技术栈收敛或大规模系统迁移;
5.在 PyTorch、Megatron-LM、vLLM、SGLang、Ray、Kubernetes 生态有代码贡献,或在 MLSys、OSDI、NSDI 等会议有论文发表。
岗位介绍:
在腾讯,技术人解决问题的激情永不熄灭。无论是面对产品、程序的问题,还是生活与人的问题,腾讯技术人都力图交出漂亮的答卷。我们善用科学工具,以强大的思维之力创造世界,为卓越的产品体验保驾护航,也为公司和产品策略提出宝贵的洞见,用技术引领新的变革。这里的每位成员,既传承着长久以来的务实文化,又时刻以创新眼光瞄准大海星辰。我们十分期待你加入这样一个「技术社区」,分享团队能量,尽情发挥所长。
1.负责中台整体技术架构与技术方案规划落地,覆盖数据、预训练、后训练、评测四条核心链路,界定中台与底层算力调度、高性能网络、分布式存储的能力边界,推进技术栈收敛;负责团队组建与技术梯队建设,主导跨团队技术决策;
2.负责数据基座建设,包括训练数据流水线、数据集与元数据管理、支持数据发版机制、样本级血缘与去重、数据质检与合版流程;
3.协同负责分布式数据存储与计算体系,规划 Ceph、CFS、HDFS 多套存储的分层使用与冷热治理,优化并行文件系统在大规模并发训练下的读取路径与吞吐,基于 Spark、Ray Data 构建数据处理算子编排与跨地域数据搬迁链路;
4.负责大规模分布式训练的性能与稳定性工程,对有效训练时间占比负责。参与 DP/TP/PP/EP 并行切分方案设计与通信计算重叠优化,定位通信、数据读取、显存与算子层瓶颈;协同建设慢节点检测、GPU XID 与 SDC 识别、异步分片 checkpoint、弹性伸缩下的状态恢复与自动续训;
5.负责训练工程链路的抽象与平台化,包括任务建模与参数配置分离、镜像与依赖版本管理、作业生命周期管理、实验记录与产物版本管理、伴生任务;
6.负责后训练链路的工程支撑,包括 SFT、RL 等后训练的全流程平台化,包含但不限于 Rollout 与 Train 的资源编排与权重同步,Reward 与 Verifier 服务的吞吐与容错,工具沙箱与环境管理,长轨迹样本的存储与回放;
7.负责模型评测的整体工程链路,支持各类模型的部署与评测,包括评测集与集合的资产化管理、评测任务调度与结果溯源、多形态评估引擎(RM、多模态、Code、Function Call、Agent 轨迹)的工程接入;了解主流推理引擎的工程实现与适配;
8.制定技术规范与研发流程,建立工程设计评审、发布门禁、故障复盘与值班机制,为整体工程质量负责。
岗位要求:
1.计算机、软件工程、人工智能等相关专业本科及以上学历,5 年以上软件研发经验;
2.主导过大型 AI 平台、机器学习平台或数据平台从架构定义到规模化落地的完整过程,所建系统被平台之外的多个团队长期使用;
3.熟悉 Kubernetes 及云原生生态,理解 Volcano、Ray 等批量与 gang scheduling 系统的调度模型与适用边界;熟悉并行文件系统的 IO 特征与可观测性体系;
4.具备大规模数据存储与处理经验,熟悉对象存储、并行文件系统与 HDFS 的适用场景,掌握 Spark 或 Ray 的分布式数据处理机制,理解列式存储与训练样本格式转换的工程约束;
5.理解 GPU 服务器、NVLink/NVSwitch、具备多机通信排障与性能分析能力,熟练使用 PyTorch Profiler 等观测工具;
6.掌握 PyTorch 与 Megatron-LM、FSDP 等并行训练框架的实现机制,理解混合精度、重计算、序列并行、MoE 路由与专家并行的工程约束;
7.熟悉大模型研发全流程,理解各训练阶段的数据形态、资源特征与失败模式;具备在既有基础设施之上构建抽象层的经验,能说明能力边界的划分依据与取舍过程;
8.具备矩阵型组织中的技术决策与推动能力,以平台能力的实际使用规模与效率提升衡量交付成果。
加分项:
1.有万卡级训练集群建设或运营经验,或异构算力适配与统一调度经验;
2.有 RL 训练链路工程化经验,包括训推混部编排、权重同步、工具沙箱环境管理;
3.有大模型评测体系、数据血缘或元数据管理系统的建设经验;
4.主导过多平台整合、技术栈收敛或大规模系统迁移;
5.在 PyTorch、Megatron-LM、vLLM、SGLang、Ray、Kubernetes 生态有代码贡献,或在 MLSys、OSDI、NSDI 等会议有论文发表。
岗位介绍:
在腾讯,技术人解决问题的激情永不熄灭。无论是面对产品、程序的问题,还是生活与人的问题,腾讯技术人都力图交出漂亮的答卷。我们善用科学工具,以强大的思维之力创造世界,为卓越的产品体验保驾护航,也为公司和产品策略提出宝贵的洞见,用技术引领新的变革。这里的每位成员,既传承着长久以来的务实文化,又时刻以创新眼光瞄准大海星辰。我们十分期待你加入这样一个「技术社区」,分享团队能量,尽情发挥所长。
免责声明:
此信息由腾讯官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“腾讯官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!