腾讯(tencent)招聘AI Infra SRE工程师(深圳/北京)
招聘职位:
AI Infra SRE工程师(深圳/北京) 搜索同类职位
岗位职责:
1.负责超大规模通用大模型服务的 SRE 体系建设,保障 AI 平台在高并发、高吞吐、复杂异构资源环境下的稳定性、可用性与服务质量;
2.负责 AI Infra 监控、可观测性、告警治理与自动化运维平台建设,构建覆盖 GPU、网络、存储、推理链路与模型服务全生命周期的智能运维体系;
3.负责线上故障快速定位、应急响应与稳定性治理,建立标准化应急预案、故障复盘与根因分析机制,持续提升系统韧性与业务连续性;
4.参与大模型训练与推理平台的部署、调优与自动化能力建设,推动 LLMOps / MLOps 工程化体系落地,提升平台交付效率与稳定性;
5.深入分析系统瓶颈与容量热点,通过数据驱动方式识别稳定性风险与性能短板,持续推动架构优化与平台演进;
6.负责 GPU / CPU / 网络 / 存储等资源利用率治理,推进模型推理加速、弹性调度与成本优化,持续提升资源效率与 ROI;
7.跟踪业界 AI 硬件与 Infra 技术演进(GPU、网络、存储、推理框架等),结合业务场景推动基础设施选型、架构升级与技术创新;
8.探索 AI Native SRE、智能 OnCall、AIOps、Agentic 运维等前沿方向,推动运维体系向智能化、自愈化与自治化演进。
岗位要求:
1.计算机、软件工程、网络工程等相关专业本科及以上学历,具备 3 年及以上大型互联网或 AI Infra 运维 / SRE 经验;
2.熟悉 Linux 操作系统原理,具备扎实的网络、存储、系统调优与分布式系统基础;
3.熟练掌握至少一种编程语言(Python / Go 优先),具备自动化平台、运维工具以及AI Coding 工具开发经验;
4.熟悉 Kubernetes、Docker、微服务架构及云原生技术体系,具备大规模容器平台运维经验;
5.熟悉 LLM、大模型训练 / 推理流程、AI Infra、LLMOps / MLOps 相关技术栈,理解模型服务链路与推理架构;
6.具备较强的性能分析、容量规划与故障排查能力,能够在复杂场景下快速定位并解决系统问题;
7.具备资源治理与成本优化意识,能够围绕 GPU 利用率、推理吞吐、时延与成本进行系统化优化;
8.具备优秀的跨团队协作与沟通能力,能够推动架构、平台、算法与业务团队高效协同;
9.对 AI Infra、云原生、大模型工程体系及前沿技术保持持续关注,具备快速学习与技术创新能力。
岗位介绍:
在腾讯,优秀的技术运营工程师始终赋能业务,关注技术运营的质量、成本、效率和安全。他们不仅是经验丰富的问题解决者,更是具有全局视角的架构师,通过自动化工具的建设,强力提升平台效能,助力业务发展。
1.负责超大规模通用大模型服务的 SRE 体系建设,保障 AI 平台在高并发、高吞吐、复杂异构资源环境下的稳定性、可用性与服务质量;
2.负责 AI Infra 监控、可观测性、告警治理与自动化运维平台建设,构建覆盖 GPU、网络、存储、推理链路与模型服务全生命周期的智能运维体系;
3.负责线上故障快速定位、应急响应与稳定性治理,建立标准化应急预案、故障复盘与根因分析机制,持续提升系统韧性与业务连续性;
4.参与大模型训练与推理平台的部署、调优与自动化能力建设,推动 LLMOps / MLOps 工程化体系落地,提升平台交付效率与稳定性;
5.深入分析系统瓶颈与容量热点,通过数据驱动方式识别稳定性风险与性能短板,持续推动架构优化与平台演进;
6.负责 GPU / CPU / 网络 / 存储等资源利用率治理,推进模型推理加速、弹性调度与成本优化,持续提升资源效率与 ROI;
7.跟踪业界 AI 硬件与 Infra 技术演进(GPU、网络、存储、推理框架等),结合业务场景推动基础设施选型、架构升级与技术创新;
8.探索 AI Native SRE、智能 OnCall、AIOps、Agentic 运维等前沿方向,推动运维体系向智能化、自愈化与自治化演进。
岗位要求:
1.计算机、软件工程、网络工程等相关专业本科及以上学历,具备 3 年及以上大型互联网或 AI Infra 运维 / SRE 经验;
2.熟悉 Linux 操作系统原理,具备扎实的网络、存储、系统调优与分布式系统基础;
3.熟练掌握至少一种编程语言(Python / Go 优先),具备自动化平台、运维工具以及AI Coding 工具开发经验;
4.熟悉 Kubernetes、Docker、微服务架构及云原生技术体系,具备大规模容器平台运维经验;
5.熟悉 LLM、大模型训练 / 推理流程、AI Infra、LLMOps / MLOps 相关技术栈,理解模型服务链路与推理架构;
6.具备较强的性能分析、容量规划与故障排查能力,能够在复杂场景下快速定位并解决系统问题;
7.具备资源治理与成本优化意识,能够围绕 GPU 利用率、推理吞吐、时延与成本进行系统化优化;
8.具备优秀的跨团队协作与沟通能力,能够推动架构、平台、算法与业务团队高效协同;
9.对 AI Infra、云原生、大模型工程体系及前沿技术保持持续关注,具备快速学习与技术创新能力。
岗位介绍:
在腾讯,优秀的技术运营工程师始终赋能业务,关注技术运营的质量、成本、效率和安全。他们不仅是经验丰富的问题解决者,更是具有全局视角的架构师,通过自动化工具的建设,强力提升平台效能,助力业务发展。
免责声明:
此信息由腾讯官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“腾讯官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!