查看更多分享

小红书招聘大模型推理服务(MaaS)研发工程师/专家

招聘职位:

大模型推理服务(MaaS)研发工程师/专家 搜索同类职位
发布日期:
2026-08-08
工作地点:
  • 北京市,上海市,杭州市
职位类型:
全职
职位类别:
引擎
来源:
小红书官网
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
DirectLLM是小红书内部面向各业务场景建设的大模型API服务产品,通过标准化API接口提供LLM/MLLM等大模型推理服务,致力于为AI应用开发者提供品类丰富、数量众多的模型选择,并通过API接口为其提供开箱即用、能力卓越、成本经济的模型服务,各领域模型的能力均可通过统一的API和SDK来实现被不同业务系统集成。

核心职责
1、MaaS 平台架构与研发: 参与 MaaS 系统架构设计与研发,建设公司统一的大模型 API 服务入口。
2、模型服务治理能力建设: 负责模型接入、请求路由、鉴权、限流、配额、TPM / RPM、灰度发布、SLO、成本统计等核心能力。
3、请求调度与稳定性建设: 建设多模型、多租户、高并发场景下的请求调度与服务治理能力,提升模型服务稳定性和资源效率。
4、推理引擎与业务打通: 打通底层推理引擎与上层业务应用,为社区、搜索、审核、企效、AI 应用等场景提供开箱即用的大模型服务能力。
5、开发者体验优化: 持续优化统一 API、SDK、文档、监控、问题诊断和接入流程,提升内部 AI 应用开发效率。
6、成本与效率优化: 与推理、压缩、调度团队协同,持续优化模型调用成本、服务延迟和资源利用率。
任职要求:
任职要求
1、熟悉 Go / Java / Python / C++ 中至少一门语言,具备扎实的服务端研发能力。
2、有大规模分布式系统、高并发 API 网关、服务治理、流控限流、鉴权、多租户系统等相关经验。
3、能对复杂业务问题进行系统建模和抽象,具备良好的稳定性、可观测性和工程质量意识。
4、了解大模型推理服务基本链路,对模型部署、请求调度、服务高可用、SLO 保障等有基本认知。
5、具备良好的沟通协作能力,能与推理框架、平台、算法和业务团队协同推进项目落地。
加分项
1、有 LLM / MLLM 模型服务平台、MaaS 平台、API 网关、云服务平台开发经验。
2、熟悉 vLLM、SGLang、TensorRT-LLM 等大模型推理框架,有模型推理部署或优化经验。
3、熟悉 Kubernetes、服务发现、负载均衡、弹性扩缩容、限流熔断、灰度发布等服务治理能力。
4、有面向开发者的平台产品建设经验,理解 API、SDK、文档、接入体验对平台效率的影响。
5、有成本治理、资源调度、请求路由、模型路由相关经验优先。
免责声明:

此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 小红书招聘常见问答

小红书招聘工作地点:
北京市,上海市,杭州市
小红书招聘经验要求:
no_limit