查看更多分享

美团(meituan)招聘视觉生成基座算法专家

招聘职位:

视觉生成基座算法专家 搜索同类职位
发布日期:
2026-08-10
工作地点:
  • 北京市
职位类型:
全职
职位类别:
技术类算法
来源:
美团官网
部门介绍:
基础研发平台是美团的核心技术平台,立足于“零售+科技”的战略定位,通过打造人工智能、大数据、云计算、安全等核心技术能力,以及研发效能平台、企业应用平台等公共服务,为业务提供稳定安全、扩展易用、技术领先的平台技术和产品服务。
在这里,我们会参与到最前沿的技术研发和探索;能够接触超规模集群、海量数据,挑战高复杂业务场景,有机会与业界一流的工程师一起并肩前行。
在这里,我们有超强的技术氛围,持续向社区贡献业界实践,加速行业技术发展;我们有完善的互联网学习生态圈,重视底层逻辑和方法论,助力职业生涯的非线性成长。
真诚地邀请你,和我们一起驱动技术发展,创造行业价值。
岗位职责:
负责视觉生成基座模型及应用的整体研发工作,面向图像生成、视频生成及音视频生成等全模态生成场景,构建行业先进的通用视觉生成能力。主要工作包括但不限于:

1. 视觉全模态生成基座模型:设计和优化适用于图像、视频、音视频等多模态场景的统一生成基座模型架构;开展多模态、多任务联合训练与对齐(如图文、视听、动作等),提升模型的通用性与泛化能力;针对不同应用场景(如图像视频内容生成与编辑等)进行模型能力扩展与定制化优化。

2. 高效图像/视频Autoencoder与Tokenizer:研发高效压缩比、低失真度的图像/视频Autoencoder、Tokenizer 等表征模型,支持大规模训练与高吞吐推理;探索适用于长视频、多视角视频等场景的结构化表征方式(如时空Token、分层编码等),平衡压缩率与生成质量。

3. 高效生成与下一代生成架构探索:研究和实现高效的生成范式,包括但不限于扩散模型、自回归模型等,并在大规模数据与大模型场景下优化训练与推理效率;探索稀疏架构、MoE(Mixture-of-Experts)等新型大模型结构,提高模型参数利用率与可扩展性;针对不同延迟与成本要求,设计分级推理与加速方案(如多阶段生成、粗到细生成、裁剪与蒸馏等)。

4. 面向世界模型(World Model)的长视频与实时生成:探索对复杂时空动态、因果关系与交互逻辑的建模方法,支撑长时长视频、连续场景生成;研发支持长视频叙事、一致角色与连贯环境的生成技术,解决长时依赖建模、记忆与控制等难题;构建低延迟、高稳定性的实时生成方案,支持交互式生成、实时驱动内容(如游戏、虚拟人、直播增强等)应用。
任职要求:
1. 熟练掌握模式识别和计算机视觉领域的基础理论和方法,在一个或多个领域有深入研究:扩散模型、图像/视频生成与编辑、跨模态理解与生成、大规模数据处理与训练等。

2. 在机器学习和深度学习方面具备扎实的理论基础和工程能力,熟悉Pytorch等主流框架。

3. 优秀的分析和解决问题的能力,项目推动力和团队协作能力。
岗位亮点:
1. 以公司实际业务为依托,有完善的技术转化和落地机制。

2. 场景全覆盖,视觉技术方向的选择空间大。

3. 注重技术创新,关注前沿技术。
免责声明:

此信息由美团官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“美团官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 美团(meituan)招聘常见问答

美团(meituan)招聘工作地点:
北京市
美团(meituan)招聘经验要求:
3年