查看更多分享

腾讯(tencent)招聘混元视频感知与理解算法研究员(北京/上海)(深圳)

招聘职位:

混元视频感知与理解算法研究员(北京/上海)(深圳) 搜索同类职位
发布日期:
2026-08-25
工作地点:
  • 北京
职位类型:
全职
职位类别:
技术
来源:
腾讯官网
岗位职责:
1.主导视频能力建设:负责多模态大语言模型(VLM)的视频感知与理解能力研发,围绕视频数据、训练方法与评测体系开展系统性建设,持续提升模型对动态视觉世界的理解能力与能力上限;
2.攻坚视频基础理解:聚焦视频中的时序、运动、事件、行为及空间关系等核心能力,提升模型对复杂动态场景、细粒度视觉信息及长程上下文的感知和理解能力;
3.提升复杂视频推理:探索面向视频场景的多步推理、时空推理、因果推理及组合推理能力,研究视频信息与大语言模型推理能力的深度融合,提升模型解决复杂视频任务的泛化能力;
4.建设视频评测与数据飞轮:建立系统化的视频能力评测体系,持续分析模型能力边界与核心 Badcase,形成“评测—数据—训练—验证”的研发闭环,驱动模型能力持续迭代;
5.推进视频全流程研发:负责视频方向的 预训练、中训练、后训练的数据生产,开展SFT、强化学习等后训练算法研发,建设高质量视频训练数据及自动化数据生产流程,探索更高效的视频能力学习与对齐方法。
岗位要求:
1.计算机视觉、人工智能、机器学习等相关方向硕士及以上学历,具备扎实的深度学习基础;
2.在视频理解、多模态大模型、视觉语言模型或相关方向具有研究或研发经验;
3.熟悉 Transformer、LLM、VLM 等模型架构,对多模态模型训练及后训练方法有较深入理解;
4.具备较强的算法研究、实验分析与工程实现能力,能够独立推动研究问题从定义到落地;
5.对多模态基础模型及视频智能方向有强烈兴趣,具备持续探索前沿问题的研究热情。
加分项:
1.有大规模 VLM / Video-LMM 训练或后训练经验;
2.有 SFT、RLHF、PPO、GRPO 等强化学习或大模型对齐经验;
3.在 CVPR、ICCV、ECCV、NeurIPS、ICLR、ACL、EMNLP 等顶级会议发表过相关工作;
4.有高质量开源项目、大规模视频数据建设或多模态评测体系经验;
5.有 Agentic Vision、长视频理解或多模态复杂推理相关研究经验。
免责声明:

此信息由腾讯官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“腾讯官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 腾讯(tencent)招聘常见问答

腾讯(tencent)招聘工作地点:
北京
腾讯(tencent)招聘经验要求:
三年以上工作经验