小红书(xiaohongshu)招聘【Dots】多模理解-视觉语言大模型研究员
招聘职位:
【Dots】多模理解-视觉语言大模型研究员 搜索同类职位
岗位职责:
团队介绍
做多模态的人通常有两种:一种是把各种模态「拼」在一起,一种是真的想搞清楚不同模态之间的关系,我们是后者。从视觉理解,到视觉+语音联合感知,到生成与理解统一——我们在挑战的不是某一个模态的单点能力,是整个「理解-生成-统一」的链条,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。
岗位职责:参与视觉语言大模型的研发工作,负责下属事项至少一项或若干
VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建
VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式;
VLM Post Train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法
生成理解统一:探索生成理解统一架构,同时提升理解和生成能力
任职要求:
任职要求
本科及以上学历,计算机等相关专业优化;
熟练掌握代码的阅读和编写技术,熟练使用 agentic ai 能力;在 python 和 pytroch 技术栈上有过深入实践
在视觉领域有过深入的实践和理解,有一定深度的专业认知和见解
具备良好的科学研发习惯、问题定义能力和对细节的敏锐度
团队介绍
做多模态的人通常有两种:一种是把各种模态「拼」在一起,一种是真的想搞清楚不同模态之间的关系,我们是后者。从视觉理解,到视觉+语音联合感知,到生成与理解统一——我们在挑战的不是某一个模态的单点能力,是整个「理解-生成-统一」的链条,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。
岗位职责:参与视觉语言大模型的研发工作,负责下属事项至少一项或若干
VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建
VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式;
VLM Post Train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法
生成理解统一:探索生成理解统一架构,同时提升理解和生成能力
任职要求:
任职要求
本科及以上学历,计算机等相关专业优化;
熟练掌握代码的阅读和编写技术,熟练使用 agentic ai 能力;在 python 和 pytroch 技术栈上有过深入实践
在视觉领域有过深入的实践和理解,有一定深度的专业认知和见解
具备良好的科学研发习惯、问题定义能力和对细节的敏锐度
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!