查看更多分享

哔哩哔哩(bilibili|b站)招聘bilibili-音视频理解算法工程师

招聘职位:

bilibili-音视频理解算法工程师 搜索同类职位
发布日期:
2026-08-17
工作地点:
  • 上海
职位类型:
全职
职位类别:
全职
来源:
b站官网
岗位介绍:
职位描述

工作职责:
1. Omni VLM 基础模型研发
- 负责面向视频理解的 Omni VLM / 多模态理解基础模型研发。
- 参与模型架构、数据体系、训练方法和评测体系建设。
- 开展大规模图像、视频、音频和文本数据上的 VLM 预训练。
- 开展多模态 SFT、偏好对齐、强化学习、复杂推理等后训练工作。
- 提升模型在长视频理解、时序推理、细粒度感知和多模态交互等方面的能力。
2. Captioner
- 建设高质量视频 Caption 和结构化语义理解能力。
- 提升模型对人物、场景、动作、事件、镜头、风格、音频和叙事等信息的理解。
- 为视频生成基模提供高质量训练数据和语义条件。
3. Prompt Enhance(PE)
- 研发面向视频生成的 Prompt Enhance 模型与策略。
- 将用户简短或模糊的意图转化为准确、丰富且适合视频生成的提示词。
- 提升生成结果的语义一致性、视觉表现和可控性。
4. Reward Model 与评估
- 建设面向视频生成的 Reward Model 和自动化评测体系。
- 评估文本—视频对齐、画面质量、运动质量、时序一致性、物理合理性和审美表现。
- 为视频生成基模的训练、偏好对齐和效果优化提供反馈信号。
5. Agent 创作链路
- 研发基于 Omni VLM 的视频创作 Agent。
- 建设意图理解、任务规划、Prompt Enhance、素材理解、工具调用和结果评估等能力。
- 探索视频的多轮生成、局部修改和自动迭代优化。
工作要求:
1. 计算机、人工智能、自动化、数学或相关专业硕士及以上学历。
2. 具备扎实的机器学习、深度学习和 Transformer 基础,熟练使用 PyTorch 等主流框架。
3. 熟悉多模态基础模型,对视觉编码、跨模态对齐、时序建模和语言建模有深入理解。
4. 具有以下至少一个方向的研发经验:
- Omni Model、VLM 或多模态理解基础模型;
- VLM / LLM 预训练或后训练;
- 视频理解、视频 Caption 或视频推理;
- Reward Model、偏好对齐或强化学习;
- 视频生成或图像生成基础模型;
- 多模态 Agent、工具调用或任务规划。
5. 熟悉基础模型的数据构建、分布式训练、推理优化和模型评估流程。
6. 具备良好的工程能力、自驱力和协作能力,能够独立推进算法研发与实验迭代。
加分项
- 参与过大规模 VLM / LLM 的预训练或后训练。
- 具有多模态 SFT、RLHF、DPO、GRPO、RLAIF 或 Reward Model 经验。
- 具有视频生成、Diffusion 或 Flow Matching 相关经验。
- 具有长视频理解、音视频联合建模或多模态推理经验。
- 具有视频创作 Agent、多轮生成或工具调用系统经验。
- 在相关顶级会议或期刊发表过论文,或有高质量开源项目。

投递简历
免责声明:

此信息由b站官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“b站官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 哔哩哔哩(bilibili|b站)招聘常见问答

哔哩哔哩(bilibili|b站)招聘工作地点:
上海