腾讯(tencent)招聘微信-语音全双工对话大模型预训练算法工程师
招聘职位:
微信-语音全双工对话大模型预训练算法工程师 搜索同类职位
岗位职责:
1.负责语音全双工对话大模型的架构设计与预训练,构建边听边说、实时打断、自然接话和连续对话能力;
2.负责音频理解模型预训练,提升语音内容、说话人、情感语气、副语言信息、环境声音及多人重叠语音的理解能力;
3.负责音频生成模型预训练,研究基于 Audio Token、Neural Codec、自回归、Diffusion 或 Flow Matching 的语音生成方案,提升音质、自然度、情感表现和生成稳定性;
4.负责全双工交互行为建模,包括回复时机、用户打断、抢话与让话、Backchannel、重叠语音和流式生成;
5.负责大规模音频预训练数据建设,包括数据清洗、去重、质量过滤、伪标注、Token 化及数据配比;
6.负责模型规模化训练、效果分析及训练稳定性优化,推动预训练模型的后训练、评测和产品落地。
岗位要求:
1.计算机、人工智能、语音信号处理等相关专业,硕士及以上学历;
2.具备全双工语音对话模型预训练经验,参与过端到端 Speech-to-Speech、Audio LLM、Omni Model 或类似模型研发;
3.具备音频理解模型或音频生成模型预训练经验,能够负责模型架构、数据建设、训练策略和效果分析;
4.熟悉全双工对话核心问题,包括 Turn-taking、End-of-turn Detection、User Interruption、Overlapping Speech、Backchannel 和 Streaming Generation;
5.熟悉 Audio Encoder、Conformer、Transformer、Audio Tokenizer、Neural Codec、自回归、Diffusion 或 Flow Matching 等技术;
6.熟练使用 PyTorch,具备大规模分布式训练经验,熟悉 DeepSpeed、Megatron-LM、FSDP 等训练框架;
7.具备较强的实验设计、问题定位和跨团队协作能力。
加分项:
1.有全双工语音对话基础模型从零到一预训练经验;
2.同时具备音频理解和音频生成模型预训练经验;
3.有大规模音频数据、十亿参数以上模型或 MoE 模型训练经验;
4.有语音 Tokenizer、长音频建模、流式模型或多模态统一建模经验;
5.在语音、音频或多模态方向发表过高质量论文,或有相关模型上线经验。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨。
1.负责语音全双工对话大模型的架构设计与预训练,构建边听边说、实时打断、自然接话和连续对话能力;
2.负责音频理解模型预训练,提升语音内容、说话人、情感语气、副语言信息、环境声音及多人重叠语音的理解能力;
3.负责音频生成模型预训练,研究基于 Audio Token、Neural Codec、自回归、Diffusion 或 Flow Matching 的语音生成方案,提升音质、自然度、情感表现和生成稳定性;
4.负责全双工交互行为建模,包括回复时机、用户打断、抢话与让话、Backchannel、重叠语音和流式生成;
5.负责大规模音频预训练数据建设,包括数据清洗、去重、质量过滤、伪标注、Token 化及数据配比;
6.负责模型规模化训练、效果分析及训练稳定性优化,推动预训练模型的后训练、评测和产品落地。
岗位要求:
1.计算机、人工智能、语音信号处理等相关专业,硕士及以上学历;
2.具备全双工语音对话模型预训练经验,参与过端到端 Speech-to-Speech、Audio LLM、Omni Model 或类似模型研发;
3.具备音频理解模型或音频生成模型预训练经验,能够负责模型架构、数据建设、训练策略和效果分析;
4.熟悉全双工对话核心问题,包括 Turn-taking、End-of-turn Detection、User Interruption、Overlapping Speech、Backchannel 和 Streaming Generation;
5.熟悉 Audio Encoder、Conformer、Transformer、Audio Tokenizer、Neural Codec、自回归、Diffusion 或 Flow Matching 等技术;
6.熟练使用 PyTorch,具备大规模分布式训练经验,熟悉 DeepSpeed、Megatron-LM、FSDP 等训练框架;
7.具备较强的实验设计、问题定位和跨团队协作能力。
加分项:
1.有全双工语音对话基础模型从零到一预训练经验;
2.同时具备音频理解和音频生成模型预训练经验;
3.有大规模音频数据、十亿参数以上模型或 MoE 模型训练经验;
4.有语音 Tokenizer、长音频建模、流式模型或多模态统一建模经验;
5.在语音、音频或多模态方向发表过高质量论文,或有相关模型上线经验。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨。
免责声明:
此信息由腾讯官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“腾讯官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!