腾讯(tencent)招聘混元语音大模型agentic评测(北京/上海)
招聘职位:
混元语音大模型agentic评测(北京/上海) 搜索同类职位
岗位职责:
1.主导 Agent 方向评测体系整体设计与落地实施,完成模型能力定义,搭建面向复杂智能体场景的评测任务体系;围绕多步推理、环境交互、工具编排、长程规划、异常错误恢复等核心维度,搭建贴合真实 Agentic 工作流的端到端评测方案;
2.搭建评测数据全链路质量管控体系,落地试题查重、数据污染检测、难度分级标定校准、标注规范制定、标注一致性审核等机制,保障评测结果可信、稳定、可复现;
3.联动模型训练团队深度对齐,提炼评测结论与优化洞察,输出模型能力迭代改进方向;协同工程团队推进评测基础设施建设,搭建可支撑高频次、大规模自动化评测的流水线;
4.持续跟进 Agent 领域学术界、工业界前沿技术动态,输出评测体系迭代演进策略,持续优化评测方案,精准衡量大模型智能体真实能力边界;
5.探索融合多模态能力的 Agentic 评测新思路、新方案,并完成方案验证与落地实施。
岗位要求:
1.本科及以上学历,拥有 2 年及以上互联网 / 人工智能领域相关评测工作经验;
2.具备从 0 到 1 独立设计 Agent Benchmark 完整实战经验,深刻理解评测数据集在区分度、数据抗污染、生态效度等维度的设计取舍与平衡;
3.熟悉 WebArena、OSWorld、GAIA、AgentBench 等主流 Agent 评测基准,掌握各类评测集底层设计思路、适用场景与固有局限性;
4.熟练使用 Python,具备扎实的数据处理、统计分析与数据可视化能力;熟悉主流大模型推理服务调用方式,了解相关工程落地约束;
5.精通 Agent 主流框架核心机制,掌握 ReAct、工具调用(Tool Use)、任务规划(Planning)等经典范式,具备 MCP 等工具协议相关认知或项目实践经验;
6.强结果导向,拥有良好的技术文档撰写能力,突出的跨团队沟通协调、项目推进落地能力。
1.主导 Agent 方向评测体系整体设计与落地实施,完成模型能力定义,搭建面向复杂智能体场景的评测任务体系;围绕多步推理、环境交互、工具编排、长程规划、异常错误恢复等核心维度,搭建贴合真实 Agentic 工作流的端到端评测方案;
2.搭建评测数据全链路质量管控体系,落地试题查重、数据污染检测、难度分级标定校准、标注规范制定、标注一致性审核等机制,保障评测结果可信、稳定、可复现;
3.联动模型训练团队深度对齐,提炼评测结论与优化洞察,输出模型能力迭代改进方向;协同工程团队推进评测基础设施建设,搭建可支撑高频次、大规模自动化评测的流水线;
4.持续跟进 Agent 领域学术界、工业界前沿技术动态,输出评测体系迭代演进策略,持续优化评测方案,精准衡量大模型智能体真实能力边界;
5.探索融合多模态能力的 Agentic 评测新思路、新方案,并完成方案验证与落地实施。
岗位要求:
1.本科及以上学历,拥有 2 年及以上互联网 / 人工智能领域相关评测工作经验;
2.具备从 0 到 1 独立设计 Agent Benchmark 完整实战经验,深刻理解评测数据集在区分度、数据抗污染、生态效度等维度的设计取舍与平衡;
3.熟悉 WebArena、OSWorld、GAIA、AgentBench 等主流 Agent 评测基准,掌握各类评测集底层设计思路、适用场景与固有局限性;
4.熟练使用 Python,具备扎实的数据处理、统计分析与数据可视化能力;熟悉主流大模型推理服务调用方式,了解相关工程落地约束;
5.精通 Agent 主流框架核心机制,掌握 ReAct、工具调用(Tool Use)、任务规划(Planning)等经典范式,具备 MCP 等工具协议相关认知或项目实践经验;
6.强结果导向,拥有良好的技术文档撰写能力,突出的跨团队沟通协调、项目推进落地能力。
免责声明:
此信息由腾讯官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“腾讯官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!