查看更多分享

美团(meituan)招聘大模型/Agent 评测工程师(AI 研发方向)

招聘职位:

大模型/Agent 评测工程师(AI 研发方向) 搜索同类职位
发布日期:
2026-08-31
工作地点:
  • 上海市,北京市
职位类型:
全职
职位类别:
技术类软件
来源:
美团官网
部门介绍:
美团核心本地商业下业务研发平台,基于公司“零售+科技”的战略导向,通过从底层架构到应用系统、从软件到硬件、从传统算法到GenAI的全方位技术研究,以及开发、运维、安全等全流程能力建设,致力于推动美团核心本地商业下需求侧与供给侧的数字化和智能化升级,助力业务实现高质量增长,优化用户使用体验,提升商户经营水平,促进行业生态伙伴关系的持续健康发展。团队秉持务实、自驱、开放以及追求卓越的工程师文化,一方面通过系统和技术体系的持续迭代升级,帮助业务高质量增长;另一方面,密切关注前沿技术趋势变化,积极创新技术能力,为业务未来发展创造新的可能性。期待优秀的你加入我们,在夯实专业、深耕平台的基础上与业务携手同行,一起用技术 “帮大家吃得更好,生活更好”。
岗位职责:
1. 负责通用 Agent、Code Agent 及 AI 研发工具的评测体系设计与建设,支撑模型、Prompt、工具和 Agent 工作流的持续迭代。
2. 深入需求分析、技术方案设计、代码生成与修改、测试生成、代码评审、缺陷修复和故障诊断等研发场景,将真实研发流程抽象为可复现、可扩展的评测任务。
3. 建立覆盖任务完成度、需求符合度、代码正确性、工具调用、规划执行、稳定性、安全性、成本和时延等维度的评测指标体系。
4. 负责评测数据和样本建设,持续沉淀真实任务、典型失败案例、线上反馈及核心回归用例,保障评测数据的代表性、区分度和可维护性。
5. 设计和研发自动化评测框架及平台,支持任务批量执行、过程数据采集、自动评分、版本对比、回归分析、异常告警和结果可视化。
6. 分析 Agent 的执行轨迹,定位其在需求理解、任务规划、上下文使用、工具调用、代码修改、测试执行和错误恢复等环节的问题,判断问题来源并提出改进建议。
7. 建立线上反馈与离线评测之间的闭环,将用户反馈、任务失败、人工接管和异常行为转化为可复现的评测与回归用例。
8. 与产品、算法、研发、测试及平台团队协作,推动评测结果应用于模型选择、Agent 优化、版本验收和发布决策。
任职要求:
1. 计算机科学、软件工程、人工智能或相关专业本科及以上学历,具备 3 年及以上软件研发、测试开发、质量工程、研发效能或 AI 工程经验。
2. 熟练掌握 Python、Go、Java 或 TypeScript 中至少一种编程语言,具备良好的工程实现能力,能够独立完成评测工具、服务或平台模块的设计与开发。
3. 熟悉软件研发流程,了解 Git、CI/CD、自动化测试、容器化环境以及常见的软件构建、测试和发布方式。
4. 对大语言模型和 Agent 有较深入理解,熟悉 Prompt、上下文管理、任务规划、工具调用、多轮交互、代码执行及错误恢复等基本机制。
5. 具备评测方案设计能力,能够将模糊的质量问题转化为明确的评测任务、指标、评分规则和验收标准。
6. 具备良好的数据分析和实验能力,能够从评测数据和执行轨迹中发现规律、归纳失败类型并定位问题根因。
7. 具备较强的业务理解、逻辑分析和跨团队协作能力,能够推动评测方案在真实研发场景中落地。
8. 对 AI 编程和 Agent 技术保持高度关注,愿意持续探索新模型、新工具和新的评测方法。
岗位亮点:
1. 聚焦大模型与 Agent 前沿方向,参与通用 Agent、Code Agent 评测体系从设计到落地的完整建设;
2. 深入需求分析、技术设计、编码、测试和代码评审等真实研发流程,探索 AI 在复杂软件研发场景中的能力边界;
3. 参与评测框架、评测平台、指标体系及评测数据建设,形成从用例构建、自动执行到结果分析的完整实践;
4. 与模型、Agent、研发工具及业务团队紧密协作,通过评测发现问题并推动模型与智能体持续迭代;
5. 面向大规模、可复现的 Agent 评测挑战,积累 AI 评测、研发效能和平台工程等复合领域经验。
免责声明:

此信息由美团官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“美团官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 美团(meituan)招聘常见问答

美团(meituan)招聘工作地点:
上海市,北京市
美团(meituan)招聘经验要求:
不限