小红书(xiaohongshu)招聘AI 评测平台 Leader
招聘职位:
AI 评测平台 Leader 搜索同类职位
岗位职责:
核心使命:
面向 C 端 AI Agent 应用建设行业领先的评测平台与评测驱动研发体系,将模型和应用的概率性效果转化为可衡量、可归因、可优化、可持续演进的工程闭环,让评测结论持续驱动模型、Agent 工程、关键 Tool 与产品体验提升。
岗位职责
1、负责评测体系设计,建设覆盖评测集、评测标准、Rubric、参考答案及必过/黄金/挑战分层的评测资产体系,明确业务场景的质量定义与准出口径。
2、建设自动化评测平台,打通数据集管理、任务编排、多模型/多配置运行、机评、人评、结果分析、问题下钻与回归验证,提升评测规模、效率和研发使用体验。
3、完善多层评测能力,建设面向用户最终体验的端到端评测,以及模型、关键 Tool、组件、Trace 过程和多配置消融等专项评测。
4、建立持续校准与资产回流机制,结合线上真实会话、人机一致性、需求迭代和行业变化,持续校准 Judge、评测集和评测标准,使离线评测长期贴近真实用户体感。
5、与产品、算法、工程和 QA 深度协作,将评测前置到需求设计和技术方案阶段,并推动评测结论进入模型后训练、Agent 架构和工程能力迭代。
任职要求:
1、具有生产级大模型、Agent 或复杂 AI 应用评测体系的建设经验,能够主导从方法设计、平台研发到业务落地的完整闭环。
2、深入理解 Rubric 设计、LLM-as-a-Judge、机评与人评协同、人机一致性校准、盲评/对比评测及结果可信性分析。
3、熟悉 Agent 应用关键链路,能够理解并评估模型推理、Context/Memory、Tool Calling、RAG、执行编排、Trace 和终端输出之间的相互影响。
4、具备扎实的平台工程和数据工程能力,能够设计高可用、可扩展的评测任务系统、数据处理链路、可观测体系及自动化分析能力,并亲自解决关键技术问题。
5、具备较强的技术判断、产品意识和跨团队推动力,能够从用户体验出发定义质量标准,并在标准不完全确定的场景中持续形成可执行结论。
核心使命:
面向 C 端 AI Agent 应用建设行业领先的评测平台与评测驱动研发体系,将模型和应用的概率性效果转化为可衡量、可归因、可优化、可持续演进的工程闭环,让评测结论持续驱动模型、Agent 工程、关键 Tool 与产品体验提升。
岗位职责
1、负责评测体系设计,建设覆盖评测集、评测标准、Rubric、参考答案及必过/黄金/挑战分层的评测资产体系,明确业务场景的质量定义与准出口径。
2、建设自动化评测平台,打通数据集管理、任务编排、多模型/多配置运行、机评、人评、结果分析、问题下钻与回归验证,提升评测规模、效率和研发使用体验。
3、完善多层评测能力,建设面向用户最终体验的端到端评测,以及模型、关键 Tool、组件、Trace 过程和多配置消融等专项评测。
4、建立持续校准与资产回流机制,结合线上真实会话、人机一致性、需求迭代和行业变化,持续校准 Judge、评测集和评测标准,使离线评测长期贴近真实用户体感。
5、与产品、算法、工程和 QA 深度协作,将评测前置到需求设计和技术方案阶段,并推动评测结论进入模型后训练、Agent 架构和工程能力迭代。
任职要求:
1、具有生产级大模型、Agent 或复杂 AI 应用评测体系的建设经验,能够主导从方法设计、平台研发到业务落地的完整闭环。
2、深入理解 Rubric 设计、LLM-as-a-Judge、机评与人评协同、人机一致性校准、盲评/对比评测及结果可信性分析。
3、熟悉 Agent 应用关键链路,能够理解并评估模型推理、Context/Memory、Tool Calling、RAG、执行编排、Trace 和终端输出之间的相互影响。
4、具备扎实的平台工程和数据工程能力,能够设计高可用、可扩展的评测任务系统、数据处理链路、可观测体系及自动化分析能力,并亲自解决关键技术问题。
5、具备较强的技术判断、产品意识和跨团队推动力,能够从用户体验出发定义质量标准,并在标准不完全确定的场景中持续形成可执行结论。
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!