小红书(xiaohongshu)招聘【Agent 平台】AI 大模型评测平台研发工程师 / 专家
招聘职位:
【Agent 平台】AI 大模型评测平台研发工程师 / 专家 搜索同类职位
岗位职责:
我们负责小红书 Agent 平台的评测建设,为基座大模型、多模态及各类 Agent 应用提供全生命周期的评测支撑。工作从平台架构、评测数据的挖掘采集与打标,到自动化评测引擎、Badcase 归因诊断,再到开发者工具链与生态建设,全程一手主导。我们相信评测是 AI 产品的生命线,直接影响全公司的 AI 迭代效率。我们期待工程能力扎实、能独立破局的人加入,一起把它做好。
工作职责
1、评测平台架构与建设:负责 LLM 及 AI 应用评测平台的架构设计与核心开发,构建对基座大模型、多模态(图/文/音/视)、Agent 及各类 Tools/Skills 的自动化评测能力
2、评测数据挖掘与生产:负责评测数据的挖掘、采集、清洗与打标,建设标注质检流程,构建评测集并支持其校验、上架与版本化管理
3、自动化评测流水线:打造敏捷评测流水线,实现从数据、执行到结果的全链路自动化评估,支撑版本快速迭代验收
4、深度诊断与归因分析:构建效果分析与报告体系,对失败用例、Agent 决策轨迹(Trace)与 Badcase 深入归因,输出可驱动产品迭代的改进建议
5、系统稳定性建设:负责评测服务的性能调优、容量规划与可观测性建设(监控、告警、日志、链路追踪),保障高并发下稳定运行
6、开发者生态与工具链:开发 Agent 应用的自动化接入工具与诊断工作台,降低各业务线接入成本,提升全公司 AI 迭代效率
7、行业追踪与资产沉淀:跟踪业界大模型动态与主流 Benchmark,制定评测方案并推动落地,沉淀评测数据、结果与报告等资产
任职要求:
任职资格
基础要求:
1、本科及以上学历,计算机、软件工程、人工智能等相关专业优先
2、扎实的工程能力,精通 Python / Java / Go 中至少一门语言,熟悉 Linux 与容器化开发
3、对并发编程、分布式系统有深入理解,熟悉 MySQL / Redis / Kafka / ElasticSearch 等常用存储与中间件
4、理解大模型评测体系(LLM-as-a-Judge、自动化指标、人工对齐等),有 AI 应用 / Agent 平台的落地经验
5、逻辑清晰、能拆解复杂问题,可独立分析并解决复杂工程问题
6、良好的跨团队沟通与推动能力
加分项:
1、主导或深度参与过主流评测框架(如 OpenCompass、DeepEval、LangSmith 等)的开发
2、有 Agent / Workflow 研发经验,理解 Agent 评测原理(任务完成率、工具调用准确率等)及指标设计
3、有高质量评测数据集的设计与管理经验
4、对模型幻觉、安全性、红队测试有研究或实战
我们希望你
1、追结果、重落地,不满足于"做完",而是"做好、做透"
2、主动思考多于被动执行,想到就能动手做到,不推诿、不等靠
3、对细节敏感,一个小 bug 就可能让版本对比失真,你得能揪出来
4、认同评测是 AI 产品的生命线,愿意用极致严谨支撑产品做到业内顶尖
我们负责小红书 Agent 平台的评测建设,为基座大模型、多模态及各类 Agent 应用提供全生命周期的评测支撑。工作从平台架构、评测数据的挖掘采集与打标,到自动化评测引擎、Badcase 归因诊断,再到开发者工具链与生态建设,全程一手主导。我们相信评测是 AI 产品的生命线,直接影响全公司的 AI 迭代效率。我们期待工程能力扎实、能独立破局的人加入,一起把它做好。
工作职责
1、评测平台架构与建设:负责 LLM 及 AI 应用评测平台的架构设计与核心开发,构建对基座大模型、多模态(图/文/音/视)、Agent 及各类 Tools/Skills 的自动化评测能力
2、评测数据挖掘与生产:负责评测数据的挖掘、采集、清洗与打标,建设标注质检流程,构建评测集并支持其校验、上架与版本化管理
3、自动化评测流水线:打造敏捷评测流水线,实现从数据、执行到结果的全链路自动化评估,支撑版本快速迭代验收
4、深度诊断与归因分析:构建效果分析与报告体系,对失败用例、Agent 决策轨迹(Trace)与 Badcase 深入归因,输出可驱动产品迭代的改进建议
5、系统稳定性建设:负责评测服务的性能调优、容量规划与可观测性建设(监控、告警、日志、链路追踪),保障高并发下稳定运行
6、开发者生态与工具链:开发 Agent 应用的自动化接入工具与诊断工作台,降低各业务线接入成本,提升全公司 AI 迭代效率
7、行业追踪与资产沉淀:跟踪业界大模型动态与主流 Benchmark,制定评测方案并推动落地,沉淀评测数据、结果与报告等资产
任职要求:
任职资格
基础要求:
1、本科及以上学历,计算机、软件工程、人工智能等相关专业优先
2、扎实的工程能力,精通 Python / Java / Go 中至少一门语言,熟悉 Linux 与容器化开发
3、对并发编程、分布式系统有深入理解,熟悉 MySQL / Redis / Kafka / ElasticSearch 等常用存储与中间件
4、理解大模型评测体系(LLM-as-a-Judge、自动化指标、人工对齐等),有 AI 应用 / Agent 平台的落地经验
5、逻辑清晰、能拆解复杂问题,可独立分析并解决复杂工程问题
6、良好的跨团队沟通与推动能力
加分项:
1、主导或深度参与过主流评测框架(如 OpenCompass、DeepEval、LangSmith 等)的开发
2、有 Agent / Workflow 研发经验,理解 Agent 评测原理(任务完成率、工具调用准确率等)及指标设计
3、有高质量评测数据集的设计与管理经验
4、对模型幻觉、安全性、红队测试有研究或实战
我们希望你
1、追结果、重落地,不满足于"做完",而是"做好、做透"
2、主动思考多于被动执行,想到就能动手做到,不推诿、不等靠
3、对细节敏感,一个小 bug 就可能让版本对比失真,你得能揪出来
4、认同评测是 AI 产品的生命线,愿意用极致严谨支撑产品做到业内顶尖
免责声明:
此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!