查看更多分享

小红书(xiaohongshu)招聘【Dots】大模型评测

招聘职位:

【Dots】大模型评测 搜索同类职位
发布日期:
2026-08-18
工作地点:
  • 北京市,上海市,杭州市
职位类型:
全职
职位类别:
大模型
来源:
小红书官网
岗位职责:
1、设计并迭代 dots 模型的多维度能力评测体系,覆盖通用能力(推理、数学、代码、语言理解)、指令遵循、长上下文、多模态、安全性、人类偏好等维度
2、跟踪主流公开 benchmark(MMLU、MATH、GSM8K、HumanEval、MBPP、ARC、HellaSwag、GPQA、Arena ELO 等),建立内外部对齐机制,输出可比的竞争力报告
3、构建评测数据集生产 pipeline:从采集、清洗、标注、质检到版本化管理,保证数据集的质量与时效性
4、开发自动化评测平台:统一的评测入口、任务调度、结果可视化、版本对比、diff 分析
5、与后训练团队(RLHF/对齐)合作,定义 reward model 和 preference 数据的评测标准
6、设计"抗污染"策略,防止评测数据集泄露到训练集
7、参与模型发布的质量卡点(gate),为版本上线提供数据支撑
8、跟踪前沿评测研究(LLM-as-judge、multi-turn eval、agent 评测、长程任务评测等),推动评测能力持续进化
任职要求:
基础要求:
1、对大语言模型能力边界有清晰认知,知道"什么是好模型"、"好在哪"
2、熟悉主流 benchmark 的设计哲学和局限,不只是会跑分,而是能看出分数的含义
3、有数据处理与工程能力(Python 熟练,熟悉数据 pipeline 工具,能搭自动化流程)
4、扎实的统计与分析能力,能从噪声数据里看出信号
5、优秀的书面表达

加分项:
1、有 LLM 评测系统或 benchmark 的从 0 到 1 搭建经验
2、熟悉 LLM-as-judge、Arena ELO、preference learning 等评测方法论
3、有高质量数据集生产/标注管理经验
4、对模型"幻觉"、安全性、红队测试有研究或实战
5、了解主流开源评测框架(EleutherAI lm-eval、OpenCompass、HELM、BigBench)
6、有多模态模型评测经验(图文、视频、音频)
7、发表过相关论文或贡献过公开 benchmark

我们看重的特质
1、教练心态:对结论负责,不为漂亮数据妥协标准
2、系统性思维:能把"测模型"这件事,变成可复用、可演进、可横向比较的工程
3、对细节敏感:一个小 bug 在评测里可能毁掉整个版本对比,你需要能揪出来
免责声明:

此信息由小红书官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“小红书官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!

FAQ 小红书(xiaohongshu)招聘常见问答

小红书(xiaohongshu)招聘工作地点:
北京市,上海市,杭州市
小红书(xiaohongshu)招聘经验要求:
one_to_three_year