腾讯(tencent)招聘智能湖仓研发工程师(上海/深圳)
招聘职位:
智能湖仓研发工程师(上海/深圳) 搜索同类职位
岗位职责:
1.负责公司统一 AI 数据湖基础能力建设,围绕存储、元数据、索引、版本、权限、生命周期和查询规划等方向,构建高性能、可治理、可复用的数据基础设施;
2.深度适配 Spark、Flink、StarRocks、Ray,Pytorch等大数据和AI 计算框架 ,优化数据写入、扫描、过滤、采样、批量读取、训练数据加载和结果回写等端到端性能;
3.支持广告、推荐、搜索等业务场景,建设样本、特征、行为日志、模型输入输出和效果数据等核心数据资产的统一管理与高效访问能力,支撑样本构建、特征回溯、训练数据管理和实验复现;
4.支持大模型研发链路中的数据采集、清洗解析、特征抽取、Embedding 生成、数据去重、训练集构建、评估与推理回写等环节,建设高效的数据存储与数据访问能力;
5.围绕多模态数据管理、向量检索、近重复检测、语义检索、RAG、混合查询和批量数据治理等场景,构建高吞吐、低成本、可版本化的数据处理与检索能力。
岗位要求:
1.5 年以上大数据、分布式系统、存储系统、湖仓、检索系统、广告推荐数据平台或 AI 数据平台研发经验;
2.熟悉 Java / Scala / C++ / Rust / Python 中至少一种语言,具备扎实的系统设计、编码和性能优化能力;
3.熟悉数据湖、湖仓、分布式存储、元数据管理、事务提交、文件组织、查询规划、分区裁剪和文件裁剪等机制;
4.熟悉 Spark、Flink、Trino / Presto、Hive、StarRocks、Ray 等计算或查询引擎中的一种或多种;
5.熟悉 Parquet,Lance, Vortex,Nimble 等列存文件格式,理解列式存储、随机访问、批量读取、压缩编码和 IO 优化;
6.熟悉广告、推荐、搜索中的样本生产、特征工程、训练数据管理、特征回溯或模型效果分析链路者优先;
7.熟悉向量检索、多模态检索、近重复检测、语义检索、RAG 或大规模 embedding 数据治理者优先;
8.具备良好的技术判断力、问题抽象能力、跨团队沟通能力和复杂项目推进能力;
9.加分项:;
10.有数据湖表格式、存储内核、查询引擎、特征平台、样本平台、向量检索系统或多模态数据平台研发经验;
11.有 Iceberg,Hudi, Paimon, Lance, Vortex, Nimble, Arrow、Spark、Flink、Trino、Ray 等开源项目源码经验或社区贡献者优先;
12.有 PB 级数据、百亿级样本、大规模 特征或 embedding 数据处理经验者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨。
1.负责公司统一 AI 数据湖基础能力建设,围绕存储、元数据、索引、版本、权限、生命周期和查询规划等方向,构建高性能、可治理、可复用的数据基础设施;
2.深度适配 Spark、Flink、StarRocks、Ray,Pytorch等大数据和AI 计算框架 ,优化数据写入、扫描、过滤、采样、批量读取、训练数据加载和结果回写等端到端性能;
3.支持广告、推荐、搜索等业务场景,建设样本、特征、行为日志、模型输入输出和效果数据等核心数据资产的统一管理与高效访问能力,支撑样本构建、特征回溯、训练数据管理和实验复现;
4.支持大模型研发链路中的数据采集、清洗解析、特征抽取、Embedding 生成、数据去重、训练集构建、评估与推理回写等环节,建设高效的数据存储与数据访问能力;
5.围绕多模态数据管理、向量检索、近重复检测、语义检索、RAG、混合查询和批量数据治理等场景,构建高吞吐、低成本、可版本化的数据处理与检索能力。
岗位要求:
1.5 年以上大数据、分布式系统、存储系统、湖仓、检索系统、广告推荐数据平台或 AI 数据平台研发经验;
2.熟悉 Java / Scala / C++ / Rust / Python 中至少一种语言,具备扎实的系统设计、编码和性能优化能力;
3.熟悉数据湖、湖仓、分布式存储、元数据管理、事务提交、文件组织、查询规划、分区裁剪和文件裁剪等机制;
4.熟悉 Spark、Flink、Trino / Presto、Hive、StarRocks、Ray 等计算或查询引擎中的一种或多种;
5.熟悉 Parquet,Lance, Vortex,Nimble 等列存文件格式,理解列式存储、随机访问、批量读取、压缩编码和 IO 优化;
6.熟悉广告、推荐、搜索中的样本生产、特征工程、训练数据管理、特征回溯或模型效果分析链路者优先;
7.熟悉向量检索、多模态检索、近重复检测、语义检索、RAG 或大规模 embedding 数据治理者优先;
8.具备良好的技术判断力、问题抽象能力、跨团队沟通能力和复杂项目推进能力;
9.加分项:;
10.有数据湖表格式、存储内核、查询引擎、特征平台、样本平台、向量检索系统或多模态数据平台研发经验;
11.有 Iceberg,Hudi, Paimon, Lance, Vortex, Nimble, Arrow、Spark、Flink、Trino、Ray 等开源项目源码经验或社区贡献者优先;
12.有 PB 级数据、百亿级样本、大规模 特征或 embedding 数据处理经验者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨。
免责声明:
此信息由腾讯官网 (查看来源)审核并发布,我们转载该信息,仅出于传递更多就业招聘资讯、促进大学生及广大求职者就业之目的。该招聘职位信息的真实性、准确性、时效性及合法性均由原始发布方“腾讯官网”负责。我们作为信息转载平台,不构成求职建议,不涉及任何职业中介服务,不对其内容承担任何形式的保证责任。请用户在使用转载信息时保持审慎,自行判断并承担相应风险,求职请认准企业官方渠道!