岗位职责
- 多模态训练数据处理 Pipeline 开发
- 基于 Spark、Ray、Hive 等分布式计算框架,开发和优化海量图文数据处理 Pipeline
- 参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设
- 持续优化数据链路性能、稳定性及资源利用效率
- 多模态数据基础设施建设
- 参与训练数据存储、索引、检索等基础能力建设
- 参与数据集管理、数据版本管理及数据治理相关系统开发
- 推动训练数据生产流程标准化与自动化
- 数据质量评估与可观测性建设
- 构建数据质量、覆盖率、分布等评估体系
- 开发数据分析与可观测性工具,提升数据链路透明度
- 大模型数据技术调研与落地
- 调研 LLM/VLM 领域前沿数据工程与数据构建方案,并在工作中落地
职位要求
教育背景: 本科及以上学历,计算机相关专业优先
技术能力: 熟练掌握 Python语言,Linux开发环境,分布式存储与计算原理
数据pipeline经验: Spark/Ray/Hive 等任意分布式计算引擎使用经验,数据pipeline搭建经验
工程能力: 具备较强的问题分析与解决能力,快速学习并独立推进技术项目
团队协作: 良好的沟通能力和团队合作精神
学习能力: 快速学习新知识、新技能,有技术热情,自驱力强
实习时间: 每周到岗 ≥ 4 天&连续实习 ≥ 3 个月,实习 6 个月以上优先
工作地点