岗位职责 多模态训练数据处理 Pipeline 开发 基于 Spark、Ray、Hive 等分布式计算框架,开发和优化海量图文数据处理 Pipeline 参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设 持续优化数据链路性能、稳定性及资源利用效率 多模态数据基础设施建设 参与训练数据存储、索引、检索等基础能力建设 参与数据集管理、数据版本管理及数据治理相关系统开发 推动训练数据生产流程标准化与自动化 数据质量评估与可观测性建设 构建数据质量、覆盖率、分布等评估体系 开发数据分析与可观测性工具,提升数据链路透明度 大模型数据技术调研与落地 调研 LLM/VLM 领域前沿数据工程与数据构建方案,并在工作中落地 职位要求 教育背景: 本科及以上学历,计算机相关专业优先 技术能力: 熟练掌握 Python语言,Linux开发环境,分布式存储与计算原理 数据pipeline经验: Spark/Ray/Hive 等任意分布式计算引擎使用经验,数据pipeline搭建经验 工程能力: 具备较强的问题分析与解决能力,快速学习并独立推进技术项目 团队协作: 良好的沟通能力和团队合作精神 学习能力: 快速学习新知识、新技能,有技术热情,自驱力强 实习时间: 每周到岗 ≥ 4 天&连续实习 ≥ 3 个月,实习 6 个月以上优先 工作地点 北京市海淀区苏州街大恒科技大厦(线下办公)