1、负责GUIAgent和Tooluse训练数据的采集、清洗、标注与质量管控;
2、设计并构建高质量的多模态训练数据集(包括UI截图、操作序列、指令文本、Skills等);
3、开发和维护数据处理Pipeline,提升数据生产效率与自动化程度;
4、参与数据标注规范制定、标注工具开发与标注质量评估;
5、对训练数据进行统计分析,输出数据质量报告,指导数据迭代优化;
6、与算法同学紧密配合,根据模型反馈持续改进数据建设方案。
1、硕士以上在读,计算机科学、数据科学、人工智能、软件工程、统计学等相关专业在读;
2、熟练掌握Python,具备良好的编程能力和代码规范意识,熟悉vibe coding;
3、熟悉常用数据处理工具与框架(如Pandas、NumPy、SQL等);
4、具备良好的逻辑思维能力和数据分析能力,有较强的责任心和团队协作能力,做事认真细致;
5、至少实习3个月,每周出勤5天。
加分项:
(1)了解大语言模型(LLM)或多模态模型(VLM)的基本原理;
(2)有GUI自动化测试、UI理解或Agent相关项目经验,熟悉数据标注平台或有标注管理经验;
(3)在数据竞赛或相关开源项目中有突出表现,有Spark、Hive等大数据处理框架使用经验更佳。