← 返回岗位列表
27届Stepstar-大语言模型pre-train 数据算法工程师
阶跃星辰
· 北京 · 上海
· 7月24日 · 1个月前
- 评分
- 79
- 发布日期
- 7月24日 (1个月前)
- 内推
- 暂无
- 公司规模
- 201-500
- 行业
- 人工智能
岗位描述
【岗位描述】
- 负责大语言模型预训练数据体系建设,包括数据采集、清洗、去重、质量过滤、配比设计与数据版本管理;
- 参与构建面向代码、数学、Reasoning、长文本、多语言、多模态等能力方向的数据recipe,支持下一代基座模型能力提升;
- 结合模型训练效果和评测结果,分析数据质量、数据分布与模型能力之间的关系,持续优化数据策略;
- 负责数据消融实验与数据飞轮建设,通过回流数据、合成数据、自蒸馏数据等方式持续提升模型表现;
- 与训练、评测和基础设施团队协作,推动大规模数据处理和训练流程稳定落地。 【岗位要求】
- 预计毕业时间介于2026年9月至2027年8月的国内外计算机、数学、人工智能、数据科学等相关专业的优秀应届毕业生;
- 具备扎实的编程基础,熟悉Python,了解数据处理、分布式计算或大规模数据pipeline者优先;
- 对大模型数据工程、预训练数据配比、数据质量评估、合成数据等方向有浓厚兴趣;
- 具有大模型、NLP、信息检索、数据挖掘、代码数据或多模态数据相关实习/科研经验者优先;
- 具备良好的实验分析能力、工程落地能力、团队协作能力和沟通能力。
加入我的投递 →