← 返回岗位列表
27届Stepstar-Code Agent 算法研究员
阶跃星辰
· 北京 · 上海
· 7月24日 · 1个月前
- 评分
- 82
- 发布日期
- 7月24日 (1个月前)
- 内推
- 暂无
- 公司规模
- 201-500
- 行业
- 人工智能
岗位描述
【岗位描述】
- 负责代码数据的合成、清洗、权重分配、来源扩充等一系列工作,持续提高代码中程训练、后训练等阶段的数据质量;负责探究预训练小领域数据的配比和最终效果之间的关系;开发数据合成链路,解决代码模型中的关键问题;
- 负责探究深度推理技术,探究Test-time Compute和模型效果的Scaling laws,参与后训练奖励模型、强化学习算法的一系列优化流程,探究线上代码补全数据到RL过程的数据飞轮。
- 专注于代码强化学习中的奖励模型(Reward Model)的优化和创新;包括和SFT阶段配合解决判别能力较差的场景、探究合成数据进行代码奖励模型的预训练、组织标注人员进行代码奖励模型的标注、Critic的前沿探究、强化学习过程中的可执行代码与单元测试的质量过滤和扩充。
- 利用强化学习方法改进智能体的规划、反思、利用工具的能力,强化在code agent实际场景的可用性;
- 探索基于人机协同的高质量数据挖掘、合成,以加强智能体的规划和利用工具能力;
- 构建code agent的基础能力,包括planning能力、测例、代码生成能力;
- 构建多模态智能体,提升多模态大模型RLHF中的训练效果;
- 构建code agent智能体自动化评测和docker环境生成。 【岗位要求】
- 预计毕业时间介于2026年9月至2027年8月的国内外计算机、数学、人工智能等相关专业的优秀应届毕业生;
- 具备软工背景,具有扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
- 熟悉语言模型的基本技术、模型结构,对AI的未来有信仰和工作热情;
- 工作认真细致,计划性强,具有刨根问底的探究精神,对研发工作中有很强的实事求是的落地信念,追求最终效果而不是盲目追求新颖的方法,对工作内容有较强责任感。 加分项:
- 有NOI、ACM竞赛经历者优先;有推荐、搜索领域出色的数据驱动工作者优先;
- 熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目;
- 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识。
加入我的投递 →