拓达教育 Touchdown Education 拓达求职支持办公室Career Support Office touchdown.org.cn ↗
JobFinder为留学生筛选身份匹配的岗位

27届Stepstar-Code Agent 算法研究员

阶跃星辰 · 北京 · 上海 · 7月24日 · 1个月前
评分
82
发布日期
7月24日 (1个月前)
内推
暂无
公司规模
201-500
行业
人工智能

岗位描述

【岗位描述】

  • 负责代码数据的合成、清洗、权重分配、来源扩充等一系列工作,持续提高代码中程训练、后训练等阶段的数据质量;负责探究预训练小领域数据的配比和最终效果之间的关系;开发数据合成链路,解决代码模型中的关键问题;
  • 负责探究深度推理技术,探究Test-time Compute和模型效果的Scaling laws,参与后训练奖励模型、强化学习算法的一系列优化流程,探究线上代码补全数据到RL过程的数据飞轮。
  • 专注于代码强化学习中的奖励模型(Reward Model)的优化和创新;包括和SFT阶段配合解决判别能力较差的场景、探究合成数据进行代码奖励模型的预训练、组织标注人员进行代码奖励模型的标注、Critic的前沿探究、强化学习过程中的可执行代码与单元测试的质量过滤和扩充。
  • 利用强化学习方法改进智能体的规划、反思、利用工具的能力,强化在code agent实际场景的可用性;
  • 探索基于人机协同的高质量数据挖掘、合成,以加强智能体的规划和利用工具能力;
  • 构建code agent的基础能力,包括planning能力、测例、代码生成能力;
  • 构建多模态智能体,提升多模态大模型RLHF中的训练效果;
  • 构建code agent智能体自动化评测和docker环境生成。 【岗位要求】
  • 预计毕业时间介于2026年9月至2027年8月的国内外计算机、数学、人工智能等相关专业的优秀应届毕业生;
  • 具备软工背景,具有扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
  • 熟悉语言模型的基本技术、模型结构,对AI的未来有信仰和工作热情;
  • 工作认真细致,计划性强,具有刨根问底的探究精神,对研发工作中有很强的实事求是的落地信念,追求最终效果而不是盲目追求新颖的方法,对工作内容有较强责任感。 加分项:
  • 有NOI、ACM竞赛经历者优先;有推荐、搜索领域出色的数据驱动工作者优先;
  • 熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目;
  • 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识。

加入我的投递 →

阶跃星辰 的其他岗位

算法工程师实习生(金融方向) · 上海 · 评分 96
27届-AI硬件测试工具开发工程师 · 上海 · 深圳 · 评分 93
27届-Agent 开发工程师(企业信息化方向) · 上海 · 评分 93
27届-产品经理(企业信息化方向) · 上海 · 评分 93
27届-安全开发工程师 · 上海 · 评分 93
27届-影像平台软件工程师 · 上海 · 评分 93

查看全部 →