岗位简介:深度参与大模型后训练相关系统框架建设,包括不限于训/推引擎效率优化、大规模RL训练效率优化、系统稳定性优化、算法/工程 co-design、前沿方向 auto-research等等。 岗位职责:
- 基础训练/推理引擎开发、精度保障、效率优化等;
- 低精度训推效率优化、训推一致性建设等;
- 大规模 RL 框架设计/优化,面向下一代长程任务训练深度优化;
- 稳定性建设,提升大规模训练过程中容错定位及恢复效率;
- 算法/工程 co-design,共同优化系统易用性、共同提升算法效果;
- 提升系统可观测性,支持细粒度的指标建设、生命周期追溯管理等。 任职要求:
- 熟悉 PyTorch 分布式训练/推理原理,熟悉Megatron/FSDP、vLLM/Sglang优先;
- 熟悉 PPO 原理及各变种RL 算法,熟悉 verl、slime等框架优先;
- 熟悉性能分析、问题排查相关工具,具备独立定位解决复杂问题能力;
- 熟悉 AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent 的经验。 加分项
- 大规模分布式训/推/强化框架经验;
- 长程AgenticRL任务算法策略调优;
- 上述相关领域发表过顶会论文。