岗位职责: 参与AI大模型训练框架的研发适配工作,分析优化性能热点,分析内存瓶颈,优化大模型训练框架; 调研分析大模型最新技术和性能优化方案,跟进社区演进方向,持续优化大模型训练瓶颈问题; 性能分析的理论计算及预估,对计算、通信时间和内存占比能够进行合理性分析,并提出优化方案; 充分理解分布式训练全过程,优化预训练及后训练阶段性能,不断提高大规模场景下的训练稳定性。 任职要求: 硕士及以上学历,微电子、计算机、通信、自动化、应用数学、物理等相关专业; 熟悉pytorch的使用,熟悉大模型相关的训练方法和技巧,如moe,长序列,多模态等; 熟悉Linux/Unix系统环境,能够熟练使用C++/Python; 熟悉计算机体系结构,熟悉多层内存结构,熟悉操作系统概念; 良好的沟通能力和团队协作能力,良好的学习能力和自驱能力。 拥有以下经验者优先: 熟悉Megatron-LM/FSDP/DeepSpeed/Transformers/Verl等任意一种框架; 有大模型训练开发经验或者框架开发优化经验; 熟悉Nsight System,DLProf等性能分析工具使用经验。 注:本岗位设置笔试环节,请留意邮件或短信通知。