本课题的研究目标是研发大规模、高效易用的大模型训练框架,针对不同模型架构,探索多机多卡分布式训练的性能极限。 包括不限于: 1、高度稀疏化、长文本的模型训练策略优化; 2、大规模MoE模型的大规模RL训练性能优化; 3、基于模型的训练和推理瓶颈,工程算法Codesign探索下一代大模型网络结构设计。 1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先; 2、熟悉Linux/Unix平台上的C++编程,熟悉网络编程-多线程编程,有良好的编程习惯; 3、熟悉其中一种主流的深度学习训练或推理框架(TensorFlow / PyTorch / Onnx / TensorRT等)的原理和实现者优先; 4、有扎实的专业基础知识,熟悉常用的数据结构和算法,对计算机系统结构-网络-操作系统等专业知识有深刻认知; 5、良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。