【研究方向】: 聚焦大规模 LLM 训练与推理中的 Scale-Out 网络通信优化,
【核心问题包括】:MoE Expert Parallelism 下的 All-to-All 通信瓶颈、网络拓扑感知的数据调度、异构集群下的通信-计算协同优化。研究成果面向 MLSys、SC、EuroSys、NeurIPS、OSDI 等顶级会议投稿。
【岗位职责】
- 研究 MoE 模型在多节点 GPU 集群上的通信模式,分析 All-to-All、AllReduce 等 Collective 操作的性能瓶颈,设计拓扑感知的通信优化方案;
- 针对异构网络环境,研究 Expert 放置策略与Token Dispatch 路由算法;
- 使用仿真工具或真实集群(多机多卡)对方案进行实验验证,产出系统级性能数据(吞吐、通信效率、端到端训练时间);
- 参与论文撰写,在 Mentor 指导下完成顶会投稿。
【岗位要求】
核心要求(满足其一即可报名):
- 熟悉 PyTorch 分布式训练框架(DDP/FSDP/DeepSpeed),理解 Tensor Parallelism、Pipeline Parallelism、Expert Parallelism 的通信开销来源;
- 了解集合通信库(NCCL/MPI),对 All-to-All、AllReduce 的底层实现和性能分析有实践经验;
- 熟悉数据中心网络拓扑(Fat-Tree、Torus、Ring 等), 有网络仿真(NS3/ASTRA-sim 等)或实测经验。
加分项:
- 有 MoE 模型(Mixtral、DeepSeek-MoE 等)训练或推理系统优化经验;
- 读过 FasterMoE、DeepSpeed-MoE、TA-MoE 等系统论文,对 Expert 路由与通信优化有自己的理解;
- 有 MLSys、SC、EuroSys、NSDI 等会议论文经历;
- 具备 C++/CUDA 通信 kernel 开发能力。