拓达教育 Touchdown Education 拓达求职支持办公室Career Support Office touchdown.org.cn ↗
JobFinder为留学生筛选身份匹配的岗位

大模型分布式训练引擎研发实习生

小红书 · 北京 · 上海 · 杭州 · 8月27日 · 1周前
CSO 可内推 机器学习/AI
评分
98
发布日期
8月27日 (1周前)
内推
有 CSO 内推渠道
公司规模
5k-10k
行业
互联网
投递编号
18934

岗位描述

工作职责:

1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率

2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证

3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合

4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。

5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。

任职资格:

1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;

2、有较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步(⭐️有大牛带着成长)

2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;

3、了解主流LLM模型结构,使用过至少一种主流LLM训练框架(Megatron-LM/DeepSpeed/veRL等);

加分项:

1、熟悉DP/TP/PP/ZeRO等分布式训练策略原理,有大模型训练调优分析经验者优先;

2、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等;

3、了解并行计算、网络通信、系统优化和集群硬件架构等相关知识者优先;

4、了解 GPU 硬件架构和 GPU 软件栈(CUDA,cuDNN),具备一定的 GPU 性能分析的能力;

5、熟悉NCCL/RDMA/IB/RoCE相关知识者优先;

6、有优秀开源项目经历者优先。

加入我的投递 →

小红书 的其他岗位

产品经理实习生 / Product Intern(Art & AI) · 上海 · 评分 99
研究型实习生-广告大模型算法工程师(创意生成) · 北京 · 上海 · 杭州 · 评分 99
AI数据产品经理(实习生) · 上海 · 评分 98
广告投放平台产品运营实习生 · 北京 · 评分 98
风控平台产品经理实习生 · 上海 · 评分 98

查看全部 →