岗位简介 聚焦新一代壁仞芯片训练生态建设,面向校招生开设「大模型训练引擎」与「强化学习训练」双方向培养岗位。你将参与大模型分布式训练与 RL 训练全链路的搭建、主流框架适配、精度性能对齐及规模化训练工程落地,支撑典型大模型和强化学习项目从跑通、对齐、优化到稳定训练,并借助 AI Agent 前沿技术赋能自动化体系建设。 岗位职责
- 负责主流大模型训练框架与强化学习框架在壁仞芯片平台上的适配、功能验证、问题排查与性能调优;
- 支撑预训练、微调、RLHF/RL 等核心训练链路建设,参与 MoE、多模态、智能驾驶、Agent 等业务场景落地;
- 定位并解决精度、显存、通信、算子等训练问题,共同搭建自动化工程体系;
- 跟踪前沿论文与开源方案,结合 AI Agent 推动新方法在业务场景落地,参与开源社区建设与发展。 任职要求
- 计算机、人工智能、数学等相关专业优先;
- 熟悉 PyTorch 核心训练流程,理解 DP/TP/PP/ZeRO/FSDP 等分布式并行策略;
- 掌握 Megatron、DeepSpeed、VeRL 等一种或多种主流训练/强化学习框架;
- 具备扎实的机器学习/深度学习基础,理解策略梯度、Actor-Critic、价值函数等核心概念;
- 熟练使用 Linux、Python,具备较强的工程调试、问题定位和性能分析能力,具备良好的学习能力与代码规范。 加分项
- 有大模型预训练、全参微调、LoRA 或 RLHF/RLAIF 相关实习或项目经历;
- 有大模型 / Agent / 工具调用 / 多步推理方向强化学习训练的实习或项目经验;
- 熟悉 CUDA / 算子开发、通信库、编译器优化或 AI 芯片软件栈;
- 有国产 AI 芯片适配、自动化平台建设、AI Agent 工具使用经验;
- 有分布式训练框架(DeepSpeed、Megatron-LM、FSDP、Ray)实践经验;
- 有主流开源社区贡献,或在 NeurIPS、ICML、ICLR 等顶会有论文发表。