岗位简介 本岗位专注于大语言模型(LLM)与多模态大模型的高性能推理服务框架研发。你将深入国产GPU底层软件栈,参与构建从模型加载、分布式推理调度到高性能算子执行的全链路系统,直面真实业务场景下的高并发、低延迟推理挑战。在这里,你将接触最前沿的大模型推理加速技术,与资深系统工程师共同协作,为国产算力平台打造业界一流的模型服务基础设施。 岗位职责 基于壁仞GPU软件栈,参与大语言模型及多模态大模型推理服务框架的架构设计与工程落地; 围绕并行策略设计、GPU通信优化、算子融合、量化压缩等方向,持续优化模型推理性能,降低端到端推理延迟,提升线上服务的吞吐能力; 跟踪前沿论文与开源方案,结合 AI Agent 推动新方法在业务场景落地,参与开源社区建设与发展。 任职要求 计算机、软件工程、人工智能、自动化、通信、微电子、数学等相关专业优先; 扎实的编程能力,熟练掌握 C/C++ 或 Python,具备良好的代码风格与工程规范意识; 了解深度学习模型的基本架构(如Transformer、Diffusion等),对大模型推理的技术栈有一定认知;具备良好的学习能力和自驱力; 逻辑思维清晰,善于拆解复杂问题,具备良好的团队沟通与协作能力。 加分项 熟悉主流大模型推理框架(如 vLLM、SGLang、LMDeploy、TensorRT-LLM、TGI 等),有使用、适配或二次开发经验; 有 CUDA 编程经验,了解GPU体系结构、内存层次或并行计算基础,有算子手写或性能调优经历; 有深度学习模型部署、ONNX/TensorRT推理优化、量化压缩等相关项目实践; 有高性能计算、分布式系统、网络通信相关领域的研究或工程经验; 有学术竞赛(如ASC超算竞赛、ACM-ICPC、Kaggle)获奖经历,或有高质量开源项目贡献。