拓达教育 Touchdown Education 拓达求职支持办公室Career Support Office touchdown.org.cn ↗
JobFinder为留学生筛选身份匹配的岗位

AI应用推理引擎研发工程师(J10989)

摩尔线程 · 中国 · 8月10日 · 3周前
评分
86
发布日期
8月10日 (3周前)
内推
暂无
公司规模
1k-5k
行业
半导体
投递编号
311170854

岗位描述

欢迎加入摩尔线程!你将参与端侧推理框架性能加速、多类模型部署适配,协同算子与编译器团队定位性能瓶颈,输出系统级优化方案,保障推理框架在真实业务场景高效稳定交付。

岗位职责:

1、负责端侧大模型推理框架(如 vLLM、llama.cpp、MNN 等)的性能优化与加速,提升吞吐与降低延迟。

2、负责端侧语音、Embedding、OCR、AIGC、自动驾驶等模型在推理框架(如 ONNXRuntime、MNN 等)中的性能调优与部署适配。

3、与算子团队、编译器团队紧密协作,共同完成端侧高性能推理框架的集成、验证与交付。

4、深入分析推理链路性能瓶颈,设计并实现系统级优化方案,推动框架在真实场景中的高效稳定运行。

任职资格

1、计算机、电子信息等相关专业,本科及以上学历,欢迎基础扎实的在读同学投递。

2、了解 vLLM、llama.cpp、ONNXRuntime 至少一种推理框架的架构与工作机制,有阅读源码经历优先。

3、了解大模型推理主流加速技术(Flash Attention、Paged Attention、Speculative Decoding、Continuous Batching 等),有实践复现经历优先。

4、了解 GPU 并行编程,会使用 Triton/Cutlass 完成 Kernel 开发调优,理解 CUDA 内存管理与性能优化思路。

5、会使用 Nsight 等性能剖析工具,了解 CUDA Graph、Torch AOT 等优化技术。

【加分项】

深入掌握算子优化、编译器优化(MLIR、TVM)或 GPU 硬件架构知识

有端侧量化(W4A16、W4A8)调优、模型部署相关项目实践

加入我的投递 →

摩尔线程 的其他岗位

GPU 架构(软件系统)研发工程师(J10943) · 软件系统 · 中国 · 评分 86
大模型训练优化工程师(J10996) · 中国 · 评分 86
GPU 基础设施开发工程师(J10968) · 中国 · 评分 86
GPU 高性能通信软件工程师(J10969) · 中国 · 评分 86
GPU软件栈测试开发工程师(J10961) · 中国 · 评分 86

查看全部 →