1.面向大模型训练与推理加速,研究 GPU、NPU、FPGA 等异构计算平台的架构与性能优化;分析 Transformer、MoE 的计算、访存和通信特征,定位系统性能瓶颈;
2.参与矩阵计算、稀疏/低比特计算、片上存储及数据流等关键模块设计;
使用性能建模、架构仿真、HLS 或 RTL 开展设计空间探索与方案验证;
推进量化、稀疏化等软硬件协同优化,提升端侧及云端部署的吞吐、延迟和能效;
3.参与原型实现、实验评估及 ISCA、MICRO、HPCA、ASPLOS、MLSys 等会议论文投稿。
【岗位要求】
1.计算机体系结构、电子工程、微电子、计算机科学等相关专业在读;
2.熟悉计算机体系结构基础,了解 GPU、NPU、FPGA 或 AI 加速器;
3.熟悉 Verilog/SystemVerilog、HLS、CUDA、C/C++ 或架构模拟工具中的一种或多种;
4.具备 Python 和 PyTorch 基础,了解 Transformer、MoE、Attention、量化及稀疏计算;
5.具备良好的工程实现、文献阅读和团队协作能力。
【加分项】
1.有 AI 加速器、RTL、FPGA、HLS 或 CUDA Kernel 项目经验;
2.有算力、带宽、功耗或片上资源受限场景的优化经验;
3.有相关高水平论文或大模型推理优化经验。