1.面向大模型训练与推理加速,研究 GPU、NPU、FPGA 等异构计算平台的架构与性能优化;分析 Transformer、MoE 的计算、访存和通信特征,定位系统性能瓶颈; 2.参与矩阵计算、稀疏/低比特计算、片上存储及数据流等关键模块设计; 使用性能建模、架构仿真、HLS 或 RTL 开展设计空间探索与方案验证; 推进量化、稀疏化等软硬件协同优化,提升端侧及云端部署的吞吐、延迟和能效; 3.参与原型实现、实验评估及 ISCA、MICRO、HPCA、ASPLOS、MLSys 等会议论文投稿。 【岗位要求】 1.计算机体系结构、电子工程、微电子、计算机科学等相关专业在读; 2.熟悉计算机体系结构基础,了解 GPU、NPU、FPGA 或 AI 加速器; 3.熟悉 Verilog/SystemVerilog、HLS、CUDA、C/C++ 或架构模拟工具中的一种或多种; 4.具备 Python 和 PyTorch 基础,了解 Transformer、MoE、Attention、量化及稀疏计算; 5.具备良好的工程实现、文献阅读和团队协作能力。 【加分项】 1.有 AI 加速器、RTL、FPGA、HLS 或 CUDA Kernel 项目经验; 2.有算力、带宽、功耗或片上资源受限场景的优化经验; 3.有相关高水平论文或大模型推理优化经验。