- 参与星火多模态大模型研发,开展视觉编码、跨模态对齐、视觉理解与推理等技术研究;
- 负责多模态理解算法研发,包括图像、视频等视觉内容的语义理解、问答与推理;
- 负责多模态交互与以人为中心的感知技术研发,包括人脸人体分析、行为理解、情感与意图识别、视听交互等;
- 负责OCR与文档理解技术研发,包括文字识别、版面分析、信息抽取、文档问答等;
- 探索数字人合成技术,包括人物生成、语音驱动、口型表情及动作生成等;
- 开展医疗影像大模型研发,探索医学影像理解、知识融合、辅助分析与可信评估;
- 跟踪前沿技术进展,推动算法优化、工程落地和成果转化。
- 硕士及以上学历,计算机、人工智能、电子信息、自动化等相关专业;
- 具备扎实的计算机视觉和深度学习基础,熟悉Transformer、视觉语言模型、生成模型等技术;
- 熟练掌握Python、PyTorch等开发工具,具备良好的算法实现和工程能力;
- 在多模态理解、多模态交互、OCR、人体感知、数字人或医疗影像大模型等至少一个方向具有研究或项目经验;
- 具备良好的文献阅读、问题分析、沟通协作和快速学习能力;
- 具备使用AI工具进行编程、调试、实验结果分析的能力。
【加分项】
- 具备大模型或多模态大模型训练、微调、评测、推理部署等实战经验;
- 熟悉RAG、工具调用及多模态Agent开发,能够熟练使用智能编程与Agent工具;
- 在相关高水平会议或期刊发表过论文,或具有高质量开源项目经验;
- 在ICPC、CCPC、NOI等程序设计竞赛或高水平AI竞赛中获奖;
- 具备上述重点方向的规模化应用或产业落地经验。
此岗位为科大讯飞集团统一招聘岗位,人员通过简历筛选、笔试、初试、复试、终审等环节后录用