- 负责语音基础大模型前沿技术研发,包括语音编码器、端到端语音大模型、端到端语音交互、语音同传、语音理解等;
- 负责语音识别(ASR)算法研究与优化,包括声学模型、语言模型、端到端识别等;
- 参与语音合成(TTS)研发,涵盖神经声码器、音色克隆、情感合成、多语言合成等;
- 负责语音信号处理算法研发,包括麦克风阵列、降噪、回声消除、声源定位、唤醒等;
- 推动语音技术在教育、办公、车载、医疗等场景落地与优化;
- 跟踪语音领域前沿技术,开展创新性研究并产出成果。
- 硕士及以上学历,计算机、信号处理、电子工程、自动化、声学等相关专业;
- 扎实的语音信号处理与深度学习基础,熟悉语音识别或合成的原理与主流方法;
- 熟练掌握至少一种深度学习框架(PyTorch/TensorFlow),具备Python/C++编程能力;
- 有语音相关项目或研究经历,如语音识别、合成、增强、声纹识别、唤醒等;
- 英文文献阅读能力良好,能快速跟进INTERSPEECH、ICASSP等顶会进展;
- 问题分析与动手能力强,有责任心,善于团队协作;
- 具备使用AI工具进行编程、调试、实验结果分析的能力。
【加分项】
- 在INTERSPEECH、ICASSP、IEEE TASLP等语音顶会或期刊发表过论文;
- 有大规模语音数据训练、端到端语音大模型相关经验;
- 在公开语音评测或比赛中获得优异成绩;
- 熟悉Kaldi、ESPnet、Fairseq等开源语音工具,有二次开发经验;
- 有低资源语言、方言、多语言语音技术研究经历。
此岗位为科大讯飞集团统一招聘岗位,人员通过简历筛选、笔试、初试、复试、终审等环节后录用。