加入我们多模态评测算法研发团队,负责多模态理解任务的benchmark设计、落地以及学术化转化工作,聚焦多模态理解、视频生成、理解生成一体化等核心技术方向,通过构建科学、全面的评测体系,推动团队技术研发的高效迭代与创新突破,助力公司在多模态技术领域保持领先地位。 1、Benchmark设计与开发:深入研究多模态理解、视频生成、理解生成一体化等技术方向的前沿动态与行业需求,设计并开发具有针对性、科学性的benchmark评测体系,涵盖数据采集、指标定义、评测方法制定等全流程,确保评测体系能够准确反映模型的性能与潜力; 2、评测落地与执行:负责benchmark评测体系的落地实施,搭建稳定、高效的评测环境,完成对多模态模型的自动化评测任务,及时处理评测过程中出现的问题,保证评测结果的准确性、可靠性与公正性; 3、数据分析与优化:对评测结果进行深入分析,挖掘模型存在的问题与不足,为模型的优化与改进提供数据支持与决策依据,结合评测数据,撰写详细的评测报告,为研发团队提供有价值的参考建议; 4、学术化转化与研究:跟踪多模态技术领域的学术研究动态,将benchmark评测成果进行学术化转化,参与学术论文的撰写与发表,提升公司在行业内的学术影响力,同时,积极开展前沿技术研究,探索新的评测方法与技术思路,为团队的技术创新注入新的活力; 5、团队协作与沟通:与算法研发、工程实现等多个团队保持密切沟通与协作,及时了解团队的技术需求与研发进展,确保评测工作与整体研发节奏保持一致,参与团队内部的技术交流与分享活动,共同提升团队的技术水平与创新能力。 1、硕士及以上学历,计算机技术、人工智能、机器学习、数据科学等相关专业优先; 2、具备扎实的机器学习 / 深度学习基础,对生成模型或多模态模型有一定理解; 3、对视频生成、AIGC、多模态理解与评测方向有浓厚兴趣; 4、具备优秀的代码基础,熟练掌握至少一门编程语言:Python(优先)、C/C++、Java; 5、了解常见 AI 模型与算法基本原理,例如:Transformer、CLIP / CNN、GAN / VAE、Diffusion Models / DiT等; 6、熟悉机器学习模型评估方法与指标与模型评测与实验设计方法; 7、具备良好的数据分析能力与数据化思维,能够基于实验结果进行系统分析并输出结论; 8、有以下经验之一者优先: LLM / VLM 相关研究或工程经验; 自动评测 / LLM-as-a-Judge 相关实践; Benchmark 构建或评测体系设计经验; 加分项: 1、参与AIGC、大模型相关的项目研发测试经验优先,有竞品大模型评测经验优先(如通义、即梦、混元等); 2、有顶会论文、国家或国际奖项、专利获得者、算法竞赛获奖者优先考虑; 3、有训练或微调常见CV、NLP、LLM、MLLM模型经验优先; 4、有扎实的美术素养、设计经验、视频创作影视导演编导、或者有互联网公司相关经验者优先。