1.负责多模态内容感知、理解及多模态文档处理相关的大模型研发工作,包括但不限于多模态或视觉预训练模型的下游任务微调与优化 2.负责视觉语言大模型(VLM)在内容理解与文档处理等场景的应用探索,深入开展大模型SFT(指令微调)、强化学习微调(如DPO/GRPO等)算法研究 3.负责基于大模型的 Agent 能力建设与应用落地,围绕复杂任务拆解、流程编排、工具调用、记忆管理、规划与执行等方向开展研发,推动 Agent 在多模态理解、文档处理、内容生产与业务自动化等场景中的实践 4.跟进计算机视觉及多模态领域前沿工作,探索前沿技术落地,并协助整理形成高质量学术论文 1.硕士及以上学历,计算机、人工智能、电子信息或相关专业 2.熟悉多模态大语言模型(VLM),对Qwen-VL系列、InternVL等前沿多模态模型有深入了解及实际应用经验 3.熟悉多模态/视觉预训练模型,如CLIP、BLIP、DINO等,有预训练或下游任务微调经验者优先 4.对多模态内容感知、图像/视频理解、多模态文档处理(如文档解析、版面分析、文档问答DocVQA等)等方向有深入研究或实战经验 5.具备扎实的代码基础,熟练使用 PyTorch 等深度学习框架,获得ACM、Kaggle等国际竞赛名次者优先 6.具有学术创新能力,在CVPR、ICCV、ECCV、ACL、NeurIPS等相关领域顶级会议/期刊发表过论文者优先 7.具备良好的团队协作能力,自驱力强,能够主动积极探索并解决研究与落地过程中发现的问题 8.实习时间6个月即以上,每周至少投入4天