岗位职责: 1.深度参与视觉大模型的效果把控,重点负责视觉理解/生成方向的模型效果评估; 2.建立科学的模型效果评估方案与策略,保障人工评测方案价值的同时积极探索自动化提效方案; 3.推动评测集题库的迭代升级,包括题库补充、内容更新、难度调整等,保障评测集能精准满足评测需求 4.负责评测报告的梳理与输出,清晰呈现评测结果、case分析、改进建议,为算法决策优化方向提供数据支撑。 岗位要求: 1.本科及以上学历,在校研究生更优【毕业时间2027届及以后】;视觉技术、人机交互、设计美学等相关专业,兼具理科逻辑思维与图片敏感度者优先; 2.熟悉视觉模型评估,有丰富的大模型评测经验,具备从训练数据生产到模型效果评估到优化的完整经验者优先; 3.有较强的分析和沟通能力,主导流程与规则优化,通过数据分析驱动评测质量提升,支撑业务决策与评测体系迭代; 4.熟悉Prompt Engineering核心方法论,有PE/Agent/Workflow实践经验; 5.实习时长5-6个月,每周4-5天者优先。