1、参与Benchmark设计,协助定义多模态生成评测任务、能力维度、Taxonomy、数据 Schema 和评测协议; 2、参与评测数据构建,负责评测 Case 的设计、筛选、标注规范制定、质量检查和数据统计分析; 3、参与自动化评测方案设计,协助设计 LLM-as-Judge / MLLM-as-Judge /自训判分模型流程; 4、参与模型评估与结果分析,对主流文生图 / 多模态生成模型进行横向评测,完成能力切片、失败归因、Case study 和实验结论整理; 5、参与论文撰写与投稿支持,协助完成相关论文材料,支持投稿与 rebuttal 准备。 1、计算机、人工智能、机器学习、计算机视觉、自然语言处理、多模态、数据科学等相关专业; 2、有较强英文论文阅读能力,能够系统梳理Related work 并提炼研究gap; 3、有较好的学术写作能力,能够参与英文论文初稿、实验分析和技术附录撰写; 4、有完整科研项目经历,理解从 idea、实验设计、结果分析到 paper writing 的基本流程; 5、有学术论文发表或投稿经验优先,有 Benchmark、Dataset、Evaluation、Leaderboard、Human Evaluation、Automatic Evaluation 相关工作经验优先; 6、参与过多模态、文生图、图文理解、VQA、MLLM、LLM-as-Judge、AIGC 评测等方向论文者优先; 7、熟悉论文实验设计、Ablation Study、Human Evaluation、Statistical Analysis、Case Study等基本范式; 8、熟悉 Python,能够完成数据处理、实验统计、指标计算和结果可视化; 9、熟悉 JSON、CSV、Pandas、Matplotlib、Jupyter 等常用数据分析工具; 10、了解常见大模型 / 多模态模型调用方式,例如 OpenAI API、Gemini API、Claude API、Transformers、Hugging Face 等; 11、具备基础工程能力,能够维护实验脚本、数据处理 pipeline 和结果分析代码。 加分项: 1、以第一作者或核心作者发表过 Benchmark / Dataset / Evaluation 相关论文; 2、有 NeurIPS、ICLR、ICML、CVPR、ICCV、ECCV、ACL、EMNLP、SIGGRAPH、AAAI、MM 等会议论文经验; 3、熟悉文生图或多模态生成方向 Benchmark,例如 T2I-CompBench、PhyBench、T2I-FactualBench、GenAI-Bench、WISE、CUBE、ABP、VBench 等; 4、熟悉自动评测方法,例如 CLIPScore、TIFA、VQAScore、DSG、ImageReward、HPS、PickScore 等; 5、有较强英文写作能力,可以直接参与英文论文正文或 appendix 撰写; 6、有开源 Benchmark、Dataset、Leaderboard 或 GitHub 项目维护经验; 7、有较强数据可视化和实验图表制作能力。