1、参与Benchmark设计,协助定义多模态生成评测任务、能力维度、Taxonomy、数据 Schema 和评测协议;
2、参与评测数据构建,负责评测 Case 的设计、筛选、标注规范制定、质量检查和数据统计分析;
3、参与自动化评测方案设计,协助设计 LLM-as-Judge / MLLM-as-Judge /自训判分模型流程;
4、参与模型评估与结果分析,对主流文生图 / 多模态生成模型进行横向评测,完成能力切片、失败归因、Case study 和实验结论整理;
5、参与论文撰写与投稿支持,协助完成相关论文材料,支持投稿与 rebuttal 准备。
1、计算机、人工智能、机器学习、计算机视觉、自然语言处理、多模态、数据科学等相关专业;
2、有较强英文论文阅读能力,能够系统梳理Related work 并提炼研究gap;
3、有较好的学术写作能力,能够参与英文论文初稿、实验分析和技术附录撰写;
4、有完整科研项目经历,理解从 idea、实验设计、结果分析到 paper writing 的基本流程;
5、有学术论文发表或投稿经验优先,有 Benchmark、Dataset、Evaluation、Leaderboard、Human Evaluation、Automatic Evaluation 相关工作经验优先;
6、参与过多模态、文生图、图文理解、VQA、MLLM、LLM-as-Judge、AIGC 评测等方向论文者优先;
7、熟悉论文实验设计、Ablation Study、Human Evaluation、Statistical Analysis、Case Study等基本范式;
8、熟悉 Python,能够完成数据处理、实验统计、指标计算和结果可视化;
9、熟悉 JSON、CSV、Pandas、Matplotlib、Jupyter 等常用数据分析工具;
10、了解常见大模型 / 多模态模型调用方式,例如 OpenAI API、Gemini API、Claude API、Transformers、Hugging Face 等;
11、具备基础工程能力,能够维护实验脚本、数据处理 pipeline 和结果分析代码。
加分项:
1、以第一作者或核心作者发表过 Benchmark / Dataset / Evaluation 相关论文;
2、有 NeurIPS、ICLR、ICML、CVPR、ICCV、ECCV、ACL、EMNLP、SIGGRAPH、AAAI、MM 等会议论文经验;
3、熟悉文生图或多模态生成方向 Benchmark,例如 T2I-CompBench、PhyBench、T2I-FactualBench、GenAI-Bench、WISE、CUBE、ABP、VBench 等;
4、熟悉自动评测方法,例如 CLIPScore、TIFA、VQAScore、DSG、ImageReward、HPS、PickScore 等;
5、有较强英文写作能力,可以直接参与英文论文正文或 appendix 撰写;
6、有开源 Benchmark、Dataset、Leaderboard 或 GitHub 项目维护经验;
7、有较强数据可视化和实验图表制作能力。