- 参与模型评测体系建设,支持通用能力、垂类任务能力及复杂场景能力的评估;
- 参与设计并实现模型自动化评测流程,包括数据构造、任务定义、结果采集、分析报告生成等;
- 参与仿真评测环境的构建,Agent任务执行、工具调用、复杂业务流程等场景设计模拟任务和测试机制;
- 参与评测指标(Metrics)开发,包括各评测维度的指标设计与落地;
- 协助构建评测数据集与Benchmark,持续提升评测集的覆盖度、区分度和稳定性;
- 分析模型评测结果,定位问题模式,推动形成数据—评测—优化—复盘的闭环;
- 参与评测平台、评测工具链和可视化分析能力建设,提升评测效率和结果可解释性;
- 跟踪模型评测前沿研究,探索更科学的评测方法与更高效的自动评测策略。
- 计算机、人工智能、数学、统计学、信息工程、软件工程等相关专业,本科以上学历;
- 仿真评测、模型评测或数据分析方向有浓厚兴趣,有相关项目经历者优先;
- 扎实的编程基础,熟悉至少一种编程语言,如 Python、C++等,具备良好的代码实现能力;
- 了解常见机器学习、仿真环境,理解训练、推理、评测等基本流程;
- 具备良好的逻辑分析能力和数据敏感度,能够从评测结果中发现问题并进行归因分析。
有以下任一经验者优先:
- 有Benchmark构建、数据标注策略设计、评测指标设计经验;
- 熟悉Prompt、RAG、Agent、工具调用、多轮对话等相关技术;
- 有仿真环境、自动化测试、A/B实验、数据分析等经验。
4.测试开发相关实习经验
工作素质:
具备良好的沟通协作能力和学习能力,能够与算法、产品、工程等多角色高效配合。