← 返回岗位列表
【基座模型】测试开发工程师-上海
- 评分
- 80
- 发布日期
- 收录于 8月15日 (2周前)
- 内推
- 暂无
- 公司规模
- 10k+
- 行业
- 汽车出行
岗位描述
- 参与模型评测体系建设,支持通用能力、垂类任务能力及复杂场景能力的评估; 2. 参与设计并实现模型自动化评测流程,包括数据构造、任务定义、结果采集、分析报告生成等; 3. 参与仿真评测环境的构建,Agent任务执行、工具调用、复杂业务流程等场景设计模拟任务和测试机制; 4. 参与评测指标(Metrics)开发,包括各评测维度的指标设计与落地; 5. 协助构建评测数据集与Benchmark,持续提升评测集的覆盖度、区分度和稳定性; 6. 分析模型评测结果,定位问题模式,推动形成数据—评测—优化—复盘的闭环; 7. 参与评测平台、评测工具链和可视化分析能力建设,提升评测效率和结果可解释性; 8. 跟踪模型评测前沿研究,探索更科学的评测方法与更高效的自动评测策略。 1. 计算机、人工智能、数学、统计学、信息工程、软件工程等相关专业,本科以上学历; 2. 仿真评测、模型评测或数据分析方向有浓厚兴趣,有相关项目经历者优先; 3. 扎实的编程基础,熟悉至少一种编程语言,如 Python、C++等,具备良好的代码实现能力; 3. 了解常见机器学习、仿真环境,理解训练、推理、评测等基本流程; 4. 具备良好的逻辑分析能力和数据敏感度,能够从评测结果中发现问题并进行归因分析。 有以下任一经验者优先: 1. 有Benchmark构建、数据标注策略设计、评测指标设计经验; 2. 熟悉Prompt、RAG、Agent、工具调用、多轮对话等相关技术; 3. 有仿真环境、自动化测试、A/B实验、数据分析等经验。 4.测试开发相关实习经验 工作素质: 具备良好的沟通协作能力和学习能力,能够与算法、产品、工程等多角色高效配合。
加入我的投递 →