岗位概述:
测试大语言模型(LLM)的生成质量、一致性、安全性、多语言能力等。重点关注模型输出的准确性和可靠性。
岗位要求:
1.构建 LLM 测试用例库:包括文本理解、代码生成、多轮对话、知识问答等
2.设计评估指标体系:准确率、相关性、毒性检测、幻觉评估等
3.执行黄金测试集测试:对 LLM 输出进行人工或自动打分
4.使用 LLM-as-a-Judge 方法进行大规模自动评估
5.红队测试:通过对抗性提示词测试模型边界和安全性
6.多语言测试:验证模型在中文、英文、印度语等市场语言上的表现
7.性能监控:跟踪模型输出延迟、成本、稳定性
1.本科及以上学历(计算机、NLP、数学相关经验等专业)
2.Python 编程能力强
3.对大语言模型有基本认知(理解 Transformer、Token、Prompt 概念)
4.逻辑严谨,能设计系统的评估方案
5.有数据标注或质量评估经验(优先)
加分项:
1.使用过 ChatGPT、Claude、国内大模型的实际体验
2.理解 Prompt Engineering 基础
3.有 NLP 课程设计或竞赛经验
4.了解评估指标:BLEU、ROUGE、BERTScore 等
5.参与过文本分类、情感分析等 NLP 项目
6.对文史哲感兴趣且有对应背景知识