【岗位描述 】 评测框架开发 :参与大模型自动化评测框架的设计、开发与维护,并支持训练框架上的联动开发,持续提升评测流程的稳定性、可扩展性和执行效率。 新指标接入 :跟进学术界与工业界最新的大模型评测基准(包括各类主客观/Agent Benchmark),负责将其快速、准确地集成到现有评测平台中。 数据处理与分析 :负责评测数据集的清洗、处理与管理,对海量评测结果进行统计分析、深度挖掘和可视化呈现,为模型优化提供数据洞见。 评测报告撰写 :协助团队完成多维度、多场景下的模型能力评测,并参与撰写发版模型技术报告。 【任职资格 】 基本要求 (Must-haves): 编程能力 :具备扎实的 Python 编程功底,代码风格良好,追求高质量的代码实现。 学历背景 :计算机科学、软件工程、人工智能、电子信息等相关专业在读本科或研究生。 实习时间 :能保证连续线下实习 3个月及以上 ,每周出勤不少于4天。 基础素质 :具备优秀的逻辑思维能力、快速学习能力和解决问题的能力,以及良好的沟通和团队协作精神。 加分项 (Nice-to-haves): 竞赛经历 :在 ACM/ICPC、信息学奥林匹克竞赛(NOI / OI / CSP)等编程竞赛中获得过优异成绩者优先。 大模型基础 :发表过 LLM 顶级会议论文 / 在主流开源 LLM 框架上有开发经验 / 大模型 Agent 系统开发经验者优先。 工程能力 :工程基础扎实,熟练使用 AI Agent 辅助 coding,有个人项目或开源社区贡献经验者优先。