岗位职责 你将参与工业级 LLM 预训练数据体系的构建与优化,包括但不限于: 从 Web、Book、Code 等多源数据中进行数据挖掘与质量分析,直接贡献到万亿级别 token 的高质量语料库; 利用大规模 CPU/GPU 集群优化数据管线,支撑 PB 级数据的处理与持续迭代; 参与数据策略制定与消融实验设计,深度分析不同数据方案对模型能力(知识、推理、表达等)的影响。 任职要求 计算机、数学、数据科学等相关专业,本科及以上学历; CS/Coding 功底扎实,熟悉 Python,具备深度学习/强化学习基础知识; 对数据科学有兴趣,有较好的数据 sense,能从大规模数据分析与实验中识别影响模型表现的关键信号; 具备强烈的好奇心与自驱力,对 AI 数据体系建设与模型优化充满热情; (加分项) 有参与 LLM 预训练数据相关工作的经验(如开源数据集构建、评测集设计、数据清洗 pipeline 等)优先; 每周不少于4天到岗,且能实习3个月以上。