岗位职责 高质量训练数据合成方案研究 调研并分析前沿的多模态大模型训练数据合成方法及最佳实践(例如CoSyn,MathCoderVL等) 多模态合成数据质量评估与迭代优化 建立合成数据的质量评估体系(如图像合理性,图像-文本匹配度等),设计自动化拒绝采样策略 基于下游任务的反馈,持续迭代优化数据合成 prompt、渲染代码与生成参数 数据合成工具链开发与平台工程化 根据研究成果,设计并开发基于代码渲染(例如LaTeX/Matplotlib/pyblender 等)的各类多模态数据合成工具链 构建并调优数据合成管线的核心模块,包括 prompt 模板库、渲染引擎调度、LLM/VLM 调用等模块 职位要求: 教育背景: 研究生在读,计算机/人工智能相关专业优先 技术能力: 熟悉Python编程语言,了解图像数据处理和分析的基本方法和工具。 多模态大模型原理理解: 对大模型基础原理,大模型训练数据(文本&图像)有一定的理解。 多模态数据合成经验: 具备基于代码生成合成图像的实践经验,熟悉至少一种渲染工具(例如Matplotlib、HTML/CSS、LaTeX、SVG等) 有使用 LLM/VLM API(GPT、Claude、Gemini 等)进行自动化数据生成的经验 了解合成数据质量评估方法,知晓不同domain的合成数据该用何种标准进行质量评估 学习能力: 具备利用大模型相关工具,快速学习和适应新知识、新技能的能力。 团队合作: 良好的沟通能力和团队合作精神,能够与团队成员密切合作。 实习时间: 持续3个月,可以6个月以上者优先 工作地点: 北京市海淀区苏州街大恒科技大厦 线下办公