拓达教育 Touchdown Education 拓达求职支持办公室Career Support Office touchdown.org.cn ↗
JobFinder为留学生筛选身份匹配的岗位

实习-后训练基础设施算法工程师

阶跃星辰 · 中国 · 6月18日 · 2个月前
评分
84
发布日期
6月18日 (2个月前)
内推
暂无
公司规模
201-500
行业
人工智能

岗位描述

岗位方向 参与大模型后训练中的 Agent 数据合成、评测诊断与基础设施建设 ,围绕 Long-Horizon Agent、代码 Agent、工具调用、多模型协作等方向,构建可用于 SFT/RL 的高质量轨迹数据与自动化评测体系。 岗位职责 设计并搭建面向 SFT/RL 的 Agent 轨迹合成 pipeline,支持多模型、多 scaffold、多策略生成训练数据; 建设 Agent 执行框架,支持任务规划、工具调用、代码修改、测试执行、失败恢复与 checkpoint 续跑; 构建 Agent 评测与诊断系统,支持 Rubric Eval、LLM-as-Judge、Failure Onset 定位和轨迹清洗; 接入 SWE-Bench、代码修复、工具调用、长上下文任务等 benchmark,形成自动化评测闭环; 分析模型在规划、工具使用、代码理解、错误恢复等方面的能力短板,并反哺数据与训练迭代。 任职要求 熟悉大模型后训练流程,了解 SFT、RLHF、GRPO/PPO 等方法; 具备扎实的 Python 工程能力,能够独立搭建数据 pipeline、评测系统或 agent runtime; 熟悉 LLM Agent 基本范式,如 ReAct、Planner-Executor、Tool Calling、Multi-Agent 等; 有代码 Agent、SWE-Bench、自动化代码修复、工具调用或长上下文任务经验者优先; 对数据质量、评测可信度、失败样本分析和训练闭环有较强理解。 加分项 有 Claude Code、Codex、OpenHands、SWE-agent、DeerFlow、MCP 等相关经验; 有大规模 SFT/RL 数据生产、trajectory synthesis、LLM-as-Judge 或 verifier 设计经验; 熟悉容器沙箱、Ray、Kubernetes、异步任务调度、Git patch/test loop 等工程系统; 熟悉 context engineering、memory、summary、retrieval、context compression 等长上下文技术。 期望产出 搭建稳定可复用的 Agent 数据合成与评测 pipeline; 提升代码任务、工具调用任务、长任务规划类 benchmark 的通过率; 形成从轨迹生成、评测诊断、数据清洗到 SFT/RL 训练的闭环。

加入我的投递 →

阶跃星辰 的其他岗位

算法工程师实习生(金融方向) · 上海 · 评分 96
27届-AI硬件测试工具开发工程师 · 上海 · 深圳 · 评分 93
27届-Agent 开发工程师(企业信息化方向) · 上海 · 评分 93
27届-产品经理(企业信息化方向) · 上海 · 评分 93
27届-安全开发工程师 · 上海 · 评分 93
27届-影像平台软件工程师 · 上海 · 评分 93

查看全部 →