岗位方向 参与大模型后训练中的 Agent 数据合成、评测诊断与基础设施建设 ,围绕 Long-Horizon Agent、代码 Agent、工具调用、多模型协作等方向,构建可用于 SFT/RL 的高质量轨迹数据与自动化评测体系。 岗位职责 设计并搭建面向 SFT/RL 的 Agent 轨迹合成 pipeline,支持多模型、多 scaffold、多策略生成训练数据; 建设 Agent 执行框架,支持任务规划、工具调用、代码修改、测试执行、失败恢复与 checkpoint 续跑; 构建 Agent 评测与诊断系统,支持 Rubric Eval、LLM-as-Judge、Failure Onset 定位和轨迹清洗; 接入 SWE-Bench、代码修复、工具调用、长上下文任务等 benchmark,形成自动化评测闭环; 分析模型在规划、工具使用、代码理解、错误恢复等方面的能力短板,并反哺数据与训练迭代。 任职要求 熟悉大模型后训练流程,了解 SFT、RLHF、GRPO/PPO 等方法; 具备扎实的 Python 工程能力,能够独立搭建数据 pipeline、评测系统或 agent runtime; 熟悉 LLM Agent 基本范式,如 ReAct、Planner-Executor、Tool Calling、Multi-Agent 等; 有代码 Agent、SWE-Bench、自动化代码修复、工具调用或长上下文任务经验者优先; 对数据质量、评测可信度、失败样本分析和训练闭环有较强理解。 加分项 有 Claude Code、Codex、OpenHands、SWE-agent、DeerFlow、MCP 等相关经验; 有大规模 SFT/RL 数据生产、trajectory synthesis、LLM-as-Judge 或 verifier 设计经验; 熟悉容器沙箱、Ray、Kubernetes、异步任务调度、Git patch/test loop 等工程系统; 熟悉 context engineering、memory、summary、retrieval、context compression 等长上下文技术。 期望产出 搭建稳定可复用的 Agent 数据合成与评测 pipeline; 提升代码任务、工具调用任务、长任务规划类 benchmark 的通过率; 形成从轨迹生成、评测诊断、数据清洗到 SFT/RL 训练的闭环。