拓达教育 Touchdown Education 拓达求职支持办公室Career Support Office touchdown.org.cn ↗
JobFinder为留学生筛选身份匹配的岗位

大模型规划算法工程师

理想汽车 · 北京 · 收录于 8月30日
评分
83
发布日期
收录于 8月30日 (4天前)
内推
暂无
公司规模
10k+
行业
汽车出行
投递编号
19838

岗位描述

  • 负责理想同学大模型规划算法的研发,包括任务拆解、意图识别、路径规划等,重点探索强化学习(RL)在决策与规划中的应用; 2. 参与Agent系统核心模块开发(Context管理、推理规划、工具调用、执行反馈),引入RL训练范式提升Agent的适应性与鲁棒性; 3. 利用RLHF、PPO等方法优化多轮对话中的模糊指令处理与跨轮任务目标; 4. 跟踪并复现ReAct、Plan-and-Execute、Reflexion等前沿范式,结合RL算法进行效果改进。 1. 学历要求:2027 届计算机、AI、NLP、数学等相关专业硕士及以上学历; 2. 基础能力:扎实的机器学习/深度学习基础,熟悉 Transformer 及主流大模型架构(GPT、LLaMA 等),熟练使用 Python 与PyTorch; 3. RL 专业能力:熟悉强化学习核心理论(MDP、PPO 等),有 RLHF、DPO 等对齐训练方法实践经验,了解 RL 框架者优先; 4. Agent 方向认知:了解对话理解、任务规划、Tool Use 等方向,对 ReAct、Plan-and-Execute、Reflexion 等 Agent前沿范式有认知; 5. 综合素质:良好的沟通与协作能力,能主动分析并解决问题;对 Agent / RL 方向有浓厚兴趣,愿意长期投入。

加入我的投递 →

理想汽车 的其他岗位

算法研发工程师实习生 · 北京 · 评分 89
Agent架构开发工程师-北京 · 北京 · 评分 86
产品经理实习生(智能眼镜影像) · 北京 · 评分 86
人工智能音乐生成实习生 · 北京 · 评分 86
多模态算法实习生 · 北京 · 上海 · 评分 86
大模型分布式训练系统与网络互联方向实习生 · 上海 · 评分 86

查看全部 →