拓达教育 Touchdown Education 拓达求职支持办公室Career Support Office touchdown.org.cn ↗
JobFinder为留学生筛选身份匹配的岗位

【基座模型】全模态感知算法工程师

理想汽车 · 杭州 · 收录于 8月15日
评分
80
发布日期
收录于 8月15日 (2周前)
内推
暂无
公司规模
10k+
行业
汽车出行

岗位描述

汽车以及机器人全模态Edge模型建设,实现具身交互always on全模态感知能力,作为具身交互入口,判断用户和环境的交互意图,建设具备主动感知能力、工具调用、数字和物理世界统一建模、视频流与多模态记忆,可于马赫芯片高效部署的全模态底座模型。包括原生架构设计、视频流token压缩、编码器特征对齐、多模态统一空间、强化学习、多模态蒸馏、量化裁剪压缩等,作为具身交互中高层语义感知和理解的大脑,配合本体操作和移动,形成完成的具身智能汽车和机器人的交互体验:

  • 负责原生全模态大模型基座架构设计和训练交付,包含多模态大模型预训练、后训练和强化学习等;
  • 负责VL模型的蒸馏方案设计、长时序视觉Token压缩方案设计、隐式COT推理能力和空间理解能力增强等落地交付;
  • 配合harness方案,进行视觉大模型实际训练和落地,配合自研马赫芯片保证全模态基座模型在端侧达到性能和速度要求;
  • 负责多模态记忆提取和检索方案建设。
  • 硕士及以上学历,自动化、计算机等相关专业;
  • 必须有视觉VLM、VLA优化经验;
  • 优秀的代码技术功底,熟练掌握模型强化学习技术、多模态大模型模型蒸馏、视觉Token压缩、空间感知增强等技术中的一种。 具备以下条件优先:
  • 在NeurlPS/ICLR/ACL/EMNLP/CVPR/ICCV等会议或期刊上发表过论文者优先;
  • 获得过国际或国内重要赛事奖项者优先。
  • 在大模型领域有主导过有影响力项目或者核心技术发布者优先。 视觉大模型VLM、多模态强化学习后训练、视觉流建模、token压缩方向研发及实习经验为佳

加入我的投递 →

理想汽车 的其他岗位

算法研发工程师实习生 · 北京 · 评分 89
Agent架构开发工程师-北京 · 北京 · 评分 86
产品经理实习生(智能眼镜影像) · 北京 · 评分 86
人工智能音乐生成实习生 · 北京 · 评分 86
多模态算法实习生 · 北京 · 上海 · 评分 86
大模型分布式训练系统与网络互联方向实习生 · 上海 · 评分 86

查看全部 →