汽车以及机器人全模态Edge模型建设,实现具身交互always on全模态感知能力,作为具身交互入口,判断用户和环境的交互意图,建设具备主动感知能力、工具调用、数字和物理世界统一建模、视频流与多模态记忆,可于马赫芯片高效部署的全模态底座模型。包括原生架构设计、视频流token压缩、编码器特征对齐、多模态统一空间、强化学习、多模态蒸馏、量化裁剪压缩等,作为具身交互中高层语义感知和理解的大脑,配合本体操作和移动,形成完成的具身智能汽车和机器人的交互体验:
- 负责原生全模态大模型基座架构设计和训练交付,包含多模态大模型预训练、后训练和强化学习等;
- 负责VL模型的蒸馏方案设计、长时序视觉Token压缩方案设计、隐式COT推理能力和空间理解能力增强等落地交付;
- 配合harness方案,进行视觉大模型实际训练和落地,配合自研马赫芯片保证全模态基座模型在端侧达到性能和速度要求;
- 负责多模态记忆提取和检索方案建设。
- 硕士及以上学历,自动化、计算机等相关专业;
- 必须有视觉VLM、VLA优化经验;
- 优秀的代码技术功底,熟练掌握模型强化学习技术、多模态大模型模型蒸馏、视觉Token压缩、空间感知增强等技术中的一种。 具备以下条件优先:
- 在NeurlPS/ICLR/ACL/EMNLP/CVPR/ICCV等会议或期刊上发表过论文者优先;
- 获得过国际或国内重要赛事奖项者优先。
- 在大模型领域有主导过有影响力项目或者核心技术发布者优先。 视觉大模型VLM、多模态强化学习后训练、视觉流建模、token压缩方向研发及实习经验为佳