【岗位定位】 本岗位致力于构建大模型的“感官”核心,定义小红书下一代多模态智能基座。小红书拥有业界最独特的图文与短视频 UGC 数据生态,是多模态模型落地最肥沃的土壤。你将负责 VLM 的 Post-training(SFT/RL) 与 架构演进,让模型不仅能“看见”,更能“洞察”与“推理”,深度赋能搜索、广告、推荐、电商、智能创作等全链路业务场景。 【工作职责】
- 核心模型研发:参与大规模视觉语言模型(VLM/MLLM)的预训练、微调和强化学习,优化模型在多模态理解、推理等任务上的表现;
- 数据闭环构建:探索高质量多模态数据的自动化清洗、标注与构造方案,从源头提升模型性能;
- 前沿技术探索:研究 Scaling Law、长文本/长视频理解、多模态 Agent 等前沿方向,保持团队技术领先性;
- 业务落地支撑:将 VLM 基础能力转化并赋能于小红书复杂的社区场景,解决实际的图文/视频理解难题。
- 专业背景:计算机、自动化、数学等相关专业在读,对多模态方向有浓厚兴趣;
- 技术功底:编程基础扎实,精通 Python,熟练掌握 PyTorch 框架,有分布式训练(DeepSpeed/Megatron-LM)经验者大加分;
- 算法理解:熟悉主流 VLM 架构(如 LLaVA, Qwen-VL, InternVL 等)及训练策略,对 Transformer 机制有深度理解;
- 加分项:在 CVPR、ICCV、NeurIPS、ICLR 等顶会发表过论文者优先;有大规模数据清洗或基础模型训练经验者优先;
- 实习要求:能长期实习,至少 4个月 以上,每周出勤 4天 及以上,Base 北京。