拓达教育 Touchdown Education 拓达求职支持办公室Career Support Office touchdown.org.cn ↗
JobFinder为留学生筛选身份匹配的岗位

多模态理解算法研究员

快手 · 北京 · 深圳 · 8月11日 · 3周前
评分
83
发布日期
8月11日 (3周前)
内推
暂无
公司规模
10k+
行业
互联网

岗位描述

1、承担视频Caption和参考生成的Instruction职责,特别是在多分镜、高动态、长视频等场景提供精准、全面的描述,最大化弥合文本模态和视频模态之间的差异; 2、承担Agentic PE的职责,对用户指令进行精准、有效、丰富的改写,从15秒片段效果和分钟级成片两个角度实现最佳的PE,控制视频生成模型产出最符合用户需求的视频内容; 3、承担Reward model的职责,能够客观、稳定地评价模型画面、运动、合理性等方面的表现,辅助视频模型训练监控、模型版本选择; 4、承担理解基模后训练的职责,充分利用可灵数据训练最适合团队的多模态理解基座模型,支撑可灵全链路的数据算法、理解算法任务。 1、有音视频理解、多模态Caption、理解生成一体化、理解/生成Benchmark等方向的经验,有大厂实习、顶会论文优先; 2、有自主开发能力且能用好Agent进行日常工作辅助开发,有多模态理解模型训练经验优先; 3、重视多模态理解能力在实际工业场景的价值,痴迷业务价值而不是绝对榜单分数; 4、有理解、生成模型能力水位的客观判断能力,有实际动手验证的能力,对自身能力保持清晰认知; 5、有良好的协作与沟通能力,能积极与团队进行沟通,能准确、清晰表达自己的需求。

加入我的投递 →

快手 的其他岗位

【留用实习】AI Agent 全栈工程师-音视频方向 · 北京 · 评分 90
游戏客户端开发工程师 · 杭州 · 中国 · 评分 88
智能媒体处理研发工程师 · 北京 · 评分 87
策略开发工程师-数据安全方向 · 北京 · 中国 · 评分 87
AI商业化产品经理-PDE · 北京 · 中国 · 评分 87
大模型数据引擎工程师 · 北京 · 评分 86

查看全部 →