岗位职责 泛OCR领域多模态大模型学术进展跟进: 跟踪学术界与工业界最新发布的文档解析、图表理解(Chart,diagram等)、STEM相关图像理解 等相关领域工作,定期进行总结分享 深入理解目前广泛使用的OCR评估体系(如NED、CDM、TEDS等指标),参与评测基准的构建与维护,并设计更贴近用户体感的OCR评测方案 泛OCR数据建设 调研并分析经典文档图像/图表合成方法(如SynthDoG)及其他OCR训练数据合成最佳实践(如Cosyn),据此参与设计与开发高效的数据合成pipeline,覆盖各泛OCR子任务 调研基于LaTeX/HTML/Markdown的文档页渲染方法,参与搭建并优化相关pipeline与工程实现 探索适合泛OCR任务的数据增强技术,包括几何变换、噪声注入等,并在实际数据上应用 OCR专家模型训练 探索并设计/优化适合OCR任务的VLM训练算法/模型结构 探索并搭建泛OCR领域的数据飞轮,寻求数据-模型协同进化的训练策略 职位要求 教育背景 研究生在读,计算机/人工智能/模式识别相关专业优先 技术能力 熟练掌握Python编程,熟悉OpenCV、PIL等图像处理库 熟练掌握Pytorch等深度学习训练框架,同时熟练掌握Transformer/Megatron等大模型训练框架 深入理解多模态大模型(VLM)基础原理,对泛OCR相关任务有一定基础认知 经验要求 (优先)具备文档图像处理经验,了解传统文本检测(DB、EAST等)、传统文本识别(CTC等)、表格识别等经典OCR方法的同学优先 (优先)熟悉最新OCR相关工作(例如DeepSeekOCR2,MinerU2.5,PaddleOCR-VL等)的同学优先 (优先)有泛OCR数据合成,LaTeX/HTML/Markdown渲染工程经验的同学优先 工程与学习能力 具备利用大模型工具快速学习新技术的能力,能独立阅读前沿论文并获取关键insight (优先)有大规模数据处理、分布式训练经验的同学优先 团队协作 良好的沟通能力和团队合作精神,能够与算法、工程团队密切协作 实习信息 实习时间:实习6个月或以上 工作地点:北京市海淀区苏州街大恒科技大厦 线下办公