JobConnect

多模态大模型算法工程师(OCR/文字理解方向)

  • ModelBest
  • Shanghai, Beijing +2 more, China
  • CNY 500,000 – CNY 800,000

北京、上海、成都、深圳社招全职技术 - 算法职位 ID:A229073

职位描述

1、OCR能力专项攻坚:负责多模态大模型OCR相关能力的建设与优化,包括但不限于复杂场景文字识别、文档解析、表格理解、版面分析、多语种OCR等方向的模型训练与效果提升。 2、数据体系建设:构建OCR/文档场景的大规模训练数据Pipeline,涵盖预训练数据清洗、SFT数据标注、评测集构建等环节,确保数据的质量、多样性和规模。 3、评测与闭环优化:建立OCR/文档场景的多维度评测体系,通过Badcase分析驱动模型迭代,形成“数据→训练→评测→优化”的正向循环。 4、前沿技术跟踪:持续追踪OCR/文档智能领域的前沿工作(如多模态文档理解、视觉富文本识别等),将新技术快速落地到模型迭代中。 5、协作与推进:与多模态理解、预训练、后训练等方向的同事紧密协作,推动模型整体能力的提升。

职位要求

1、2年以上多模态大模型(VLM)或多模态OCR/文档理解相关研发经验 2、熟悉Transformer架构及主流多模态模型(如Qwen-VL、InternVL、LLaVA等),有实际的SFT/RL训练经验 3、熟悉OCR/文档理解领域的关键技术(如版面分析、表格识别、Text-rich VQA等),了解该领域的技术演进路线 4、具备大规模多模态数据处理经验,熟悉数据清洗、标注、质量评估等数据工程建设方法 5、具备良好的沟通协作能力,能与算法、工程、数据团队高效配合 加分项 1、有多模态OCR相关论文发表(如CVPR、ICCV、ACL、NeurIPS等顶会) 2、有OCRBench、DocVQA、TextVQA等评测榜单的上榜经验或专项优化经验 3、有大规模多模态OCR数据集的构建经验 熟悉文档智能相关的模型架构(如Donut、LayoutLM、UDOP、GOT等)

投递

Skills

  • Multimodal Large Language Models
  • OCR
  • Document Understanding
  • Transformer Architecture
  • SFT/RL Training
  • Data Pipeline Engineering
  • PyTorch

Related jobs

ModelBestApply for this job