JobConnect

Large Model Algorithm Researcher

  • XPENG
  • Shanghai, Beijing +1 more, China
  • CNY 300,000 – CNY 600,000

大模型算法研究员

深圳、北京、上海全职智能机器人板块

职位描述

我们正在探索面向真实世界任务的大模型与智能体技术,重点关注大模型后训练、Agent 能力构建,以及大模型与具身智能的结合。你将参与大模型算法的研究、训练与评测工作,探索如何通过高质量数据、监督微调、强化学习和交互式训练等方法,提升模型在推理、工具使用、长程任务与复杂环境中的能力,并推动相关技术在机器人及具身智能场景中的落地。 主要工作包括: 1、负责大模型后训练相关算法的研究与开发,包括但不限于监督微调、强化学习、在线蒸馏及持续学习等方向。 2、负责训练数据的构建、清洗、筛选与分析,探索数据组成、数据质量及训练策略对模型能力的影响。 3、探索大模型 Agent 相关技术,包括工具调用、任务规划、环境交互、记忆、反思与长程任务执行等能力。 4、探索大模型与具身智能的结合,研究大模型在机器人任务理解、高层决策、环境交互和复杂任务执行中的应用。 5、设计并搭建模型训练与评测流程,分析模型行为、训练稳定性和能力边界,持续推动模型效果迭代。 6、跟进大模型、Agent、强化学习和具身智能领域的前沿研究,形成可验证的技术方案,并推动研究成果落地。 7、与算法、工程、机器人及产品团队协作,完成从算法研究、实验验证到系统部署的完整闭环。

职位要求

1、计算机科学、人工智能、自动化或相关专业硕士及以上学历,优秀本科毕业生亦可考虑。 2、具备扎实的机器学习和深度学习基础,理解 Transformer、大语言模型训练及自回归生成的基本原理。 3、熟悉大模型后训练中的一种或多种方法,包括监督微调、偏好学习、强化学习、知识蒸馏或模型融合等。 4、具备良好的编程能力,熟练使用 Python,熟悉 PyTorch 等深度学习框架,能够独立完成算法实现、实验设计与问题排查。 5、具备大规模数据处理经验,能够完成训练数据的清洗、转换、采样、质量分析与数据管线开发。 6、具备大模型训练或微调经验,了解分布式训练、显存优化、推理部署及常见训练框架和工具。 7、具备较强的实验分析能力,能够根据训练曲线、评测结果和模型输出定位问题,并提出合理的改进方案。 8、对大模型 Agent、强化学习或具身智能方向有浓厚兴趣,愿意探索尚未形成标准答案的研究问题。 9、具备良好的沟通和协作能力,能够清晰表达研究思路、实验结论与技术判断。 【加分项】 1、在大语言模型后训练、强化学习、Agent、具身智能或机器人学习方向有实际研究或项目经验。 2、熟悉 SFT、DPO、PPO、GRPO、RLHF、RLAIF、RLVR 等训练方法,并有完整训练或调优经验。 3、具备 Agent 系统或交互环境开发经验,例如工具调用、多轮决策、长期记忆、任务规划、环境反馈或多智能体系统。 4、具备机器人、具身智能、仿真环境或视觉语言模型相关经验,熟悉机器人任务规划、环境建模或多模态交互。 5、具备高质量训练数据建设经验,包括数据生成、数据清洗、难度分层、拒绝采样、质量评估或数据配比优化。 6、在 NeurIPS、ICML、ICLR、ACL、EMNLP、AAAI、CVPR、CoRL、ICRA、IROS 等相关会议或期刊发表过论文。 7、在相关竞赛、开源项目或模型研发项目中取得突出成果,或对开源社区有持续贡献。 8、具备较强的研究敏感度,能够快速理解前沿工作、识别关键问题,并将研究思路转化为可执行的实验方案。

投递

Skills

  • Python
  • PyTorch
  • Large Language Models
  • Reinforcement Learning
  • Supervised Fine-Tuning
  • Distributed Training
  • Data Engineering

Related jobs

XPENGApply for this job