JobConnect

AI Infra Engineer (Agentic RL Training Framework)

  • XPENG
  • Shanghai, Beijing +1 more, China
  • CNY 500,000 – CNY 800,000

深圳、北京、上海全职智能机器人板块

职位描述

参与机器人大模型强化学习训练框架的研发与优化,面向不同模型、训练方式和业务场景,完善训练与推理能力,提升框架的稳定性、扩展性和运行效率。通过框架开发、性能分析与算法工程协作,支撑大规模强化学习实验和业务训练,推动算法能力高效落地。 【职位描述】

  1. 训练框架研发:负责强化学习训练框架的设计、开发与迭代,完善 GRPO、PPO、On-Policy Distillation 等训练方式的完整流程、数值正确性与运行稳定性,统一训练数据、优化目标与参数更新的扩展接口;
  2. 核心模块与多后端适配:参与训练、推理、轨迹管理、奖励计算等核心模块研发,推进模块解耦与服务化,完善对 FSDP、Megatron、vLLM、SGLang 等训练与推理后端的适配层,支持不同模型、训练方式和业务场景的接入;
  3. 评测与性能优化:建设核心训练场景的 benchmark、profiling 与 CI 回归体系,理解不同训练场景的运行特征,定位影响端到端效率与资源利用率的关键瓶颈,结合真实业务负载开展优化并推动成果落地;
  4. 业务训练闭环:与算法团队协作完成具身模型 RL 后训练等真实业务的训练闭环,参与训练需求分析、技术方案设计与联调验证,支持新训练方法的接入与工程化落地;
  5. 自动化与研发效能:完善任务配置、实验追溯、排障诊断与模型交付工具及文档,降低实验配置、管理与排障成本,提升框架使用体验与算法研发效率。

职位要求

  1. 扎实的 Python 编程与软件工程能力,熟悉 Linux 开发环境,具备良好的代码设计、调试和维护能力;
  2. 熟悉 PyTorch,理解大模型训练与推理的基本流程,具有相关框架或基础设施的实际研发经验;
  3. 具备分布式训练或推理系统经验,熟悉 FSDP、Megatron、vLLM、SGLang 等框架中的至少一种,能够理解其执行机制并定位实际问题;
  4. 具备系统性能分析能力,能够结合 CPU、GPU、内存和通信等运行信息定位瓶颈,并通过实验验证优化效果;
  5. 了解强化学习中采样、训练、环境交互和权重更新的关系,能够理解算法需求并转化为合理的工程实现;
  6. 具备独立负责模块开发与问题闭环的能力,能够与算法及业务团队有效协作,完成方案设计、开发验证和持续迭代。 【加分项】
  7. 有 AReaL、verl、RLinf 等强化学习框架的使用、集成或开发经验;
  8. 有训练或推理框架源码开发、多后端适配、分布式通信或显存优化经验;
  9. 熟悉 PyTorch Profiler、Nsight 等性能分析工具,或具有 CUDA、Triton、算子优化相关经验;
  10. 有多模态、Agentic RL、异步强化学习等场景的工程实践,或有服务化、资源调度和自动调优相关经验。

投递

Skills

  • Python
  • PyTorch
  • Distributed Training
  • FSDP
  • Megatron
  • vLLM
  • Reinforcement Learning

Related jobs

XPENGApply for this job