AI Infra Engineer (Agentic RL Training Framework)
- XPENG
- Shanghai, Beijing +1 more, China
- CNY 500,000 – CNY 800,000
深圳、北京、上海全职智能机器人板块
职位描述
参与机器人大模型强化学习训练框架的研发与优化,面向不同模型、训练方式和业务场景,完善训练与推理能力,提升框架的稳定性、扩展性和运行效率。通过框架开发、性能分析与算法工程协作,支撑大规模强化学习实验和业务训练,推动算法能力高效落地。 【职位描述】
- 训练框架研发:负责强化学习训练框架的设计、开发与迭代,完善 GRPO、PPO、On-Policy Distillation 等训练方式的完整流程、数值正确性与运行稳定性,统一训练数据、优化目标与参数更新的扩展接口;
- 核心模块与多后端适配:参与训练、推理、轨迹管理、奖励计算等核心模块研发,推进模块解耦与服务化,完善对 FSDP、Megatron、vLLM、SGLang 等训练与推理后端的适配层,支持不同模型、训练方式和业务场景的接入;
- 评测与性能优化:建设核心训练场景的 benchmark、profiling 与 CI 回归体系,理解不同训练场景的运行特征,定位影响端到端效率与资源利用率的关键瓶颈,结合真实业务负载开展优化并推动成果落地;
- 业务训练闭环:与算法团队协作完成具身模型 RL 后训练等真实业务的训练闭环,参与训练需求分析、技术方案设计与联调验证,支持新训练方法的接入与工程化落地;
- 自动化与研发效能:完善任务配置、实验追溯、排障诊断与模型交付工具及文档,降低实验配置、管理与排障成本,提升框架使用体验与算法研发效率。
职位要求
- 扎实的 Python 编程与软件工程能力,熟悉 Linux 开发环境,具备良好的代码设计、调试和维护能力;
- 熟悉 PyTorch,理解大模型训练与推理的基本流程,具有相关框架或基础设施的实际研发经验;
- 具备分布式训练或推理系统经验,熟悉 FSDP、Megatron、vLLM、SGLang 等框架中的至少一种,能够理解其执行机制并定位实际问题;
- 具备系统性能分析能力,能够结合 CPU、GPU、内存和通信等运行信息定位瓶颈,并通过实验验证优化效果;
- 了解强化学习中采样、训练、环境交互和权重更新的关系,能够理解算法需求并转化为合理的工程实现;
- 具备独立负责模块开发与问题闭环的能力,能够与算法及业务团队有效协作,完成方案设计、开发验证和持续迭代。 【加分项】
- 有 AReaL、verl、RLinf 等强化学习框架的使用、集成或开发经验;
- 有训练或推理框架源码开发、多后端适配、分布式通信或显存优化经验;
- 熟悉 PyTorch Profiler、Nsight 等性能分析工具,或具有 CUDA、Triton、算子优化相关经验;
- 有多模态、Agentic RL、异步强化学习等场景的工程实践,或有服务化、资源调度和自动调优相关经验。
投递
Skills
- Python
- PyTorch
- Distributed Training
- FSDP
- Megatron
- vLLM
- Reinforcement Learning







