AI Infra Engineer (Agentic Runtime)
- XPENG
- Shanghai, Beijing +1 more, China
- CNY 400,000 – CNY 800,000
深圳、北京、上海全职智能机器人板块
职位描述
参与从 0 到 1 建设具身学习基础设施平台,为机器人大模型的强化学习后训练、评测与自迭代提供统一的环境服务与策略推理能力。以仿真环境和策略推理为切入点,通过资源调度、系统性能优化和运行保障,提高有效样本产出,降低实验等待与资源成本,并逐步扩展至端侧和真机执行场景。 【职位描述】
- 环境与 Rollout 服务平台建设:建设共享 Sandbox 资源池与执行服务,实现环境申请、初始化、隔离、重置、回收与运行观测;对接强化学习训练框架,支撑真实具身模型训练与评测任务;
- 策略推理集成与优化:集成和优化 vLLM、SGLang 等推理引擎,建设策略服务部署、路由与资源管理能力;结合业务负载优化批处理、缓存、多模态处理与模型执行效率,保障权重更新与模型版本关联的正确性;
- 资源画像与动态调度:根据任务类型、环境资产和实际资源用量建立资源画像,设计预热、资产亲和、配额管理与动态扩缩容策略,通过运行反馈持续优化资源申请规格、并发配置与调度效率;
- 端到端性能分析:分析环境准备、仿真执行、观测传输、策略推理及权重同步等阶段的瓶颈,建立可复现的性能基线,以有效 Rollout 吞吐、端到端时延和资源成本验证优化收益;
- 稳定性与执行正确性保障:完善故障检测、超时处理、背压、恢复与资源清理机制,支持长时间无人值守运行;建立任务、环境、轨迹、Reward 与 Policy 版本的关联追溯,保障执行隔离与样本正确性;
- 标准化接入与架构演进:设计可扩展的任务与 Runtime 接口,支持 Isaac Sim、Unity 等仿真环境,以及强化训练、评测、Replay 等业务复用平台能力,为后续边缘节点、台架和机器人接入奠定基础。
职位要求
- 扎实的 Python 编程与软件工程能力,熟悉 C++ / Go 至少一门,熟悉并发、异步、网络通信及 Linux 系统,能够独立定位复杂系统问题;
- 有分布式平台或计算服务研发经验,熟悉 Kubernetes、Ray 等技术中的至少一种,理解资源调度、服务生命周期、状态管理和故障恢复;
- 熟悉大模型或多模态模型推理流程,具有 vLLM、SGLang 或同类推理系统的部署、集成或性能优化经验;
- 具备系统性能分析能力,能够结合 CPU、GPU、内存、网络及应用链路数据定位瓶颈,并通过对照测试验证收益;
- 了解强化学习系统中训练、Rollout、环境交互和权重同步的关系,能够与算法团队共同保障采样与训练链路的正确性;
- 有可维护、可观测的平台服务建设经验,能够从实际业务需求出发完成设计、开发、上线及持续优化。 【加分项】
- 有 AReaL、verl、RLinf 等强化学习框架的使用、集成或开发经验;
- 有 Isaac Sim、Isaac Lab、Unity、MuJoCo 等机器人仿真或云游戏平台相关经验;
- 熟悉 PyTorch Profiler、Nsight Systems、Nsight Compute,或具备 CUDA、Triton、CUDA Graph、算子及通信优化经验;
- 有 GPU 资源池、异构计算、云边协同、端侧模型部署或真机任务执行系统的建设经验。
投递
Skills
- Python
- Kubernetes
- Ray
- vLLM
- SGLang
- GPU Performance Optimization
- Reinforcement Learning Systems




