AI Infra Engineer(预训练框架与性能优化)
- XPENG
- Shanghai, Beijing +1 more, China
- CNY 500,000 – CNY 900,000
深圳、北京、上海全职智能机器人板块
职位描述
面向 VLA 与 World Action Model(视频生成与多模态模型)的预训练需求,参与自研训练框架的开发与演进。通过训练性能分析、分布式执行优化、训练稳定性治理与算法工程协作,提升训练效率与资源利用率,降低训练成本,逐步推动预训练、微调、蒸馏与强化学习共用核心基础能力,支撑不同模型和业务场景的持续扩展。 【职位描述】
- 训练框架研发:负责预训练框架核心模块的设计、开发与迭代,支持模型、数据、优化器与训练策略的灵活接入;建设统一的训练执行与状态管理机制,完善 checkpoint 保存恢复、指标记录与评测接口,保障训练正确性、可复现性与兼容性;
- 端到端性能优化:建立性能分析与评测体系,定位数据处理、计算、显存和通信等环节的瓶颈;优化数据加载与预处理流水线、模型计算与显存使用,评估算子优化、编译、低精度等技术的收益,提升 GPU 有效利用率与训练吞吐;
- 分布式训练与规模扩展:优化并行策略、通信与计算重叠及负载均衡;开展 NCCL 集合通信性能分析与优化,结合 GPU 互联和网络拓扑定位带宽、时延和慢节点问题,完成百卡到千卡规模的扩展验证与容量规划;
- 训练可靠性与工程效能:建设训练监控、日志、告警与诊断能力,定位并解决 OOM、NaN、卡死等稳定性问题;完善训练状态保存、故障恢复和重试机制,开展故障演练与复盘,降低长任务中断与人工干预;
- 公共训练能力沉淀:推进分布式执行、资源管理、保存恢复与性能分析等公共能力的抽象与复用,支持预训练与强化学习框架的融合,使视频模型预训练与现有 RL 任务共用核心基础能力。
职位要求
- 扎实的 Python 编程与软件工程能力,熟悉 PyTorch,能够独立完成模块设计、开发、调试与验证;
- 具有大模型训练框架或分布式训练系统研发经验,熟悉 FSDP、Megatron、DeepSpeed 等框架中的至少一种;
- 熟悉并行训练、显存管理、分布式通信等关键机制,了解 GPU 计算、显存管理与异步执行机制;
- 具备系统性能分析与优化能力,熟悉 PyTorch Profiler、Nsight 等工具,能够结合 CPU、GPU、内存和通信等运行信息定位问题;
- 了解 Transformer、扩散模型等模型的基本计算特点,能够理解算法需求并转化为合理的工程实现;
- 具备复杂训练任务的排障经验和良好的协作能力,能够与算法团队共同完成问题定位、方案验证和持续改进。 【加分项】
- 有视频生成、多模态模型或 DiT 训练经验,熟悉 FastVideo、DiffSynth-Studio、Diffusers 等项目;
- 熟悉 NCCL 及 AllReduce、AllGather、ReduceScatter 等集合通信机制,具备通信性能测试、调优或故障定位经验;
- 有 CUDA / Triton 算子开发、编译优化、低精度训练或高性能数据处理经验;
- 有大规模 GPU 集群、分布式 checkpoint、训练故障治理或运维工具开发经验;
- 有 AReaL、verl、RLinf 等强化学习框架的使用或开发经验,参与过多类训练流程的整合与公共模块设计。
投递
Skills
- PyTorch
- Distributed Training
- NCCL
- Performance Optimization
- FSDP
- Megatron
- CUDA







