AI Infra工程师(大模型推理优化方向)
- XPENG
- Shanghai, Beijing +1 more, China
- CNY 300,000 – CNY 500,000
北京、上海、广州正式互联网 / 电子 / 网游
职位描述
1、负责小鹏大模型推理技术在物理AI场景下的工程搭建及落地,包括但不限于自动驾驶,舱驾融合,机器人等场景 2、负责小鹏大模型推理引擎XLLM的核心特性开发,包括但不限于kv cache管理,FlashAttention设计及优化,投机解码 3、负责小鹏大模型推理引擎XLLM的加速优化,包括模型结构优化(MoE,Diffusion)及底层计算加速(INT4、INT8)。 4、负责小鹏大模型压缩技术探索,涵盖量化(QAT/PTQ)、剪枝、蒸馏、稀疏化、NAS等
职位要求
1、硕士研究生及以上学历,计算机及相关专业; 2、有扎实的数据结构与算法基础,熟悉python或C/C++。 3、熟悉并掌握主流模型压缩技术,如量化(GPTQ/AWQ/SmoothQuant)、剪枝(Sheared-LLaMa)、蒸馏及NAS。 4、熟悉LLM推理框架(如vLLM,SGLang,TensorRT-LLM)及优化加速技术(如Flashattention、KV Cache Management,Speculative-Decoding)。 5、具备LLM推理优化和加速技术的实践经验。 6、拥有深入研究精神、创新能力及持续学习意愿。 加分项: 1、熟悉GPU/NPU硬件架构,能使用CUDA、CUTLASS进行编程优化。 2、有异构计算加速或芯片级性能调优经验。
投递
Skills
- LLM inference optimization
- C++
- Python
- CUDA
- vLLM
- Model Quantization
- FlashAttention





