JobConnect

AI Infra研发工程师(推理系统)

  • NIO
  • Shanghai, Shenzhen +2 more, China
  • CNY 400,000 – CNY 600,000

上海、杭州、深圳、合肥社招全职数字技术 - 芯片研发本科及以上1-3 年

职位描述

负责大模型及 AI 芯片的高性能推理系统与编译栈建设,打通从深度学习算法到芯片硬件的极致加速通路:

  1. 推理系统与框架演进:参与大模型推理引擎(如 vLLM / TensorRT-LLM / SGLang 或自研引擎)的核心组件研发,优化高并发、高吞吐场景下的请求调度与缓存管理(KV Cache);
  2. 计算图与编译优化:负责 AI 模型的计算图优化、算子融合(Operator Fusion)、内存复用及代码生成(Tiling/Lowering),释放硬件计算潜能;
  3. 前沿技术工程落地:结合业务场景(大模型/多模态等),探索并落地投机解码、长上下文、PD 分离或模型量化压缩(FP8/INT8)等前沿优化技术;
  4. 系统性能剖析与工具链:分析系统端到端瓶颈,完善性能分析(Profiling/Tracing)工具与验证体系,保障线上服务与底层工具链的高可用交付。

职位要求

  1. 计算机、人工智能、软件工程、电子通信等相关专业本科及以上学历;
  2. 熟练掌握 C/C++ 或 Python,具备良好的系统编程素养与数据结构基础;
  3. 理解主流深度学习模型的计算原理(如 Transformer、CNN 等),熟悉模型推理的基本计算流程与内存瓶颈;
  4. 具备扎实的工程实现与性能分析能力,对软硬件协同优化有浓厚兴趣。 满足以下条件优先
  5. 熟悉至少一种主流推理框架(如 vLLM、TensorRT-LLM、SGLang、Triton Server 等),对其底层调度、PagedAttention、PD 分离等机制有实践经验;
  6. 熟悉 TVM、MLIR、TensorRT、Torch-Inductor、IREE、XLA 等深度学习编译器,有图优化 Pass、算子融合或 Tiling 优化实战经验;
  7. 具备 GPU/NPU 异构加速实战经验,熟悉 CUDA/Triton 编程,或有 AWQ、GPTQ、SmoothQuant 等低比特量化(INT8/FP8/INT4)加速落地经验;
  8. 有智能辅助驾驶、具身智能、音视频图像等领域的模型工程化落地与部署经验;
  9. 在相关开源社区(如 vLLM、TensorRT-LLM、TVM 等)有代码贡献,或在体系结构、系统优化相关顶会发表过论文。

投递

Skills

  • C/C++
  • Python
  • Deep Learning Inference
  • vLLM
  • TensorRT-LLM
  • CUDA
  • Performance Optimization

Related jobs

NIOApply for this job