AI Infra研发工程师(推理系统)
- NIO
- Shanghai, Shenzhen +2 more, China
- CNY 400,000 – CNY 600,000
上海、杭州、深圳、合肥社招全职数字技术 - 芯片研发本科及以上1-3 年
职位描述
负责大模型及 AI 芯片的高性能推理系统与编译栈建设,打通从深度学习算法到芯片硬件的极致加速通路:
- 推理系统与框架演进:参与大模型推理引擎(如 vLLM / TensorRT-LLM / SGLang 或自研引擎)的核心组件研发,优化高并发、高吞吐场景下的请求调度与缓存管理(KV Cache);
- 计算图与编译优化:负责 AI 模型的计算图优化、算子融合(Operator Fusion)、内存复用及代码生成(Tiling/Lowering),释放硬件计算潜能;
- 前沿技术工程落地:结合业务场景(大模型/多模态等),探索并落地投机解码、长上下文、PD 分离或模型量化压缩(FP8/INT8)等前沿优化技术;
- 系统性能剖析与工具链:分析系统端到端瓶颈,完善性能分析(Profiling/Tracing)工具与验证体系,保障线上服务与底层工具链的高可用交付。
职位要求
- 计算机、人工智能、软件工程、电子通信等相关专业本科及以上学历;
- 熟练掌握 C/C++ 或 Python,具备良好的系统编程素养与数据结构基础;
- 理解主流深度学习模型的计算原理(如 Transformer、CNN 等),熟悉模型推理的基本计算流程与内存瓶颈;
- 具备扎实的工程实现与性能分析能力,对软硬件协同优化有浓厚兴趣。 满足以下条件优先
- 熟悉至少一种主流推理框架(如 vLLM、TensorRT-LLM、SGLang、Triton Server 等),对其底层调度、PagedAttention、PD 分离等机制有实践经验;
- 熟悉 TVM、MLIR、TensorRT、Torch-Inductor、IREE、XLA 等深度学习编译器,有图优化 Pass、算子融合或 Tiling 优化实战经验;
- 具备 GPU/NPU 异构加速实战经验,熟悉 CUDA/Triton 编程,或有 AWQ、GPTQ、SmoothQuant 等低比特量化(INT8/FP8/INT4)加速落地经验;
- 有智能辅助驾驶、具身智能、音视频图像等领域的模型工程化落地与部署经验;
- 在相关开源社区(如 vLLM、TensorRT-LLM、TVM 等)有代码贡献,或在体系结构、系统优化相关顶会发表过论文。
投递
Skills
- C/C++
- Python
- Deep Learning Inference
- vLLM
- TensorRT-LLM
- CUDA
- Performance Optimization




