中/高级后端开发工程师(AI算力平台)
- RoboScience
- Beijing, Shenzhen, China
- CNY 350,000 – CNY 600,000
深圳、北京全职智能制造 / 工业互联网 / 工业自动化
职位描述
- 参与 AI 算力平台 / MaaS 平台后端系统建设,负责统一网关、租户、权限、Token / 证书、配额、审计、计费等核心能力;
- 负责在线推理服务管理能力建设,包括模型注册、模型部署、版本管理、灰度发布、服务升级 / 回滚、限流、路由、请求追踪等;
- 负责训练 / 微调任务系统建设,包括任务提交、任务队列、任务状态机、日志追踪、Checkpoint / 模型产物管理,以及训练任务生命周期管理;
- 对接 Kubernetes、腾讯云 TI-ONE、Ray、PyTorchJob 等云原生与 AI 任务系统,实现模型推理、训练、微调任务的自动化编排;
- 参与 GPU 资源管理与调度能力建设,支持资源池管理、配额控制、任务排队、成本统计、资源利用率分析等能力;
- 与算法、推理优化、SRE 团队协作,持续提升平台的稳定性、可观测性、发布效率和算力利用效率。
职位要求
- 计算机、软件工程、人工智能等相关专业本科及以上学历;
- 熟练掌握 Go / Python / Java 中至少一种语言,具备良好的工程实现能力,能独立完成复杂模块设计与开发;
- 熟悉 Kubernetes 基本原理和生态组件,理解 Deployment、Service、Job、CRD、Operator、Ingress、HPA 等核心概念,有 K8s 平台开发或应用接入经验;
- 熟悉后端系统常见组件与架构设计,包括 API Gateway、消息队列、任务调度、MySQL / PostgreSQL、Redis、对象存储、日志与监控等;
- 熟悉云原生服务治理和发布流程,了解灰度发布、蓝绿发布、限流、熔断、重试、回滚、可观测性等工程实践;
- 了解 AI 训练 / 推理基本流程,熟悉 PyTorch、模型部署、在线推理、微调任务、模型版本管理等概念,有 AI 平台、算力平台、MLOps 平台经验者优先;
- 具备较强的问题拆解能力和 Owner 意识,能与算法、基础设施、SRE、产品团队协作推进复杂平台项目落地。
投递
Skills
- Go
- Kubernetes
- Python
- API Gateway
- MLOps
- PyTorch
- Microservices Architecture
