AI 可观测系统研发工程师
- MiniMax
- Shanghai, Beijing, China
- CNY 500,000 – CNY 800,000
北京、上海社招全职研发 - 基础架构
职位描述
一、一句话定位 面向大模型训练、大模型推理与 Agent 运行时建设新一代可观测平台,连接硬件、网络、存储、模型框架、推理引擎和 Agent 执行轨迹,让复杂 AI 系统的异常看得见、定得准、恢复快、价值可衡量。 二、为什么这个岗位重要 大模型系统的问题往往横跨 GPU、网络、存储、容器、框架、推理引擎、模型行为和外部工具。我们希望建设统一的数据与诊断能力,回答三类核心问题: 训练为什么中断、变慢或损失有效算力; 推理为什么首 Token 变慢、吞吐下降、成本升高或质量退化; Agent 为什么任务失败、循环调用、链路异常或 Token 消耗失控。 三、你将负责什么
- 建设统一的 AI 可观测平台 建设指标、日志、Trace、事件的采集、处理、存储、查询与可视化能力; 建立作业、请求、Agent 任务与节点、GPU、Pod、进程、Rank、模型、版本之间的关联; 治理高基数、高频事件和大规模时序数据,探索异常检测、告警降噪与根因分析能力。
- 支撑大模型训练可观测 建设覆盖基础设施、通信与运行时、训练框架、模型与数据的分层观测体系; 关联 job → pod/process → rank → node → GPU UUID,诊断训练 Hang、慢 Rank、硬件、网络、存储和 Checkpoint 异常; 量化训练进度、有效算力及重试、等待损耗,推动问题处置和效果验证闭环。
- 支撑大模型推理可观测 建设覆盖网关、路由、批处理、推理引擎、模型实例和 GPU 的请求级观测; 观测 TTFT、TPOT、排队、吞吐、KV Cache、Token 等指标,定位 Prefill、Decode、调度与资源争用问题; 关联模型版本、参数、上下文、输出质量和成本,支持性能与质量回归分析。
- 支撑 Agent 运行时可观测 建设 Agent 任务到模型、工具、子 Agent、记忆和知识库访问的完整执行轨迹; 支持顺序、并行、循环和分支结构,量化任务成功率、工具成功率、重试及 Token 成本; 结合规则、模型评估、人工反馈和业务结果,诊断依赖故障、工作流异常及质量回归。
职位要求
四、我们期望你具备 基本要求
- 计算机或相关专业本科及以上学历,或具备同等工程能力;
- 具备 3 年以上可观测、基础架构、分布式系统、云原生平台或后端平台研发经验;资深候选人需有大型生产系统的设计与落地经历;
- 熟练掌握 Go、Java、C++、Rust、Python 中至少一门语言,具备扎实的并发编程和系统设计能力;
- 熟悉 Metrics、Logs、Traces、Events 中至少两类数据的完整工程链路;
- 熟悉 Linux、网络、容器、Kubernetes 和分布式系统,能够开展跨层问题分析;
- 具备良好的抽象、落地和协作能力,愿意深入理解 AI 工作负载。 加分项
- 有 Prometheus/Mimir、VictoriaMetrics、Thanos、OpenTelemetry、Jaeger/Tempo、Loki/ELK、ClickHouse、Grafana 等系统经验;
- 有 GPU、RDMA、NCCL、分布式训练、Checkpoint 或训练稳定性经验;
- 有 vLLM、TensorRT-LLM、SGLang、TGI、模型网关或容量管理经验;
- 有 Agent Runtime、工作流引擎、LLM Trace 或评测平台经验;
- 有 eBPF、AIOps、开源贡献或从 0 到 1 建设平台的经验。
投递
Skills
- Go
- Java
- C++
- Rust
- Python
- Kubernetes
- Prometheus
- OpenTelemetry
- Grafana
- ClickHouse
- NCCL
- vLLM





