JobConnect

Site Reliability Engineer

  • Xsolla
  • Russia
  • RUB 3,600,000 – RUB 5,400,000

Об Xsolla

Xsolla — глобальный лидер в сфере видеоигровой коммерции, предоставляющий разработчикам все возможности для запуска, развития и монетизации игр. Компания поддерживает студии любого масштаба — от инди до AAA — с помощью решений в области Direct-to-Consumer коммерции, интеллектуальных платежей, IP из медиаиндустрии и инструментов вовлечения игроков. Xsolla помогает разработчикам финансировать, распространять, продвигать и монетизировать игры в глобальном масштабе.

Нам доверяют более 70 процентов из топ-100 самых кассовых игр. Xsolla выступает в роли merchant of record в 200+ регионах мира с доступом к более чем 1000 локальных платёжных методов.

Xsolla глубоко верит в будущее игровой индустрии и последовательно объединяет все возможности, открывая путь к росту для разработчиков по всему миру.

О роли

Мы ищем Site Reliability Engineer (SRE) — прагматичного специалиста с продуктовым мышлением, который одинаково уверенно чувствует себя как при написании кода, так и при эксплуатации production-систем, — в SRE-команду департамента Инфраструктуры.

Идеальный кандидат умеет эффективно работать в быстро меняющейся, динамичной среде с высоким уровнем взаимодействия между командами и готов нести ответственность за инфраструктуру на уровне приложений — от CI/CD-пайплайнов и Kubernetes-манифестов до SLO, capacity planning и production readiness.

Для этой роли необходимы сильные навыки в Kubernetes, observability и разработке ПО, а также опыт эксплуатации production-сервисов в облачной среде (GCP/GKE или аналогичной) и тесного взаимодействия с продуктовыми командами разработки.

Ключевым фактором успеха будет способность одновременно понимать обе стороны — как разработчики создают и выпускают новые функциональные возможности и что необходимо инфраструктуре для сохранения высокой надежности — и учитывать требования к надежности уже на ранних этапах проектирования и принятия архитектурных решений.

Если вам интересно превращать сложные распределенные системы в предсказуемые и стабильно работающие платформы и вы хотите развивать commerce- и monetization-инфраструктуру, которая помогает разработчикам игр по всему миру получать доход от своих продуктов, будем рады познакомиться!

Чем вы будете заниматься

  • Отвечать за инфраструктуру на уровне приложений: Helm-чарты, конфигурации Terraform, Kubernetes-деплойменты, runtime-конфигурацию, а также сетевые настройки и интеграции сервисов.
  • Отвечать за observability в рамках продуктового домена: проектировать и внедрять SLO/SLI, мониторы, алерты и дашборды для критичных сервисов с использованием Datadog и инструментов на базе OpenTelemetry.
  • Помогать в создании и развитии CI/CD-пайплайнов для сервисов домена (GitLab CI, GitHub Actions), включая автоматизацию деплоя и отката изменений.
  • Выполнять планирование производительности и емкости инфраструктуры, а также performance tuning перед ожидаемыми пиковыми нагрузками — запусками продуктов, распродажами и региональными релизами. Проводить нагрузочное тестирование и расследовать регрессии производительности.
  • Проводить Production Readiness Review для новых сервисов и значительных изменений; определять и контролировать критерии готовности сервисов домена к эксплуатации в production.
  • Участвовать в реагировании на инциденты в рамках домена: помогать в глубоком расследовании сложных инцидентов, участвовать в подготовке post-mortem, инициировать и доводить до реализации улучшения надежности, а также поддерживать runbook-документацию в актуальном состоянии.
  • Разрабатывать автоматизацию, специфичную для домена и сокращающую объем рутинных операционных задач: автоматизацию runbook-процедур, инструменты для деплоя и регулярные операционные скрипты.
  • Совместно с техническими лидерами продуктовых команд формировать и развивать долгосрочный roadmap по надежности домена.
  • Участвовать в планировании, refinement-сессиях и архитектурных ревью продуктовых команд, обеспечивая учет требований к надежности еще до того, как изменение архитектурных решений станет дорогостоящим.
  • Совместно с основной SRE-командой разрабатывать корпоративные стандарты в области SLO/SLI, capacity planning и эксплуатации; напрямую участвовать в улучшении общих подсистем, находящихся в зоне ответственности SRE.
  • Участвовать в дежурствах SRE-команды, оказывая поддержку разработчикам по всей компании.

Что мы ожидаем

  • От 3 лет подтвержденного опыта работы в роли SRE, DevOps- или Platform Engineer: участие в on-call/реагировании на инциденты, ответственность за SLO и мониторинг, работа с deployment pipelines и инфраструктурой production-сервисов.
  • Опыт разработки ПО: вы не только эксплуатировали системы, но и разрабатывали и выпускали backend-сервисы. Умеете читать и анализировать код приложения при расследовании проблем и писать production-quality автоматизацию как минимум на одном языке программирования, например Go или PHP.
  • Практический опыт работы с Kubernetes: Helm, manifests, стратегии деплоя, диагностика проблем производительности и сетевого взаимодействия на уровне приложений; опыт с GKE или другими managed Kubernetes-платформами.
  • Уверенные знания и практический опыт в observability: создание мониторов, дашбордов и SLO/SLI на современных платформах. Предпочтителен Datadog; опыт с Prometheus/Grafana также релевантен. Знакомство с OpenTelemetry.
  • Опыт работы с Infrastructure as Code (Terraform/Terragrunt), достаточный для эффективного взаимодействия с Platform-командами.
  • Опыт работы с GCP, включая IAM, networking и managed services.
  • Опыт создания и поддержки CI/CD-пайплайнов в GitLab CI и/или GitHub Actions.
  • Уверенные навыки программирования и написания скриптов, достаточные для создания автоматизации и внутренних инструментов, например на Python, Go или Bash.
  • Практический опыт реагирования на инциденты, проведения post-mortem и реализации улучшений надежности по результатам инцидентов.
  • Сильные коммуникативные навыки и умение эффективно работать в команде — эта роль предполагает ежедневную тесную работу с продуктовыми командами разработки.
  • Опыт работы с платежными системами, fintech, e-commerce или gaming-продуктами с высоконагруженными транзакционными системами.

Будет преимуществом

  • Сертификации по Kubernetes.
  • Сертификации Google Cloud Platform.
  • Сертификации HashiCorp.

Что мы предлагаем

  • Развитие и обучение: доступ к внутренней платформе, участие в профессиональных конференциях, хакатонах, митапах и воркшопах
  • Современные инструменты: топовое оборудование (Mac), доступ к продвинутым ИИ-сервисам, которые избавляют от рутины и помогают быть продуктивнее
  • Забота о здоровье: ДМС со стоматологией для вас и членов вашей семьи (супруг, дети), 21 день доплачиваемого до размера зарплаты больничного
  • Глобальные возможности: участие в международных проектах, командировки и потенциальная релокация в один из зарубежных офисов
  • Удалёнка с комфортом: компенсация расходов на обустройство эргономичного рабочего места дома - для удаленщиков

Если вам откликается эта роль, но вы не уверены, что соответствуете каждому пункту — всё равно напишите. Мы открыты к диалогу и с интересом рассмотрим вашу кандидатуру. Возможно, вы идеально подойдёте именно нам.

Skills

  • Kubernetes
  • CI/CD
  • Observability
  • SLO
  • Capacity Planning
  • Production Readiness
  • Go

Related jobs

XsollaApply for this job