SECTION I · THE BRIEF
Brief #45493Updated 26 AUG 2026RUSSIALeverSOFTWARE COMPANIES
Employbl Company Profile

Site Reliability Engineer

Xsolla is an international payment services company, providing game developers and publishers with payment, billing, distribution, and marketing tools. Headquartered in Sherman Oaks, Los Angeles, California.

Location
Russia
Company size
500–1,000
Posted
Today
Via
Lever
Section II · Premium ProfileMembers only
  • 01Comp band & equity packageLocked
  • 02Seniority & experience requirementsLocked
  • 03Interview process & rubricLocked
  • 04Hiring manager & team contextLocked
  • 05Growth trajectory in this roleLocked
  • 06Offer & decision timelineLocked

7-day free trial · $25/mo · cancel anytime

Xsolla logo

Site Reliability Engineer · Xsolla

View company profile
Job title
Site Reliability Engineer
Job location
Russia
Job description

Об Xsolla

Xsolla — глобальный лидер в сфере видеоигровой коммерции, предоставляющий разработчикам все возможности для запуска, развития и монетизации игр. Компания поддерживает студии любого масштаба — от инди до AAA — с помощью решений в области Direct-to-Consumer коммерции, интеллектуальных платежей, IP из медиаиндустрии и инструментов вовлечения игроков. Xsolla помогает разработчикам финансировать, распространять, продвигать и монетизировать игры в глобальном масштабе.

Нам доверяют более 70 процентов из топ-100 самых кассовых игр. Xsolla выступает в роли merchant of record в 200+ регионах мира с доступом к более чем 1000 локальных платёжных методов.

Xsolla глубоко верит в будущее игровой индустрии и последовательно объединяет все возможности, открывая путь к росту для разработчиков по всему миру.

О роли

Мы ищем Site Reliability Engineer (SRE) — прагматичного специалиста с продуктовым мышлением, который одинаково уверенно чувствует себя как при написании кода, так и при эксплуатации production-систем, — в SRE-команду департамента Инфраструктуры.

Идеальный кандидат умеет эффективно работать в быстро меняющейся, динамичной среде с высоким уровнем взаимодействия между командами и готов нести ответственность за инфраструктуру на уровне приложений — от CI/CD-пайплайнов и Kubernetes-манифестов до SLO, capacity planning и production readiness.

Для этой роли необходимы сильные навыки в Kubernetes, observability и разработке ПО, а также опыт эксплуатации production-сервисов в облачной среде (GCP/GKE или аналогичной) и тесного взаимодействия с продуктовыми командами разработки.

Ключевым фактором успеха будет способность одновременно понимать обе стороны — как разработчики создают и выпускают новые функциональные возможности и что необходимо инфраструктуре для сохранения высокой надежности — и учитывать требования к надежности уже на ранних этапах проектирования и принятия архитектурных решений.

Если вам интересно превращать сложные распределенные системы в предсказуемые и стабильно работающие платформы и вы хотите развивать commerce- и monetization-инфраструктуру, которая помогает разработчикам игр по всему миру получать доход от своих продуктов, будем рады познакомиться!

Чем вы будете заниматься
  • Отвечать за инфраструктуру на уровне приложений: Helm-чарты, конфигурации Terraform, Kubernetes-деплойменты, runtime-конфигурацию, а также сетевые настройки и интеграции сервисов.

  • Отвечать за observability в рамках продуктового домена: проектировать и внедрять SLO/SLI, мониторы, алерты и дашборды для критичных сервисов с использованием Datadog и инструментов на базе OpenTelemetry.

  • Помогать в создании и развитии CI/CD-пайплайнов для сервисов домена (GitLab CI, GitHub Actions), включая автоматизацию деплоя и отката изменений.

  • Выполнять планирование производительности и емкости инфраструктуры, а также performance tuning перед ожидаемыми пиковыми нагрузками — запусками продуктов, распродажами и региональными релизами. Проводить нагрузочное тестирование и расследовать регрессии производительности.

  • Проводить Production Readiness Review для новых сервисов и значительных изменений; определять и контролировать критерии готовности сервисов домена к эксплуатации в production.

  • Участвовать в реагировании на инциденты в рамках домена: помогать в глубоком расследовании сложных инцидентов, участвовать в подготовке post-mortem, инициировать и доводить до реализации улучшения надежности, а также поддерживать runbook-документацию в актуальном состоянии.

  • Разрабатывать автоматизацию, специфичную для домена и сокращающую объем рутинных операционных задач: автоматизацию runbook-процедур, инструменты для деплоя и регулярные операционные скрипты.

  • Совместно с техническими лидерами продуктовых команд формировать и развивать долгосрочный roadmap по надежности домена.

  • Участвовать в планировании, refinement-сессиях и архитектурных ревью продуктовых команд, обеспечивая учет требований к надежности еще до того, как изменение архитектурных решений станет дорогостоящим.

  • Совместно с основной SRE-командой разрабатывать корпоративные стандарты в области SLO/SLI, capacity planning и эксплуатации; напрямую участвовать в улучшении общих подсистем, находящихся в зоне ответственности SRE.

  • Участвовать в дежурствах SRE-команды, оказывая поддержку разработчикам по всей компании.

  • Что мы ожидаем
    • От 3 лет подтвержденного опыта работы в роли SRE, DevOps- или Platform Engineer: участие в on-call/реагировании на инциденты, ответственность за SLO и мониторинг, работа с deployment pipelines и инфраструктурой production-сервисов.
    • Опыт разработки ПО: вы не только эксплуатировали системы, но и разрабатывали и выпускали backend-сервисы. Умеете читать и анализировать код приложения при расследовании проблем и писать production-quality автоматизацию как минимум на одном языке программирования, например Go или PHP.
    • Практический опыт работы с Kubernetes: Helm, manifests, стратегии деплоя, диагностика проблем производительности и сетевого взаимодействия на уровне приложений; опыт с GKE или другими managed Kubernetes-платформами.
    • Уверенные знания и практический опыт в observability: создание мониторов, дашбордов и SLO/SLI на современных платформах. Предпочтителен Datadog; опыт с Prometheus/Grafana также релевантен. Знакомство с OpenTelemetry.
    • Опыт работы с Infrastructure as Code (Terraform/Terragrunt), достаточный для эффективного взаимодействия с Platform-командами.
    • Опыт работы с GCP, включая IAM, networking и managed services.
    • Опыт создания и поддержки CI/CD-пайплайнов в GitLab CI и/или GitHub Actions.
    • Уверенные навыки программирования и написания скриптов, достаточные для создания автоматизации и внутренних инструментов, например на Python, Go или Bash.
    • Практический опыт реагирования на инциденты, проведения post-mortem и реализации улучшений надежности по результатам инцидентов.
    • Сильные коммуникативные навыки и умение эффективно работать в команде — эта роль предполагает ежедневную тесную работу с продуктовыми командами разработки.
    • Опыт работы с платежными системами, fintech, e-commerce или gaming-продуктами с высоконагруженными транзакционными системами.
    • Будет преимуществом

      • Сертификации по Kubernetes.
      • Сертификации Google Cloud Platform.
      • Сертификации HashiCorp.
    View job listing ↗
    The Saturday Briefing

    Get the Saturday tech briefing

    New company profiles, funding moves, and who’s hiring across the market — every Saturday morning.

    Xsolla headquarters

    Thousand Oaks, CA

    Company size

    5001,000 employees

    Founded

    2005

    View company profile ↗