Команда Server Infrastructure занимается эксплуатацией быстро растущей инфраструктуры Yandex Cloud в рамках подразделения Cloud Foundation Services. Мы строим надёжную и масштабируемую инфраструктуру, поверх которой запускаются виртуальные машины пользователей и внутренние сервисы. В сервисах реализуем различные сценарии работы с железом: от процессов ввода, вывода, починки до бесшовного обновления ОС на всём кластере. Наши сервисы работают с большим количеством облачных и общих яндексовых систем, собирают данные о хостах, метрики состояния железа и кластера в целом, чтобы планировать обслуживание серверов и распределять ресурсы. Мы предоставляем сервисы и инструменты, которые упрощают и автоматизируют внутренние процессы, делают инфраструктуру прозрачнее и стабильнее, снимают с инженеров рутинную работу. Под нашим управлением уже более 20 тыс. серверов в трёх дата-центрах Яндекса, и их количество непрерывно растёт. Мы разрабатываем и постоянно совершенствуем способы мониторинга наших серверов и подходы к нему так, чтобы заранее и автоматически диагностировать неполадки и выполнять обслуживание, не дожидаясь выхода серверов из строя. В работе мы используем: * Golang и Python для разработки сервисов и автоматики * SaltStack и Terraform для описания инфраструктуры * TeamCity и Spinnaker для процессов CI/CD

Обязанности:

Система эксплуатации инфраструктуры
Вам предстоит развивать систему, упрощающую эксплуатацию инфраструктуры Yandex Cloud, автоматизировать различные сценарии работы с серверами. Система хранения железа
Вы будете проектировать и дорабатывать систему инвентаризации, позволяющую объединить как физическую, так и логическую информацию обо всём парке железа, упростить хранение и использование информации об инфраструктуре. Мониторинг и сборы метрик
Нужно будет разрабатывать сервисы-агенты для мониторинга, сбора метрик и выполнения проверок на хостах. Работа с инструментами
Вы будете поддерживать инструменты, которые помогают планировать и распределять ресурсы внутри облака. Больше о бэкенде в Яндексе — в канале Yandex for Backend

Ключевые навыки:

  • Умеете хорошо писать код на Golang или Python
  • Разрабатывали и поддерживали отказоустойчивые системы
  • Знаете, как построить идеальный мониторинг
  • Выстраивали и эксплуатировали CI/CD-процессы для сервисов, использовали концепцию Infrasructure as Code
  • Любите улучшать процессы и автоматизировать задачи, писали сервисы и утилиты для автоматизации

Дополнительные требования:

  • Имеете опыт многопоточного и асинхронного программирования
  • Умеете быстро разобраться в чём угодно — в работе мы используем Go, Python, Linux, QEMU/KVM, Yandex Cloud и множество собственных и свободно распространяемых технологий
  • Работали с системами контейнеризации и управления конфигурациями: Docker, K8s, SaltStack, Ansible, Terraform
  • Строили облачные сервисы
  • Глубоко знаете Linux