YADRO набирает команду SRE и DevOps для крупной аналитической платформы в команде AI. Масштаб системы быстро растёт: множество источников, пользователей и микросервисов, сложные алгоритмы обработки, круглосуточная поддержка.

Обязанности:

  • Эксплуатация и обеспечение доступности production-сервисов по SLA/SLO/SLI;
  • Развитие и масштабирование Kubernetes-инфраструктуры;
  • Построение observability и эксплуатации production (VictoriaMetrics/Prometheus, Grafana, Alertmanager, OpenSearch);
  • CI/CD и автоматизация полного цикла доставки;
  • Построение георезервирования и бесшовного CD;
  • Взаимодействие с разработчиками, Data Engineering и L1/L2, участие в 24/7 поддержке.

Требования / стек:

  • Linux, сети, troubleshooting TCP/IP;
  • Kubernetes, OpenStack;
  • Observability: VictoriaMetrics, Prometheus, Grafana, Alertmanager, OpenSearch;
  • CI/CD и автоматизация: Jenkins/Groovy, GitLab CI, ArgoCD;
  • IaC и управление конфигурацией: Ansible, Helm;
  • Базы данных: PostgreSQL, ClickHouse, MongoDB, OpenSearch;
  • Системы обмена сообщений и сервисы: Kafka, Zookeeper, Consul;
  • HAProxy, Nginx;
  • Опыт эксплуатации production, построения систем с нуля, обеспечения надёжности 24/7.

Условия: формат работы — удалённо / гибрид / офис. Ищут опытных специалистов уровня Senior / Lead; условия по зарплате обсуждаются индивидуально.