YADRO набирает команду SRE и DevOps для крупной аналитической платформы в команде AI. Масштаб системы быстро растёт: множество источников, пользователей и микросервисов, сложные алгоритмы обработки, круглосуточная поддержка.
Обязанности:
- Эксплуатация и обеспечение доступности production-сервисов по SLA/SLO/SLI;
- Развитие и масштабирование Kubernetes-инфраструктуры;
- Построение observability и эксплуатации production (VictoriaMetrics/Prometheus, Grafana, Alertmanager, OpenSearch);
- CI/CD и автоматизация полного цикла доставки;
- Построение георезервирования и бесшовного CD;
- Взаимодействие с разработчиками, Data Engineering и L1/L2, участие в 24/7 поддержке.
Требования / стек:
- Linux, сети, troubleshooting TCP/IP;
- Kubernetes, OpenStack;
- Observability: VictoriaMetrics, Prometheus, Grafana, Alertmanager, OpenSearch;
- CI/CD и автоматизация: Jenkins/Groovy, GitLab CI, ArgoCD;
- IaC и управление конфигурацией: Ansible, Helm;
- Базы данных: PostgreSQL, ClickHouse, MongoDB, OpenSearch;
- Системы обмена сообщений и сервисы: Kafka, Zookeeper, Consul;
- HAProxy, Nginx;
- Опыт эксплуатации production, построения систем с нуля, обеспечения надёжности 24/7.
Условия: формат работы — удалённо / гибрид / офис. Ищут опытных специалистов уровня Senior / Lead; условия по зарплате обсуждаются индивидуально.