Поиск — первый и ключевой сервис Яндекса. За много лет из простой поисковой программы он развился в высоконагруженную и нетривиальную систему. Поиск большой: им пользуются сотни миллионов пользователей, сотни тысяч ядер обрабатывают миллиарды запросов в сутки, а некоторые микросервисы держат десятки миллионов RPS, обрабатывая петабайты горячих данных. Такой масштаб и критичность накладывает серьёзные требования на надёжность. Наша команда работает над всей инфраструктурой основного веб-поиска и поиска по картинкам. Мы ищем SRE, способных внедрять современные SRE-подходы и процессы. Роль SRE — одна из ключевых в продукте.

Обязанности:

Автоматизация непрерывной поставки
Вы будете разрабатывать и улучшать механизмы автоматической приёмки и выкатки релизов, минимизируя участие сервисных команд. Это позволит одновременно как повысить надёжность, так и соптимизировать time to market различных внедрений. Разработка инструментов наблюдаемости
У Поиска из-за большого масштаба много специфичных инструментов для обеспечения наблюдаемости на всех стадиях. Это распределённый трейсинг, инструментарий для анализа инцидентов и так далее. Вам предстоит как использовать эти инструменты, так и развивать их. Улучшение процессов координации инцидентов
С появлением LLM можно автоматизировать и упростить значительную часть координации инцидентов. Вы будете улучшать процессы починки аварий, упрощать дебаг сложных инцидентов и ускорять починку. Больше о разработке в Яндексе — в канале Yandex for Developers

Ключевые навыки:

  • Работали с системами мониторинга и управления конфигурациями
  • Уверенно владеете Linux, имеете крепкую ментальную модель разных подсистем
  • Понимаете принципы работы TCP/IP и умеете диагностировать сетевые проблемы
  • Разбираетесь в построении распределённых и отказоустойчивых веб-сервисов
  • Знакомы с подходами Infrastructure as Code
  • На хорошем уровне владеете Python или Go

Дополнительные требования:

  • Разрабатывали на системном языке программирования (в идеале C++)
  • Читали SRE book, понимаете принципы SRE
  • Понимаете принципы работы очередей и распределённых систем
  • Умеете анализировать coredumps
  • Уверенно владеете современными подходами к AI в разработке и поддержке