Обязанности:
У нас есть разные направления работы, и вы можете как сфокусироваться на одном из них, так и принести пользу сразу в нескольких. Эксперты в команде помогут разобраться с тонкостями системы. Вы будете работать в основном с Python, но встречаются и задачи, связанные с C++ или Go. Повышение надёжности и удобства обученийМы разрабатываем единую библиотеку распределённых обучений, которая будет интегрирована со всем спектром систем запуска обучений, анализа логов, профилирования, мониторинга и др. Мы хотим сократить количество ручных действий и нестабильностей, чтобы быстрее двигаться вперёд. Автоматизация обнаружения и устранения ошибок распределённых обучений
Одна из важных проблем состоит в том, что в случае ошибки обучения бывает сложно определить точную причину: выход из строя одного из серверов, сбой сети при передаче данных или ошибка в пользовательском коде. Мы работаем над тем, чтобы автоматически обнаруживать ошибку и принимать решение о необходимости перезапуска обучения на другом оборудовании, а также рекомендовать пользователю способы исправления ошибки. Мониторинг, профилирование и оптимизация использования GPU
Различные сбои и неэффективности могут приводить к тому, что GPU простаивают. Мы разрабатываем инструменты, позволяющие обнаруживать и анализировать неэффективное использование GPU. Больше о бэкенде в Яндексе — в канале Yandex for Backend
Ключевые навыки:
- Уверенно владеете Python, Go или C++
- Умеете и хотите разбираться в распределённых системах и нетривиальном коде
- Способны быстро погружаться в новые задачи и находить оптимальные решения — даже в незнакомых областях и при меняющихся приоритетах
Дополнительные требования:
- Готовы взаимодействовать с пользователями и помогать им диагностировать проблемы
- Понимаете, как устроено ML-обучение