Обязанности:
Повышение эффективности алгоритмовВам предстоит оптимизировать алгоритмы, учитывая аппаратные особенности платформ, автоматизировать тестирование алгоритмов и их адаптацию к платформе. Оптимизация инференса ML-моделей
Совместно с МL-командой вы будете ускорять вывод моделей машинного обучения через ONNX за счёт комплексного применения методов квантизации моделей, анализа и оптимизации структуры вычислительных графов и учётом аппаратных возможностей бортовых ускорителей. Управление загрузкой GPU и инфраструктурой вычислений
Вам предстоит обеспечивать эффективное использование GPU: разрабатывать механизмы планирования вычислений, создавать инфраструктуру для запуска нагрузок и настраивать мониторинг распределения ресурсов. Больше о бэкенде в Яндексе — в канале Yandex for Backend
Ключевые навыки:
- Профессионально пишете на CUDA и C++
- Глубоко понимаете модель исполнения GPU и иерархию памяти
- Умеете измерять и объяснять, где теряется производительность
- Способны довести оптимизацию от идеи до измеримого результата
Дополнительные требования:
- Работали с TensorRT, Triton, cuDNN или собственными kernel
- Оптимизировали пайплайны обработки облаков точек или изображений
- Знакомы с Python и ML-фреймворками (PyTorch)