Мы создаем экосистему цифровых сотрудников на базе передовых открытых LLM/VLM-моделей. Ищем MLOps-инженера в банковскую команду, который превращает исследовательские прототипы в отказоустойчивую GenOps-фабрику цифровых агентов.
Обязанности:
- Проектирование и развитие self-service CI/CD пайплайнов для деплоя AI-агентов и мультиагентных систем.
- Развёртывание и оптимизация LLM/VLM-инференса (оптимизация памяти, скорость) с использованием vLLM, Triton Inference Server, SGLang.
- Обеспечение высокой доступности сервисов, масштабирование подов и управление состоянием агентов.
- Внедрение мониторинга: от стандартных метрик (CPU/GPU, задержка) до ML-метрик (качество генерации, дрейф данных, оценка тональности).
Требования:
- Опыт вывода LLM-решений в прод.
- Уверенное владение Python и асинхронным программированием (asyncio).
- Уверенное владение Kubernetes (Helm, управление кластерами).
- Знание GitLab CI, Jenkins и пр.
- Понимание архитектуры RAG-систем, работы embedding-моделей и ранжирования.
- Умение оптимизировать инференс: квантизация, continuous batching, PagedAttention.
- Будет плюсом: опыт с графовыми БД и построением мультиагентных систем.
Технологический стек: Python, FastAPI, langchain, llamaindex, haystack, Kubernetes, Docker, S3, PostgreSQL, векторные и графовые БД, vLLM, Triton Inference Server, SGLang.
Условия:
- Оформление по ТК РФ в IT-аккредитованную компанию.
- ДМС (включая стоматологию), компенсация фитнеса, скидки на обучение английскому, индексация зарплаты, современная техника.