Мы создаем экосистему цифровых сотрудников на базе передовых открытых LLM/VLM-моделей. Ищем MLOps-инженера в банковскую команду, который превращает исследовательские прототипы в отказоустойчивую GenOps-фабрику цифровых агентов.

Обязанности:

  • Проектирование и развитие self-service CI/CD пайплайнов для деплоя AI-агентов и мультиагентных систем.
  • Развёртывание и оптимизация LLM/VLM-инференса (оптимизация памяти, скорость) с использованием vLLM, Triton Inference Server, SGLang.
  • Обеспечение высокой доступности сервисов, масштабирование подов и управление состоянием агентов.
  • Внедрение мониторинга: от стандартных метрик (CPU/GPU, задержка) до ML-метрик (качество генерации, дрейф данных, оценка тональности).

Требования:

  • Опыт вывода LLM-решений в прод.
  • Уверенное владение Python и асинхронным программированием (asyncio).
  • Уверенное владение Kubernetes (Helm, управление кластерами).
  • Знание GitLab CI, Jenkins и пр.
  • Понимание архитектуры RAG-систем, работы embedding-моделей и ранжирования.
  • Умение оптимизировать инференс: квантизация, continuous batching, PagedAttention.
  • Будет плюсом: опыт с графовыми БД и построением мультиагентных систем.

Технологический стек: Python, FastAPI, langchain, llamaindex, haystack, Kubernetes, Docker, S3, PostgreSQL, векторные и графовые БД, vLLM, Triton Inference Server, SGLang.

Условия:

  • Оформление по ТК РФ в IT-аккредитованную компанию.
  • ДМС (включая стоматологию), компенсация фитнеса, скидки на обучение английскому, индексация зарплаты, современная техника.