Создание и развитие GenOps‑фабрики цифровых агентов на базе открытых LLM/VLM-моделей. Развёртывание отказоустойчивых сервисов инференса и мультиагентных систем.

Обязанности:

  • Проектирование и развитие самообслуживаемых CI/CD пайплайнов для деплоя AI-агентов и мультиагентных систем.
  • Развёртывание и оптимизация LLM/VLM в процессе разработки (оптимизация памяти, скорость) с использованием vLLM, Triton Inference Server, SGLang.
  • Обеспечение высокой доступности сервисов, масштабирование подов, управление состоянием агентов.
  • Внедрение мониторинга: от CPU/GPU и задержек до ML-метрик (качество генерации, дрейф данных, оценка тональности).

Требования:

  • Опыт вывода LLM-решений в прод.
  • Уверенное владение Python и асинхронным программированием (asyncio).
  • Опыт работы с Kubernetes (Helm, управление кластерами).
  • Знание GitLab CI, Jenkins или аналогичных CI-систем.
  • Понимание архитектуры RAG, embedding-моделей и ранжирования.
  • Умение оптимизировать инференс: квантизация, continuous batching, PagedAttention.
  • Будет плюсом: опыт с графовыми БД и построением мультиагентных систем.

Технологический стек: Python, FastAPI, langchain, llamaindex, haystack, Kubernetes, Docker, S3, PostgreSQL, векторные и графовые БД, vLLM, Triton Inference Server, SGLang.

Условия:

  • Оформление по ТК РФ в IT-аккредитованную компанию.
  • ДМС (включая стоматологию), компенсация фитнеса.
  • Скидки на обучение английскому (Skyeng), индексация зарплаты, современная техника.