Создание и развитие GenOps‑фабрики цифровых агентов на базе открытых LLM/VLM-моделей. Развёртывание отказоустойчивых сервисов инференса и мультиагентных систем.
Обязанности:
- Проектирование и развитие самообслуживаемых CI/CD пайплайнов для деплоя AI-агентов и мультиагентных систем.
- Развёртывание и оптимизация LLM/VLM в процессе разработки (оптимизация памяти, скорость) с использованием vLLM, Triton Inference Server, SGLang.
- Обеспечение высокой доступности сервисов, масштабирование подов, управление состоянием агентов.
- Внедрение мониторинга: от CPU/GPU и задержек до ML-метрик (качество генерации, дрейф данных, оценка тональности).
Требования:
- Опыт вывода LLM-решений в прод.
- Уверенное владение Python и асинхронным программированием (asyncio).
- Опыт работы с Kubernetes (Helm, управление кластерами).
- Знание GitLab CI, Jenkins или аналогичных CI-систем.
- Понимание архитектуры RAG, embedding-моделей и ранжирования.
- Умение оптимизировать инференс: квантизация, continuous batching, PagedAttention.
- Будет плюсом: опыт с графовыми БД и построением мультиагентных систем.
Технологический стек: Python, FastAPI, langchain, llamaindex, haystack, Kubernetes, Docker, S3, PostgreSQL, векторные и графовые БД, vLLM, Triton Inference Server, SGLang.
Условия:
- Оформление по ТК РФ в IT-аккредитованную компанию.
- ДМС (включая стоматологию), компенсация фитнеса.
- Скидки на обучение английскому (Skyeng), индексация зарплаты, современная техника.