QA (ML/LLM) в проекте Сбера от компании Цифровые привычки.
Условия: Трудоустройство: ИП или ГПХ. Первые 3 месяца — офис, далее гибрид (офис в Москве). Локация: Москва.
Вилка зарплаты: от 200 тр до 250 тр.
Требования:
- Опыт QA от 3 лет, в том числе тестирования ML/LLM-систем
- Уверенный SQL (GreenPlum) — умение читать и проверять чужие запросы, находить логические ошибки
- Python для автоматизации тестов и обработки результатов
- Понимание специфики LLM: недетерминированность, галлюцинации, чувствительность к промптам
- Будет плюсом: опыт с фреймворками оценки LLM (Ragas, DeepEval) или построения своих; опыт с LangChain/LangGraph; знание банковской предметной области, финансовой отчётности (P&L); опыт тестирования data-продуктов: витрины, ETL, качество данных
Обязанности:
- Выстроить систему оценки качества ответов LLM-агентов (SQL-агент, агент анализа, агент визуализации): метрики, критерии, процесс
- Развивать и сопровождать тестовые корзины для регрессионного тестирования: эталонные вопросы, ожидаемые SQL-запросы и ответы
- Автоматизировать прогон тестов и оценку по бинарным критериям (валидность JSON, исполнимость SQL, отсутствие галлюцинаций, корректность ролевого доступа, консистентность ответов), в том числе через LLM Judge
- Проводить сравнительное тестирование моделей и версий промптов, готовить отчёты для принятия решений
- Тестировать релизы перед выводом в пром, выявлять расхождения поведения между тестовым и промышленным контурами
- Анализировать инциденты качества в проме, локализовывать причины (промпт / модель / данные / код)