Компания: Цифровые привычки. Локация: Москва. Формат работы: первые 3 месяца офис, далее гибрид. Трудоустройство: ИП или ГПХ. Проект: Сбер.
Обязанности:
- Выстроить систему оценки качества ответов LLM-агентов (SQL-агент, агент анализа, агент визуализации): метрики, критерии, процесс.
- Развивать и сопровождать тестовые корзины для регрессионного тестирования: эталонные вопросы, ожидаемые SQL-запросы и ответы.
- Автоматизировать прогон тестов и оценку по бинарным критериям (валидность JSON, исполнимость SQL, отсутствие галлюцинаций, корректность ролевого доступа, консистентность ответов), в том числе через LLM Judge.
- Проводить сравнительное тестирование моделей и версий промптов, готовить отчёты для принятия решений.
- Тестировать релизы перед выводом в пром, выявлять расхождения поведения между тестовым и промышленным контурами.
- Анализировать инциденты качества в проме, локализовывать причины (промпт / модель / данные / код).
Требования:
- Опыт QA от 3 лет, в том числе тестирования ML/LLM-систем.
- Уверенный SQL (GreenPlum) — умение читать и проверять чужие запросы, находить логические ошибки.
- Python для автоматизации тестов и обработки результатов.
- Понимание специфики LLM: недетерминированность, галлюцинации, чувствительность к промптам.
- Опыт тестирования data-продуктов: витрины, ETL, качество данных.
- Знание банковской предметной области, финансовой отчётности (P&L) — будет плюсом.
- Будет плюсом: опыт с фреймворками оценки LLM (Ragas, DeepEval) или построения своих, опыт с LangChain / LangGraph.
Условия:
- Зарплата: от 200 000 до 250 000 ₽.
- Формат: первые 3 месяца в офисе, далее гибрид.
- Трудоустройство: ИП или ГПХ.