Компания: Цифровые привычки. Локация: Москва. Формат работы: первые 3 месяца офис, далее гибрид. Трудоустройство: ИП или ГПХ. Проект: Сбер.

Обязанности:

  • Выстроить систему оценки качества ответов LLM-агентов (SQL-агент, агент анализа, агент визуализации): метрики, критерии, процесс.
  • Развивать и сопровождать тестовые корзины для регрессионного тестирования: эталонные вопросы, ожидаемые SQL-запросы и ответы.
  • Автоматизировать прогон тестов и оценку по бинарным критериям (валидность JSON, исполнимость SQL, отсутствие галлюцинаций, корректность ролевого доступа, консистентность ответов), в том числе через LLM Judge.
  • Проводить сравнительное тестирование моделей и версий промптов, готовить отчёты для принятия решений.
  • Тестировать релизы перед выводом в пром, выявлять расхождения поведения между тестовым и промышленным контурами.
  • Анализировать инциденты качества в проме, локализовывать причины (промпт / модель / данные / код).

Требования:

  • Опыт QA от 3 лет, в том числе тестирования ML/LLM-систем.
  • Уверенный SQL (GreenPlum) — умение читать и проверять чужие запросы, находить логические ошибки.
  • Python для автоматизации тестов и обработки результатов.
  • Понимание специфики LLM: недетерминированность, галлюцинации, чувствительность к промптам.
  • Опыт тестирования data-продуктов: витрины, ETL, качество данных.
  • Знание банковской предметной области, финансовой отчётности (P&L) — будет плюсом.
  • Будет плюсом: опыт с фреймворками оценки LLM (Ragas, DeepEval) или построения своих, опыт с LangChain / LangGraph.

Условия:

  • Зарплата: от 200 000 до 250 000 ₽.
  • Формат: первые 3 месяца в офисе, далее гибрид.
  • Трудоустройство: ИП или ГПХ.