Мы занимаемся поисковыми сигналами — сложными элементами, которые устроены гораздо глубже стандартных продуктовых метрик. Их улучшение напрямую влияет на итоговое качество ранжирования. Наша миссия — ускорить эволюцию Поиска: заменить рутинную ручную разметку автоматикой, внедрить LLM в процессы оценки и сделать релизы моделей быстрее без потери качества. Сейчас команда находится на стыке аналитики и разработки, решая сложные методологические задачи. Мы не просто считаем метрики, а проектируем системы оценки, где каждый аспект должен быть статистически значим. В ближайшее время нас ждёт переход от офлайн-экспериментов к полноценным онлайн-тестам, где нам предстоит выявлять тонкие проблемы ранжирования и находить пути их решения.

Обязанности:

Методология замены ручной разметки автоматикой
Вам предстоит разрабатывать подходы к замещению труда разметчиков AI-агентами и LLM. Необходимо не просто внедрить автоматизацию, а доказать, что качество сигнала при этом не ухудшилось (или улучшилось). Это требует создания сложных бенчмарков и методик валидации. Оценка качества LLM-as-a-judge
Мы активно используем большие языковые модели как «судью» для оценки релевантности. Ваша задача — придумать, как объективно измерить качество самой LLM в этой роли, выявить её системные ошибки (биасы) и калибровать её выводы для задач ранжирования. Исследование влияния изменений на ранжирование
Работа с поисковыми сигналами требует понимания казуальности: как изменения в разметке или сигнале трансформируют финальное ранжирование. Вы будете проектировать дизайн экспериментов (офлайн и онлайн), строить срезы данных и находить скрытые проблемы, которые могут повлиять на пользовательский опыт. Подготовка и проведение онлайн-экспериментов
Через несколько месяцев фокус сместится на запуск A/B-тестов в реальном поисковом трафике. Вам предстоит определять, в каких срезах и аспектах ранжирования возникают проблемы, и предлагать инженерные способы их починки на основе данных эксперимента. Больше об аналитике в Яндексе — в канале Yandex for Analytics

Ключевые навыки:

  • Имеете опыт на стыке аналитики и разработки: уверенно работаете с SQL и Python (pandas, NumPy), умеете не только извлекать данные, но и строить на их основе сложные модели оценки: офлайн-метрики, статистические выводы
  • Понимаете принципы машинного обучения: знаете, как устроены метрики качества ML-моделей (precision, recall, ndcg), имели опыт с LLM или понимаете их специфику: промпт-инжиниринг, оценку качества генерации
  • Умеете выстраивать эксперименты: знаете, как обеспечить статистическую значимость выводов, работали с A/B-тестированием или офлайн-симуляциями
  • Склонны к методологической работе: вам интересно не просто посчитать цифру, а придумать способ измерения там, где готового инструмента нет, и защитить свой подход перед стейкхолдерами
  • Обладаете критическим мышлением: умеете декомпозировать сложные проблемы поискового ранжирования на измеримые компоненты