Наша команда занимается разработкой computer-use-агентов, которые проходят тест-кейсы в интерфейсах и приложениях Яндекса — смотрят на экран, кликают, проверяют результат. Это помогает экономить время на рутинных тестах и сокращает время на выпуск версий. Наша работа происходит на стыке harness и моделей, которых мы дообучаем через SFT/RL. Если вам интересно разрабатывать агентов, отвечая за весь стек технологий, используемых под капотом, — будем рады познакомиться!

Обязанности:

Развитие harness
Нам важно строить эффективную (как по токенам, так и по скорости) обвязку вокруг модели. Разработка базы знаний по большой вариации тест-кейсов, улучшение планера, разработка верификаторов и тулов — это лишь малая часть задач, которые окружают harness. Агентское планирование в модели
Уже сейчас наши модели неплохо справляются с автоматизацией. Но инструментов становится больше, тест-кейсы — сложнее. Чтобы сохранять эффективность и находить оптимальные пути решения задач, вам предстоит обучать модель таким эффективным стратегиям, а также работе в нашем harness. Больше об ML в Яндексе — в канале Yandex for ML

Ключевые навыки:

  • Понимаете, как строятся VLM-агенты и tool calling, работали с ними
  • Разбираетесь с RL в интерактивных средах
  • Хорошо знаете NLP/CV, особенно LLM/VLM
  • Умеете решать ML-задачи полного цикла — от сбора разметки до внедрения в продакшен

Дополнительные требования:

  • Понимаете ограничения современных VLM
  • Следите за трендами в области агентов и tool-augmented-моделей