Команда робототехники занимается всем, что связано с автономными роботами и роботизированными системами: от исследований, прототипирования и разработки первых образцов до интеграции ML-моделей в реальные устройства и подготовки решений к серийному производству. Мы создаём нейросетевые компоненты для роботов: восприятие, принятие решений, управление поведением, обучение в симуляции и на реальных данных, пайплайны дообучения и инфраструктуру для экспериментов. В команде работают специалисты по machine learning, reinforcement learning, computer vision, vision-language-action-моделям, MLOps и робототехнике. Сейчас мы ищем ML Engineer, который будет развивать методы post-training и fine-tuning для VLA- и других robot policy. Вам предстоит применять reinforcement learning, imitation learning и recovery-oriented-подходы, чтобы улучшать качество выполнения задач, устойчивость к OOD-состояниям, способность к восстановлению после ошибок и обобщение на реальные робототехнические сценарии. Это роль для человека, которому интересно работать на границе современных foundation models, RL и робототехники: брать базовую VLA-policy, обученную на демонстрациях, и доводить её до надёжного поведения с помощью offline и online RL, recovery-сценариев и систематических экспериментов.

Обязанности:

Разработка post-training-пайплайнов для VLA
Вы будете развивать пайплайны дообучения VLA на данных реальных роботов, симуляции и демонстрациях. В фокусе — повышение success rate, стабильности и обобщающей способности моделей, адаптация к конкретным робототехническим платформам, задачам, сенсорам и интерфейсам управления. Вам предстоит работать с behavior cloning и его вариантами, представлением действий, мультимодальными входами, temporal context и другими компонентами, которые определяют качество policy на заключительном этапе обучения. Offline и online reinforcement learning
Вы будете исследовать и внедрять RL-подходы для улучшения VLA-политик после предобучения и supervised fine-tuning. В зоне ответственности — offline RL на логах взаимодействий и демонстрациях, offline-to-online RL, RL fine-tuning и residual RL. Будет уделяться внимание тому, как безопасно использовать данные реальных rollout’ов, строить reward’ы и success-сигналы, улучшать политики без потери исходных навыков и находить баланс между качеством, устойчивостью и sample efficiency. Обучение на corrective data и recovery trajectories
Вам предстоит развивать ML-часть обучения роботов на их собственных ошибках. Робот может попасть в OOD-состояние, начать неуспешно выполнять навык или потерять уверенность; в таких случаях оператор или другой механизм восстановления формирует корректирующую траекторию. Эти эпизоды становятся данными для следующей итерации обучения. Вы будете работать с подходами уровня DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и dataset aggregation. Основная задача — превращать всё это в улучшение VLA-policy. Сбор данных, teleoperation и операционные процессы находятся на стороне других команд; с вашей стороны — требования к данным, методы обучения, оценка качества и интеграция результатов в training pipeline. OOD robustness и final-mile quality
Вы будете улучшать качество моделей в сложных, редких и нештатных сценариях: при распределительном сдвиге, изменении условий сцены, ошибках восприятия, накоплении ошибок управления и неполных или шумных наблюдениях. В фокусе — анализ failure modes, OOD robustness, uncertainty-aware и recovery-oriented learning, работа с hard examples и long-tail-данными. Важно строить понятные метрики качества: success rate, recovery rate, intervention rate, устойчивость к возмущениям и безопасность выполнения задач. Больше об ML в Яндексе — в канале Yandex for ML

Ключевые навыки:

  • Уверенно программируете на Python и работали с PyTorch
  • Имеете сильную базу в deep learning и reinforcement learning
  • Понимаете основные подходы в RL: policy optimization, actor-critic, value learning, off-policy learning и offline RL
  • Понимаете, что такое behavior cloning, covariate shift и dataset aggregation
  • Умеете ставить эксперименты, проводить абляции, работать с метриками и анализировать причины деградации моделей
  • Умеете читать исследовательские статьи и превращать исследовательские идеи в устойчивые ML-пайплайны

Дополнительные требования:

  • Работали с гуманоидными роботами или другими физическими робототехническими платформами
  • Знакомы с DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и recovery learning
  • Работали с online RL, offline-to-online RL, safe RL, constrained RL или residual RL
  • Знакомы с Isaac Lab, Isaac Sim, MuJoCo, ManiSkill или другими симуляторами