YT (YTsaurus) — это основная платформа для аналитики и построения batch-процессов в Яндексе, которая включает несколько видов хранилищ, планировщик ресурсов и встроенный MapReduce-движок. Apache Spark — популярный открытый фреймворк для распределённой обработки больших объёмов данных. Уже больше 5 лет мы занимаемся интеграцией Spark с YTsaurus в рамках проекта SPYT. За это время Spark стал одним из основных аналитических инструментов для работы с данными, которые хранятся в YTsaurus и используются как внутри Яндекса, так и внешними пользователями. Исходный код SPYT доступен в опенсорсе в [репозитории](https://github.com/ytsaurus/ytsaurus-spyt). За последние годы мы несколько раз рассказывали про наш проект на конференциях: * [Как подключить к Apache Spark проприетарный источник данных](https://highload.ru/spring/2021/abstracts/7266) * [Помогаем планировщику Apache Spark быть ещё эффективнее](https://highload.ru/spb/2023/abstracts/10222) * [Spark Connect: новый подход для работы с Apache Spark](https://www.youtube.com/watch?v=ayAJ2UGVGRU) * [YTsaurus Shuffle Service: как повысить надёжность и производительность тяжёлых Spark-приложений](https://www.youtube.com/watch?v=U8WhhKuxfNU) Перед нами стоят всё более интересные и амбициозные задачи, и мы ищем сильного разработчика, который станет частью нашей команды.

Обязанности:

Повышение эффективности интеграции Apache Spark и YTsaurus
Как у Spark, так и у YTsaurus регулярно выходят новые версии, которые расширяют набор предоставляемых этими инструментами возможностей. Одна из основных задач команды — постоянно интегрировать их, чтобы обеспечивать наиболее эффективное взаимодействие. Кроме того, мы проводим регулярные бенчмарки, в ходе которых определяем проблемные зоны в интеграции и устраняем их. Расширение области применения инструмента
Мы находимся в тесном контакте с дата-инженерами — как с теми, кто работает в Яндексе, так и с опенсорс-пользователями: помогаем им наиболее эффективно решать задачи при помощи нашего инструмента. На основе обратной связи от них, а также общих трендов развития инструментов для дата-инженерии мы регулярно актуализируем план дальнейшей интеграции. Продвижение опенсорс-проекта
С 2023 года код YTsaurus, в том числе и SPYT, есть в открытом доступе, поэтому мы активно работаем над развитием внешнего комьюнити вокруг проекта.

Ключевые навыки:

  • Работали с Apache Spark не менее трёх лет и знаете, как добиться от него максимальной эффективности
  • Умеете разрабатывать под JVM на Java и Scala, а также на Python
  • Понимаете принципы распределённого хранения и обработки больших объёмов данных

Дополнительные требования:

  • Работали с Hadoop-стеком (HDFS, YARN)
  • Работали с Docker и Kubernetes
  • Принимали участие в работе над опенсорс-проектом
  • Знаете C++