Data Engineer Middle в федеральную логистическую компанию. Гражданство и локация — без ограничений (не более ±1 часа от МСК). Срок проекта — долгосрочный. Старт ASAP.

Ставка: Ставка 1600, с НДС

Стек: Greenplum, Trino, Apache Airflow, ClickHouse, Python, Spark, SQL (dbt), S3, Hadoop, Iceberg, Kafka, Cosmos, Flink

Обязанности:

  • Сбор требований с бизнес-заказчиков и анализ источников данных
  • Разработка, реализация и поддержка интеграционных потоков и потоков сборки витрин данных на принятом стеке: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink
  • Оперативное реагирование на инциденты в зоне ответственности и выполнение типовых задач в установленные сроки
  • Поддержание документации типовых интеграционных решений платформы больших данных и предоставление отчетности руководителю

Требования:

  • Общее представление о стеке технологий Lakehouse
  • Понимание различий работы BigData/Lakehouse и работы с данными обычного размера
  • Знание SQL (индексы, функции, оптимизация, профилирование производительности)
  • Знание языков программирования: Java, Python
  • Опыт работы с реляционными БД (Oracle, Postgres, MySQL, MsSQL и т.п.)
  • Умение работать с Git (git pull/commit/push)
  • Опыт работы с DBT, Cosmos, Ni-Fi
  • Опыт разработки на Spark
  • Понимание особенностей Trino
  • Знание форматов данных: Iceberg, Parquet, Avro
  • Опыт работы с MinIO или другим S3-совместимым хранилищем
  • Опыт использования систем ведения проектов и документации