Data Engineer Middle в федеральную логистическую компанию. Гражданство и локация — без ограничений (не более ±1 часа от МСК). Срок проекта — долгосрочный. Старт ASAP.
Ставка: Ставка 1600, с НДС
Стек: Greenplum, Trino, Apache Airflow, ClickHouse, Python, Spark, SQL (dbt), S3, Hadoop, Iceberg, Kafka, Cosmos, Flink
Обязанности:
- Сбор требований с бизнес-заказчиков и анализ источников данных
- Разработка, реализация и поддержка интеграционных потоков и потоков сборки витрин данных на принятом стеке: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink
- Оперативное реагирование на инциденты в зоне ответственности и выполнение типовых задач в установленные сроки
- Поддержание документации типовых интеграционных решений платформы больших данных и предоставление отчетности руководителю
Требования:
- Общее представление о стеке технологий Lakehouse
- Понимание различий работы BigData/Lakehouse и работы с данными обычного размера
- Знание SQL (индексы, функции, оптимизация, профилирование производительности)
- Знание языков программирования: Java, Python
- Опыт работы с реляционными БД (Oracle, Postgres, MySQL, MsSQL и т.п.)
- Умение работать с Git (git pull/commit/push)
- Опыт работы с DBT, Cosmos, Ni-Fi
- Опыт разработки на Spark
- Понимание особенностей Trino
- Знание форматов данных: Iceberg, Parquet, Avro
- Опыт работы с MinIO или другим S3-совместимым хранилищем
- Опыт использования систем ведения проектов и документации