Ищем инициативного Data Engineer для разработки и поддержки инфраструктуры данных большого проекта озера данных.

Условия: удаленно/гибрид, локация — Москва, оформление по ТК РФ.

Обязанности:

  • разработка и поддержание парсеров
  • автоматизация обработки и преобразования данных
  • отладка и мониторинг конвейеров данных

Технологический стек: Python, PostgreSQL, Dagster, Selenium

Требования:

  • знание основных библиотек Python для работы с данными
  • опыт обработки и скрейпинга/парсинга сложных и слабоструктурированных документов (pdf, doc, docx, xls, xlsx)
  • опыт автоматизации конвейеров данных и знание соответствующих инструментов
  • представление об управлении качеством данных
  • понимание отладки и мониторинга конвейеров
  • понимание форматов данных (JSON lines, Parquet, XML, CSV и т.д.)
  • понимание методов получения и поставки данных (S3, REST API, SOAP, RPC)
  • знание Git
  • знание английского на уровне чтения технической документации

Плюсы: опыт работы с данными из открытых источников, долгосрочная поддержка парсеров, опыт с библиотеками Python для computer vision.

Преимущества проекта: проект только стартовал — мало легаси, много свободы для экспериментов; возможность влиять на выбор технологий и архитектурных решений.