Ищем инициативного Data Engineer для разработки и поддержки инфраструктуры данных большого проекта озера данных.
Условия: удаленно/гибрид, локация — Москва, оформление по ТК РФ.
Обязанности:
- разработка и поддержание парсеров
- автоматизация обработки и преобразования данных
- отладка и мониторинг конвейеров данных
Технологический стек: Python, PostgreSQL, Dagster, Selenium
Требования:
- знание основных библиотек Python для работы с данными
- опыт обработки и скрейпинга/парсинга сложных и слабоструктурированных документов (pdf, doc, docx, xls, xlsx)
- опыт автоматизации конвейеров данных и знание соответствующих инструментов
- представление об управлении качеством данных
- понимание отладки и мониторинга конвейеров
- понимание форматов данных (JSON lines, Parquet, XML, CSV и т.д.)
- понимание методов получения и поставки данных (S3, REST API, SOAP, RPC)
- знание Git
- знание английского на уровне чтения технической документации
Плюсы: опыт работы с данными из открытых источников, долгосрочная поддержка парсеров, опыт с библиотеками Python для computer vision.
Преимущества проекта: проект только стартовал — мало легаси, много свободы для экспериментов; возможность влиять на выбор технологий и архитектурных решений.