Мы ищем инженера данных для работы в крупном банке с промышленным хранилищем данных и большими объемами финансовых и операционных данных. Вы будете разрабатывать и сопровождать ETL/ELT-пайплайны, обеспечивать надежность загрузок и качество данных на всех этапах: от источников до витрин и BI-отчетности.
Технологический стек:
• Хранилище данных и ETL: Greenplum, UI DWH (настройка ETL-загрузки), Airflow
• BI-платформа: Power BI (DAX, ролевые модели доступа)
• Управление данными и моделирование: Data Vault 2.0, OpenMetadata (каталог данных)
• Инструменты и инфраструктура: SQL-клиент (DBeaver или аналог), Git, GitLab, Wiki (Eva или аналог)
Обязанности
1. Разработка и сопровождение ETL/ELT-пайплайнов
• Самостоятельно реализовывать и сопровождать пайплайны для критичных бизнес-процессов.
• Работать с задачами повышенной сложности без постоянного контроля руководителя.
• Понимать полный цикл поставки данных: источник → загрузка → трансформация → контроль качества → публикация витрины → эксплуатация → исправление дефектов.
• Участвовать в постановке загрузок на регулярное расписание и согласовывать технические решения с аналитиками и владельцами витрин.
• Разрабатывать и поддерживать ETL/ELT-процессы в Airflow или аналогичном оркестраторе.
• Вносить улучшения в существующие ETL-цепочки: повышать стабильность, снижать время загрузки, устранять избыточные шаги и повторяющиеся ручные операции.
2. Работа с данными и SQL
• Уверенно работать с Greenplum или другими MPP-СУБД: сложный SQL, оптимизация запросов, индексы, партиционирование, анализ причин деградации производительности.
• Понимать нормализацию, денормализацию, схемы звезда/снежинка и принципы Data Vault 2.0.
• Участвовать в проектировании слоев КХД, витрин и интеграций.
• Реализовывать пайплайны с учетом требований к надежности, идемпотентности, повторному запуску и полноте загрузки данных.
3. Обработка больших данных (Spark)
• Иметь практический опыт работы с Apache Spark: Spark SQL, DataFrame API, пакетная обработка.
• Применять базовые приемы оптимизации: партиционирование, кэширование, broadcast join.
• Диагностировать типовые проблемы производительности в Spark-задачах.
4. Качество данных и эксплуатация
• Выполнять сверки между источниками, слоями КХД и витринами.
• Внедрять SQL-проверки полноты, согласованности и корректности данных.
• Отслеживать стабильность загрузок, анализировать логи, участвовать в расследовании инцидентов и устранении причин дефектов.
• Настраивать базовый мониторинг загрузок, логи и оповещения по критичным сбоям.
• Участвовать в автоматизации отладки пайплайнов.
• Собирать статистику сроков построения витрин и помогать оценивать возможность SLA по загрузкам и отчетности.
• Писать тесты и сверки для ETL-процессов, контролировать полноту, корректность и своевременность загрузок.
5. Документирование и взаимодействие
• Документировать потоки данных, правила трансформации, зависимости и эксплуатационные особенности.
• Работать в связке с аналитиками данных, тестировщиками, архитектором и владельцами витрин.
• Следовать архитектурным стандартам и документировать технические решения.
• Понимать подходы к миграции данных между DWH-платформами (например, Oracle → Greenplum или сопоставимые переходы).
Обязательные требования
• Опыт работы в инженерии данных или ETL-разработке не менее 3 лет, включая промышленную разработку банковских КХД, витрин и интеграционных потоков.
• Опыт работы в промышленном ETL-ландшафте: регулярные загрузки, расписания, зависимости, инциденты и сопровождение витрин после внедрения.
• Понимание полного цикла поставки данных.
• Уверенное владение SQL: сложные запросы, оптимизация, индексы, партиционирование.
• Глубокое понимание Greenplum (или других MPP-СУБД): распределение, партиционирование, планы выполнения, анализ деградации производительности.
• Понимание схем звезда/снежинка и принципов Data Vault 2.0.
• Практический опыт Apache Spark: Spark SQL, DataFrame API, пакетная обработка.
• Базовые приемы оптимизации в Spark: партиционирование, кэширование, broadcast join, диагностика проблем производительности.
• Python и/или Java для доработки пайплайнов, утилит, проверок качества и автоматизации регламентных операций.
• Airflow (или аналогичный оркестратор) — разработка и поддержка ETL/ELT-процессов.
• Git и участие в CI/CD-процессах.
• Liquibase (или аналоги) для управления схемами и миграциями данных.
• Понимание подходов к миграции между DWH-платформами (Oracle → Greenplum и др.).
• Аналитическое мышление.
• Умение объяснять сложные вещи простым языком.
• Умение структурировать информацию и фиксировать договоренности по итогам встреч.
• Навыки письменной коммуникации: понятные комментарии, статусы, описания решений, инструкции и документация.
• Ответственность за корректность результатов.
Будет плюсом
• Опыт работы с OpenMetadata или другими каталогами данных.
• Опыт миграции данных между DWH-платформами.
• Участие в настройке мониторинга и алертинга для ETL-пайплайнов.
• Понимание SLA по загрузкам и отчетности.