назад

Инженер данных

Мы ищем инженера данных для работы в крупном банке с промышленным хранилищем данных и большими объемами финансовых и операционных данных. Вы будете разрабатывать и сопровождать ETL/ELT-пайплайны, обеспечивать надежность загрузок и качество данных на всех этапах: от источников до витрин и BI-отчетности.
Технологический стек:
• Хранилище данных и ETL: Greenplum, UI DWH (настройка ETL-загрузки), Airflow
• BI-платформа: Power BI (DAX, ролевые модели доступа)
• Управление данными и моделирование: Data Vault 2.0, OpenMetadata (каталог данных)
• Инструменты и инфраструктура: SQL-клиент (DBeaver или аналог), Git, GitLab, Wiki (Eva или аналог)

Обязанности

1. Разработка и сопровождение ETL/ELT-пайплайнов
• Самостоятельно реализовывать и сопровождать пайплайны для критичных бизнес-процессов.
• Работать с задачами повышенной сложности без постоянного контроля руководителя.
• Понимать полный цикл поставки данных: источник → загрузка → трансформация → контроль качества → публикация витрины → эксплуатация → исправление дефектов.
• Участвовать в постановке загрузок на регулярное расписание и согласовывать технические решения с аналитиками и владельцами витрин.
• Разрабатывать и поддерживать ETL/ELT-процессы в Airflow или аналогичном оркестраторе.
• Вносить улучшения в существующие ETL-цепочки: повышать стабильность, снижать время загрузки, устранять избыточные шаги и повторяющиеся ручные операции.

2. Работа с данными и SQL
• Уверенно работать с Greenplum или другими MPP-СУБД: сложный SQL, оптимизация запросов, индексы, партиционирование, анализ причин деградации производительности.
• Понимать нормализацию, денормализацию, схемы звезда/снежинка и принципы Data Vault 2.0.
• Участвовать в проектировании слоев КХД, витрин и интеграций.
• Реализовывать пайплайны с учетом требований к надежности, идемпотентности, повторному запуску и полноте загрузки данных.

3. Обработка больших данных (Spark)
• Иметь практический опыт работы с Apache Spark: Spark SQL, DataFrame API, пакетная обработка.
• Применять базовые приемы оптимизации: партиционирование, кэширование, broadcast join.
• Диагностировать типовые проблемы производительности в Spark-задачах.

4. Качество данных и эксплуатация
• Выполнять сверки между источниками, слоями КХД и витринами.
• Внедрять SQL-проверки полноты, согласованности и корректности данных.
• Отслеживать стабильность загрузок, анализировать логи, участвовать в расследовании инцидентов и устранении причин дефектов.
• Настраивать базовый мониторинг загрузок, логи и оповещения по критичным сбоям.
• Участвовать в автоматизации отладки пайплайнов.
• Собирать статистику сроков построения витрин и помогать оценивать возможность SLA по загрузкам и отчетности.
• Писать тесты и сверки для ETL-процессов, контролировать полноту, корректность и своевременность загрузок.

5. Документирование и взаимодействие
• Документировать потоки данных, правила трансформации, зависимости и эксплуатационные особенности.
• Работать в связке с аналитиками данных, тестировщиками, архитектором и владельцами витрин.
• Следовать архитектурным стандартам и документировать технические решения.
• Понимать подходы к миграции данных между DWH-платформами (например, Oracle → Greenplum или сопоставимые переходы).

Обязательные требования

• Опыт работы в инженерии данных или ETL-разработке не менее 3 лет, включая промышленную разработку банковских КХД, витрин и интеграционных потоков.
• Опыт работы в промышленном ETL-ландшафте: регулярные загрузки, расписания, зависимости, инциденты и сопровождение витрин после внедрения.
• Понимание полного цикла поставки данных.
• Уверенное владение SQL: сложные запросы, оптимизация, индексы, партиционирование.
• Глубокое понимание Greenplum (или других MPP-СУБД): распределение, партиционирование, планы выполнения, анализ деградации производительности.
• Понимание схем звезда/снежинка и принципов Data Vault 2.0.
• Практический опыт Apache Spark: Spark SQL, DataFrame API, пакетная обработка.
• Базовые приемы оптимизации в Spark: партиционирование, кэширование, broadcast join, диагностика проблем производительности.
• Python и/или Java для доработки пайплайнов, утилит, проверок качества и автоматизации регламентных операций.
• Airflow (или аналогичный оркестратор) — разработка и поддержка ETL/ELT-процессов.
• Git и участие в CI/CD-процессах.
• Liquibase (или аналоги) для управления схемами и миграциями данных.
• Понимание подходов к миграции между DWH-платформами (Oracle → Greenplum и др.).
• Аналитическое мышление.
• Умение объяснять сложные вещи простым языком.
• Умение структурировать информацию и фиксировать договоренности по итогам встреч.
• Навыки письменной коммуникации: понятные комментарии, статусы, описания решений, инструкции и документация.
• Ответственность за корректность результатов.

Будет плюсом

• Опыт работы с OpenMetadata или другими каталогами данных.
• Опыт миграции данных между DWH-платформами.
• Участие в настройке мониторинга и алертинга для ETL-пайплайнов.
• Понимание SLA по загрузкам и отчетности.

Расположение

Remote work

тип работы

DWH Development

Номер вакансии

VR-72096

язык

English: A2 Elementary

Опыт работы

Regular

откликнуться

Нажимая «Отправить», я подписываю соглашение об использовании простой электронной подписи для подписания документов, связанных с обработкой моих персональных данных.

Я даю согласие на обработку персональных данных в целях потенциального трудоустройства. С Политикой обработки персональных данных можно ознакомиться здесь.

Я даю согласие на обработку персональных данных в целях включения в кадровый резерв. С Положением о кадровом резерве можно ознакомиться здесь.

Я даю согласие ООО «ИТ1» и компаниям на направление мне маркетинговых материалов и коммерческих предложений. Проставляя галочку, я также даю согласие на обработку персональных данных в указанных целях.

Работа у нас — это:

ДМС и страхование жизни

Корпоративные мероприятия

Культура обратной связи

Внутренняя ротация и ежегодная оценка

наставничество
и менторство

обучение, повышение квалификации

Индивидуальный план развития

Реферальная программа

Внутренние IT-сообщества

Похожие вакансии

Старший инженер данных

DWH Development Remote work

Мы ищем старшего инженера данных для работы в крупном банке с промышленным хранилищем данных и большими объемами финансовых и операционных данных. Вы будете разрабатывать и сопровождать ETL/ELT-пайплайны, обеспечивать надежность загрузок и качество данн...

Старший инженер данных (Senior+/Lead)

DWH Development Remote work

Мы ищем опытного инженера данных уровня Senior+ для работы в крупном банке с промышленным хранилищем данных и большими объемами финансовых и операционных данных. Вы будете разрабатывать и сопровождать ETL/ELT-пайплайны, обеспечивать надежность загрузок ...

Возврат к списку