назад

Старший инженер данных

Мы ищем старшего инженера данных для работы в крупном банке с промышленным хранилищем данных и большими объемами финансовых и операционных данных. Вы будете разрабатывать и сопровождать ETL/ELT-пайплайны, обеспечивать надежность загрузок и качество данных на всех этапах: от источников до витрин и BI-отчетности.
Технологический стек:
• Хранилище данных и ETL: Greenplum, UI DWH (настройка ETL-загрузки), Airflow
• BI-платформа: Power BI (DAX, ролевые модели доступа)
• Управление данными и моделирование: Data Vault 2.0, OpenMetadata (каталог данных)
• Инструменты и инфраструктура: SQL-клиент (DBeaver или аналог), Git, GitLab, Wiki (Eva или аналог)

Обязанности

1. Архитектура и стратегия данных
• Самостоятельно вести техническое направление или крупный контур данных.
• Отвечать за архитектурную целостность, производительность, надежность и сопровождаемость решений.
• Проектировать логические и физические модели DWH, витрины и потоки данных с учетом Data Vault 2.0, происхождения данных, SLA/SLO, масштабирования и стоимости сопровождения.
• Выбирать архитектурные паттерны загрузки, инкрементальности, восстановления, дедупликации и контроля качества данных.
• Прорабатывать интеграции с источниками, BI, сервисами и внешними системами, учитывать требования информационной безопасности и разграничения доступа.
• Проектировать загрузки и интеграции с учетом банковских систем-источников, критичности данных, регламентов обновления и требований к аудиту.

2. Техническое лидерство и развитие команды
• Выступать техническим лидером для инженеров данных и ETL-разработчиков.
• Проводить ревью решений, кода, моделей и пайплайнов.
• Консультировать коллег по архитектуре и оптимизации.
• Формировать переиспользуемые подходы для команды, а не только реализовывать отдельные пайплайны.
• Разрабатывать общие ETL-фреймворки, библиотеки и стандарты команды, сокращающие дублирование и повышающие надежность поставки данных.
• Наставлять специалистов, участвовать в планировании развития платформы данных и оценке технических рисков.
• Развивать корпоративную аналитическую платформу, помогать аналитикам и инженерам эффективнее использовать данные и инфраструктуру.

3. Разработка и оптимизация ETL/ELT-пайплайнов
• Проектировать сложные ETL/ELT-пайплайны в Airflow или аналогичных инструментах.
• Обеспечивать контроль версий и автоматизированные проверки.
• Проектировать архитектуру ETL-потоков под разные источники и объемы данных.
• Выбирать подходящую модель хранения и стратегию загрузки.
• Внедрять автоматическое восстановление процессов, политики версионирования и развертывания данных, ведение логов и алертинг.

4. Работа с Big Data (Spark)
• Глубоко владеть Apache Spark, проектировать производительные пайплайны под большие объемы и сложную трансформационную логику.
• Понимать DAG, shuffle, механизмы исполнения Spark (executors), управление ресурсами.
• Оптимизировать Spark-задачи, устранять узкие места производительности.
• Настраивать кластерную инфраструктуру и лучшие практики по мониторингу Spark-задач, контролю ресурсов.
• Организовывать интеграцию Spark с Kafka, Airflow и другими инструментами.

5. Качество данных и эксплуатация
• Внедрять систему контроля качества данных: полнота, согласованность, своевременность, проверяемость.
• Проводить регрессионные проверки и мониторинг пайплайнов.
• Настраивать наблюдаемость загрузок, алертинг, анализ причин инцидентов.
• Разрабатывать корректирующие действия для предотвращения повторных сбоев.
• Внедрять проверки качества данных, мониторинг Spark-задач и автоматическое восстановление процессов.

6. Бизнес-взаимодействие и SLA
• Иметь опыт анализа статистики сроков сбора витрин.
• Готовить SLA/SLO и согласовывать ожидания с бизнес-заказчиками.
• Проактивно взаимодействовать с архитекторами и заказчиками данных.
• Предлагать оптимизацию процессов загрузки и хранения под цели бизнеса.
• Ведет проекты перехода на Spark-инфраструктуру или миграции между DWH-платформами, включая сценарии Oracle → Greenplum или сопоставимые переходы.

Обязательные требования

• Опыт построения и развития банковских КХД, ETL/ELT и платформ данных не менее 5 лет, включая работу с большими объемами данных в промышленной среде.
• Опыт реализации КХД-решений, миграций или модернизации платформы данных с измеримым эффектом по скорости, надежности и масштабируемости.
• Понимание банковских систем-источников, критичности данных, регламентов обновления и требований к аудиту.
• Глубокое владение Greenplum (или другими MPP-СУБД): распределение данных, партиционирование, планы выполнения, оптимизация под большие объемы и параллельную обработку.
• Опыт проектирования логических и физических моделей DWH.
• Глубокое понимание схем звезда/снежинка и Data Vault 2.0 на уровне архитектурных решений.
• Глубокое владение Apache Spark: проектирование производительных пайплайнов под большие объемы.
• Понимание DAG, shuffle, механизмов исполнения Spark (executors), управления ресурсами.
• Опыт оптимизации Spark-задач и устранения узких мест производительности.
• Настройка кластерной инфраструктуры и мониторинга Spark-задач.
• Опыт интеграции Spark с Kafka, Airflow и другими инструментами.
• Проектирование сложных ETL/ELT-пайплайнов в Airflow (или аналогах).
• Python и Java для разработки переиспользуемых фреймворков, библиотек, утилит и средств мониторинга данных.
• Опыт разработки общих ETL-фреймворков и стандартов команды.
• Настройка автоматического восстановления процессов, политик версионирования и развертывания данных.
• Опыт миграции данных между DWH-платформами (Oracle → Greenplum или сопоставимые переходы).
• Управление схемами и миграциями (Liquibase или аналоги).
• Git и CI/CD-процессы.
• Аналитическое мышление.
• Умение объяснять сложные вещи простым языком.
• Умение структурировать информацию и фиксировать договоренности по итогам встреч.
• Навыки письменной коммуникации: понятные комментарии, статусы, описания решений, инструкции и документация.
• Ответственность за корректность результатов.

Будет плюсом

• Опыт работы с OpenMetadata или другими каталогами данных.
• Опыт настройки мониторинга и алертинга для ETL-пайплайнов.
• Опыт работы с Kafka.
• Понимание SLA/SLO и их согласование с бизнесом.
• Опыт миграции между DWH-платформами.

Расположение

Remote work

тип работы

DWH Development

Номер вакансии

VR-72097

язык

English: A2 Elementary

Опыт работы

Senior

откликнуться

Нажимая «Отправить», я подписываю соглашение об использовании простой электронной подписи для подписания документов, связанных с обработкой моих персональных данных.

Я даю согласие на обработку персональных данных в целях потенциального трудоустройства. С Политикой обработки персональных данных можно ознакомиться здесь.

Я даю согласие на обработку персональных данных в целях включения в кадровый резерв. С Положением о кадровом резерве можно ознакомиться здесь.

Я даю согласие ООО «ИТ1» и компаниям на направление мне маркетинговых материалов и коммерческих предложений. Проставляя галочку, я также даю согласие на обработку персональных данных в указанных целях.

Работа у нас — это:

ДМС и страхование жизни

Корпоративные мероприятия

Культура обратной связи

Внутренняя ротация и ежегодная оценка

наставничество
и менторство

обучение, повышение квалификации

Индивидуальный план развития

Реферальная программа

Внутренние IT-сообщества

Похожие вакансии

Инженер данных

DWH Development Remote work

Мы ищем инженера данных для работы в крупном банке с промышленным хранилищем данных и большими объемами финансовых и операционных данных. Вы будете разрабатывать и сопровождать ETL/ELT-пайплайны, обеспечивать надежность загрузок и качество данных на все...

Старший инженер данных (Senior+/Lead)

DWH Development Remote work

Мы ищем опытного инженера данных уровня Senior+ для работы в крупном банке с промышленным хранилищем данных и большими объемами финансовых и операционных данных. Вы будете разрабатывать и сопровождать ETL/ELT-пайплайны, обеспечивать надежность загрузок ...

Возврат к списку