Подготовка и эксплуатация PROD-инфраструктуры для высоконагруженной системы. Обеспечение отказоустойчивости, disaster recovery и бесперебойной работы сервисов.
Обязанности
• Подготовка и настройка PROD-инфраструктуры: Linux-серверы, сетевое окружение, hardening ОС
• Развёртывание и эксплуатация кластеров PostgreSQL: репликация, backup (pgBackRest / WAL-G), Patroni / Repmgr, tuning под нагрузку
• Развёртывание и сопровождение Kubernetes-кластеров (production-grade): Helm, Operators, Kustomize
• Проектирование и реализация стратегий backup и Disaster Recovery (DR): RPO/RTO, гео-репликация, multi-AZ
• Обеспечение отказоустойчивости: HA-архитектуры, автоматическое восстановление, chaos-практики
• Описание инфраструктуры как код (IaC): Terraform, Ansible
• Построение CI/CD-пайплайнов (GitLab CI / ArgoCD / Jenkins), GitOps-подход
• Участие в расследовании PROD-инцидентов, написание runbooks
Обязательные требования
• Опыт эксплуатации Kubernetes в production от 3 лет
• Уверенное знание PostgreSQL: кластеры, backup, репликация, tuning
• Глубокое знание Linux (RHEL / Ubuntu / CentOS): kernel tuning, systemd, networking, security hardening
• Опыт построения DR-стратегий и обеспечения отказоустойчивости
• IaC: Terraform, Ansible
• CI/CD: GitLab CI, ArgoCD, Jenkins
• Git flow, code review, работа с Git (GitLab / GitHub)
Будет плюсом
• Сертификации CKA / CKAD / RHCE
• Опыт работы с Yandex Cloud / AWS / Hybrid-окружениями
• Опыт с Kafka / RabbitMQ в k8s
• HashiCorp Vault (секреты)
• Опыт в регулируемых отраслях (финтех, биржа, госсектор)