Построение единой системы мониторинга, сбора метрик и логов для компонентов Kubernetes-кластера. Обеспечение прозрачности работы PROD-окружения.
Обязанности
• Развёртывание и настройка Victoria Metrics (vm-cluster, vm-agent, vmalert) для сбора метрик k8s-кластера
• Развёртывание и сопровождение Victoria Logs для централизованного сбора логов
• Настройка сбора метрик и логов с k8s-подов: vmagent, fluent-bit / vector, Prometheus exporters
• Разработка и поддержка дашбордов в Grafana: визуализация состояния кластера, сервисов, бизнес-метрик
• Настройка alerting-правил (vmalert, Alertmanager), интеграция с дежурными сменами (PagerDuty / Telegram / Slack)
• Настройка ServiceMonitors / PodMonitors, поддержка kube-prometheus-stack
• Интеграция observability-стека с SIEM и системами incident management
• Участие в расследовании инцидентов, построение SLO/SLI
Обязательные требования
• Опыт развёртывания и эксплуатации Victoria Metrics / Victoria Logs от 1 года (или глубокий опыт Prometheus + Loki)
• Уверенное знание Grafana: дашборды, alerting, provisioning, data sources
• Понимание Prometheus-экосистемы: exporters, ServiceMonitors, kube-prometheus-stack
• Опыт настройки сбора логов с k8s: fluent-bit / vector / Promtail
• Понимание основ k8s (Pods, Deployments, Services, DaemonSets)
• Опыт работы с Linux, YAML, Helm
• Понимание принципов observability: метрики, логи, трейсы
Будет плюсом
• Опыт с OpenTelemetry, Jaeger, Tempo
• Опыт с Loki, OpenSearch, Elasticsearch
• Написание PromQL / MetricsQL запросов средней и высокой сложности
• Опыт построения SLO/SLI/Error Budgets
• Сертификации Prometheus / Grafana