Мы создаём платформу нового поколения для разработки ПО на основе автономных AI-агентов. Продукт - распределённая система из множества сервисов, развёрнутых в Kubernetes, с интеграциями в GitLab, LiteLLM, Langfuse, PostgreSQL и Keycloak. Мы поставляем продукт как в облачном виде (multi-tenant), так и в виде on-prem инсталляций у корпоративных клиентов с собственными контурами безопасности. Мы ищем DevOps-инженера, который возьмёт на себя CI/CD-платформу и релизный конвейер. От вас зависит, насколько быстро и предсказуемо команда выкатывает новые версии — и насколько спокойно мы спим во время раскаток у клиентов.
Обязанности
CI/CD-платформа:
• Построение и развитие единой CI/CD-платформы: шаблоны пайплайнов, переиспользуемые компоненты, политики качества (линтеры, тесты, security scans).
• Автоматизация сборки и публикации разнородных артефактов: Docker-образы, Helm-чарты, Python-пакеты, фронтенд-бандлы, миграции БД, библиотеки скиллов и промптов для агентов.
• Управление версионированием, тегированием и трассируемостью «коммит → артефакт → стенд → релиз».
Релизный процесс:
• Автоматизация выкаток на множество стендов: dev / test / stage / preprod / прод + клиентские контуры. Промоутирование артефактов между средами без пересборки.
• Стратегии деплоя через ArgoCD: blue-green, canary, поэтапные раскатки, автоматический откат.
• Релизные ворота: автотесты, ручные апрувы, smoke-тесты после деплоя.
• Инструменты для on-prem поставок: упаковка дистрибутивов, оффлайн-инсталляции, скрипты обновления у клиентов.
Инфраструктура и эксплуатация:
• Kubernetes-кластеры (в облаке — Yandex Managed Service for Kubernetes: мастер, автообновления и восстановление узлов на стороне провайдера; вы управляете группами узлов, нагрузкой и конфигурацией): Helm-чарты, оператор-паттерны, GitOps на ArgoCD.
• Управление секретами (Vault/SOPS), сертификатами, сетевыми политиками.
• Observability стек: Prometheus, Grafana, OpenTelemetry. Дашборды и алерты для релизных метрик.
Обязательные требования
• Уверенный Python как основной инструмент. У нас CI-логика реализована на Python, чтобы минимально зависеть от движка сборки — это ядро релизной автоматизации, а не вспомогательные скрипты. Ждём умения писать поддерживаемый код с тестами, а не разовые скрипты.
• Глубокий GitLab CI. Наша платформа и процессы построены вокруг GitLab CI: переиспользуемые шаблоны, child
- и multi-project-пайплайны, dotenv-артефакты, оптимизация времени сборки и кэширование. Это ваш ежедневный инструмент.
• Готовность работать с другими CI-системами. В отдельных клиентских внедрениях мы можем мигрировать на Jenkins, Bitbucket Pipelines или другой движок по требованию заказчика. Глубокое знание конкретной системы не обязательно — важна способность быстро в ней разобраться и перенести нашу Python-логику на новый движок с минимальной переделкой.
• Уверенный Kubernetes: понимание ресурсов, RBAC, сетевой модели и сетевых политик (Calico/Cilium), управление группами узлов и нагрузкой. Опыт работы с managed-кластерами (в облаке у нас Yandex Managed Service for Kubernetes) — умение диагностировать проблемы на уровне узлов и подов, не залезая в control plane, который ведёт провайдер.
• Helm + GitOps-подход: опыт написания нетривиальных Helm-чартов и эксплуатации ArgoCD (или Flux) в продакшене — включая стратегии деплоя (blue-green, canary, поэтапные раскатки) и автооткат.
• Версионирование и трассируемость: опыт проектирования схемы «коммит → артефакт → стенд → релиз», промоутирования артефактов между средами без пересборки.
• Docker / OCI: многослойные образы, multi-stage-сборки, оптимизация размера и времени сборки.
• Linux на уровне администратора: systemd, сеть, файловые системы, отладка performance-проблем.
• Системное мышление: способность видеть весь релизный конвейер как продукт со своими SLA, а не как набор скриптов.
Будет плюсом
• Опыт on-prem / air-gapped поставок — упаковка дистрибутивов, оффлайн-инсталляции, скрипты обновления у клиентов.