Команда выстраивает современные CI/CD‑процессы на базе open‑source‑решений, обеспечивает поддержку тестовых окружений, команд разработки и тестирования. Ищем инженера в Devops команду развития ai сервисов.
Обязанности
• Проектирование и развитие архитектуры AI‑систем и сервисов инференса.
• Внедрение и настройка GPU‑планировщика для шаринга нагрузки на одном физическом сервере и k8s.
• Проектирование и поддержка ML‑пайплайнов.
• Организация CI/CD для моделей: версионирование данных, моделей, экспериментов.
• Мониторинг production‑моделей и инфраструктуры.
• Деплой и оптимизация LLM / inference‑серверов.
• Контейнеризация и оркестрация сервисов (Kubernetes, Helm).
• Настройка и поддержка CI/CD (GitLab CI).
• Настройка мониторинга и observability (Prometheus, Grafana).
• Обеспечение выполнения требований информационной безопасности в отношении инфраструктуры."
• Сопровождение инфраструктуры для инференса LLM‑моделей, AI‑сервисов, Mcp сервисов, агентов.
• Работа с GPU‑инфраструктурой и управление on‑prem GPU‑серверами:
• Настройка драйверов ОС, мониторинг, оптимизация использования ресурсов."
Обязательные требования
• Уверенное администрирование Linux
• Программирование на Python (автоматизация, скрипты, интеграции)
• Опыт настройки и поддержки пайплайнов в GitLab CI/CD
• Владение Ansible для управления конфигурациями и автоматизации развёртывания
• Практический опыт работы с Kubernetes (развёртывание, масштабирование, troubleshooting)
• Управление пакетами приложений через Helm
• Понимание принципов service mesh и опыт работы с Istio
• Настройка и поддержка HAProxy (балансировка, проксирование)
• Работа с Nexus (хранение и управление артефактами)
• Работа с Harbor (реестр контейнерных образов)
• Опыт работы с Kafka (настройка, поддержка, мониторинг)
• Управление секретами через Vault
• Настройка аутентификации и авторизации через Keycloak
• Построение дашбордов и алертинга в Grafana
• Желательно: связка Grafana + Prometheus для сбора и визуализации метрик
• Опыт работы с CUDA (GPU-ускорение)
• Знакомство с vLLM и LiteLLM (развёртывание и обслуживание LLM)
• Работа с MLflow (трекинг экспериментов, управление моделями)
• Автоматизация процессов через n8n
• Понимание принципов планирования GPU-ресурсов
• Знакомство с DRA, MPS, time-slicing для эффективного использования GPU
Будет плюсом
• Опыт построения отказоустойчивых кластеров Kubernetes в production
• Знание Terraform или других IaC-инструментов
• Понимание принципов SRE (SLI/SLO/SLA, error budget)
• Опыт работы с облачными провайдерами (Yandex Cloud, AWS, GCP)
• Навыки написания Helm-чартов и операторов Kubernetes