Публикатор: Vadim - Vadim

DevOps Engineer

@devops_jobs_feed 15.08.2026 23:07 Рекрутер: @DevOps_savage

Публикатор: Vadim Обсуждение: @devops_jobs #резюме #devops #sre #platformengineer #kubernetes #remote #fulltime #gitops #iac DevOps / SRE / Platform Engineer Опыт работы: 4 года 7 месяцев Локация: Москва, Россия Формат: Удаленно Занятость: Full-time Контакт: @DevOps_savage Ключевой стек: - Orchestration & Mesh: Kubernetes, Helm, Argo CD, Istio, Docker - IaC & Automation: Terraform, Ansible, Python, Bash - CI/CD & DevSecOps: GitLab CI/CD, Jenkins, HashiCorp Vault, Trivy, SonarQube - Observability & Logging: Prometheus, Grafana, Jaeger, Alertmanager, ELK/EFK Stack - DB, Caching & Brokers: PostgreSQL (Patroni, pgBackRest), Redis, Apache Kafka, RabbitMQ - Cloud & Infrastructure: AWS, Yandex Cloud, Nginx, HAProxy, Linux (Ubuntu, CentOS) Главные кейсы и достижения: Миграция, K8s и IaC (Платформа): - Спроектировал и реализовал zero-downtime миграцию 50+ микросервисов из изолированных ВМ в Managed Kubernetes через Terraform (3 кластера, 300+ нод). - Разработал библиотеку переиспользуемых Terraform-модулей (VPC, IAM, EKS, DB), сократив время развертывания новых окружений с 2 дней до 30 минут. - Провел FinOps-оптимизацию ресурсов (right-sizing, spot-инстансы, HPA/VPA): снизил утилизацию CPU в простое на 40% при росте общего трафика системы на 50%. CI/CD, GitOps и DevSecOps: - Внедрил платформу автоматизированного деплоя на базе K8s, Helm и Argo CD, сократив Time-to-Market с 4 дней до 3 часов, а время релиза в GitLab CI — с 35 до 8 минут (failed deployments снизились на 45%). - Развернул HashiCorp Vault для 150+ сервисов, полностью ликвидировав хардкод-секретов в Git и автоматизировав их ротацию. - Встроил Trivy и SonarQube в CI/CD пайплайны и перевел 30+ сервисов на multi-stage builds, уменьшив размер Docker-образов на 55%. Observability, Service Mesh и Надежность (SRE): - Настроил Istio Service Mesh для 40+ микросервисов (канареечные релизы с автоматическим откатом при error rate > 1%). - Построил единый контур мониторинга по принципам SLO/SLA (Prometheus, Grafana, Jaeger): снизил MTTR с 35 до 10 минут, сократил ложные алерты на 60% и поднял SLA до 99.98%. - Внедрил централизованный сбор логов (>10 млн записей в сутки), сократив время локализации сложных аномалий с 25 до 5 минут. Базы данных и Высокая нагрузка: - Настроил катастрофоустойчивый кластер PostgreSQL (Patroni, pgBackRest) с авто-бэкапами в S3 (RTO < 5 минут, RPO < 30 секунд). - Оптимизировал Redis-кластер под нагрузкой >20K RPS, снизив p99 latency ответов БД на 30%. - Автоматизировал управление Kafka-кластером (8 брокеров) и массовую конфигурацию 150+ Linux-серверов через Ansible playbooks (время обновления сократилось с 2 дней до 3 часов).

Похожие вакансии

После первого сообщения

Не теряйте контекст по этой вакансии: сначала отправьте короткий отклик, затем через 3–5 дней сделайте follow-up, если ответа не было.