Senior DevOps Engineer
Зарплата не указана
Плати по всему миру · Москва
Поддержка инфраструктуры: администрирование Linux-серверов, диагностика и обеспечение стабильной работы. CI/CD: разработка и поддержка пайплайнов в GitLab CI, оптимизация...
Амбрелла · Москва
Основной фокус роли — промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное...
Зарплату работодатель не назвал — вилку обсуждают на собеседовании.
DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB
Привет! Меня зовут Эля, я HR компании «Амбрелла».
Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.
Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB.
Основной фокус роли — промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.
Вторая важная зона — MariaDB: эксплуатация, репликация, отказоустойчивость, Galera Cluster, backup/restore, disaster recovery, performance tuning и миграция с master-master-репликации на более надёжную кластерную архитектуру.
Нам нужен инженер, который умеет не просто «поднять базу», а безопасно эксплуатировать production-инфраструктуру с критически важными данными: проверять гипотезы на стендах, оценивать риски, готовить rollback-план, участвовать в расследовании инцидентов и фиксировать результаты в документации.
Чем предстоит заниматься: ClickHouse:
— Администрировать продуктивные и тестовые кластеры ClickHouse;
— Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц;
— Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой;
— Анализировать системные таблицы ClickHouse и состояние кластера;
— Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц;
— Планировать горизонтальное масштабирование ClickHouse-кластера;
— Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера;
— Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище;
— Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям;
— Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;
— Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия;
— Разрабатывать и проверять backup/restore и disaster recovery;
— Настраивать мониторинг, алерты и дашборды по ClickHouse;
— Готовить Ansible playbooks / roles, runbook’и, инструкции, чек-листы и технические отчёты.
MariaDB:
— Администрировать продуктивные и тестовые инсталляции MariaDB;
— контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов;
— Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication;
— Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах;
— Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster;
— Настраивать, сопровождать и диагностировать Galera Cluster;
— Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски;
— Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий;
— Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO;
— Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети;
— Настраивать TLS/SSL для клиентских подключений и репликации;
— Настраивать мониторинг, алерты, дашборды и runbook’и по MariaDB.
Production, автоматизация и взаимодействие:
— Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой;
— Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации;
— Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов;
— Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах;
— Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений;
— Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production;
— Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты;
— Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения.
Обязательные требования:
— Практический опыт промышленной эксплуатации ClickHouse;
— Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family;
— Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;
— Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes;
— Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;
— Опыт настройки TLS/SSL для ClickHouse;
— Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде;
— Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels;
— Опыт настройки и диагностики репликации MariaDB;
— Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации;
— Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий;
—Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO;
— Опыт эксплуатации Linux-серверов;
— Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB;
— Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры;
— Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;
— Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты;
— Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата;
— Умение писать техническую документацию: инструкции, runbook’и, чек-листы, postmortem-отчёты.
Желательные требования:
— Опыт или уверенное понимание Galera Cluster;
— Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем;
— Опыт работы с большими объёмами данных: десятки или сотни ТБ;
— Опыт работы с ClickHouse Keeper или ZooKeeper;
— Опыт эксплуатации ClickHouse / MariaDB на bare metal;
— Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;
— Опыт нагрузочного тестирования ClickHouse и MariaDB;
— Опыт построения процедур disaster recovery;
— Опыт подготовки архитектурных и эксплуатационных документов для заказчиков;
— Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями;
— Опыт проведения регламентных работ с минимальным downtime;
— Опыт аудита продуктивных инсталляций у заказчиков.
Что важно в кандидате:
— Инженерная аккуратность и понимание рисков production-среды;
— Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production;
— Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы;
— Клиентоориентированность и зрелая коммуникация;
— Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках;
— Способность лидировать технические встречи, фиксировать решения и следующие шаги;
— Готовность документировать решения и передавать знания команде.
Условия:
— Постоянная занятость;
— Работа с продуктивной, тестовой и лабораторной инфраструктурой;
— Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;
— Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных.
Всегда рады новым талантам и новым успехам наших сотрудников!
Вакансия опубликована 3 октября, проверена 05.10.2026. Открыть оригинал.
Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую. Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова. Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье как быстро найти работу.
Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «DevOps-инженер» платят 174 000 ₽.
В требованиях указано: более 6 лет. Формат работы удалённый, переезд не потребуется.
Да, на 05.10.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.
ООО Амбрелла - молодая инновационная компания в сфере информационной безопасности. Мы занимаемся разработкой, созданием и внедрением высокотехнологичных IT-систем, позволяющих обеспечить защиту информационных активов, как от внешних, так и от внутренних угроз. Основные направления деятельности Компании - разработка специализированного программного обеспечения; предоставление консалтинговых услуг …
Открытых вакансий: 5Соседи по направлению с близкими требованиями.
Зарплата не указана
Плати по всему миру · Москва
Поддержка инфраструктуры: администрирование Linux-серверов, диагностика и обеспечение стабильной работы. CI/CD: разработка и поддержка пайплайнов в GitLab CI, оптимизация...
до 340 000 ₽
Отм Ворлд Вайд · Москва
Автоматизация процессов (CI/CD): Настройка и поддержка конвейеров непрерывной интеграции и доставки кода (Continuous Integration / Continuous Delivery). Управление инфраструктурой (IaC...
Зарплата не указана
Фалькон Тех · Москва
Технологическое развитие инфраструктуры highload-проекта. Обеспечение стабильной и бесперебойной работы систем. Выявление проблем с производительностью, устранение и предотвращение причин возникновения...
Зарплата не указана
Платформа ОФД · Москва
Организация работы отдела из 3-х сотрудников, координация работы со смежными специалистами. Поддержка и развитие инфраструктуры разработки, систем мониторинга и...
Зарплата не указана
Группа IT-компаний Lad · Нижний Новгород
Анализировать логи и метрики заказчиков: системные логи, логи сервисов, дашборды Grafana, метрики Prometheus. Обновлять компоненты по инструкциям от команды разработки...
Пригодится до собеседования: сколько останется на руки от названной суммы, как считаются отпускные и переработки.
CI/CD, контейнеры, облака и мониторинг: доставка кода и стабильность сервисов.