DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB
Привет! Меня зовут Эля, я HR компании «Амбрелла».
Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.
Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB.
Основной фокус роли— промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.
Вторая важная зона —MariaDB: эксплуатация, репликация, отказоустойчивость, Galera Cluster, backup/restore, disaster recovery, performance tuning и миграция с master-master-репликации на более надёжную кластерную архитектуру.
Нам нужен инженер, который умеет не просто «поднять базу», а безопасно эксплуатировать production-инфраструктуру с критически важными данными: проверять гипотезы на стендах, оценивать риски, готовить rollback-план, участвовать в расследовании инцидентов и фиксировать результаты в документации.
Чем предстоит заниматься:ClickHouse:
- Администрировать продуктивные и тестовые кластеры ClickHouse;
- Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц;
- Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой;
- Анализировать системные таблицы ClickHouse и состояние кластера;
- Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц;
- Планировать горизонтальное масштабирование ClickHouse-кластера;
- Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера;
- Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище;
- Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям;
- Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;
- Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия;
- Разрабатывать и проверять backup/restore и disaster recovery;
- Настраивать мониторинг, алерты и дашборды по ClickHouse;
- Готовить Ansible playbooks / roles, runbook’и, инструкции, чек-листы и технические отчёты.
MariaDB:
- Администрировать продуктивные и тестовые инсталляции MariaDB;
- контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов;
- Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication;
- Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах;
- Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster;
- Настраивать, сопровождать и диагностировать Galera Cluster;
- Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски;
- Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий;
- Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO;
- Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети;
- Настраивать TLS/SSL для клиентских подключений и репликации;
- Настраивать мониторинг, алерты, дашборды и runbook’и по MariaDB.
Production, автоматизация и взаимодействие:
- Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой;
- Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации;
- Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов;
- Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах;
- Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений;
- Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production;
- Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты;
- Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения.
Обязательные требования:
- Практический опыт промышленной эксплуатации ClickHouse;
- Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family;
- Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;
- Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes;
- Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;
- Опыт настройки TLS/SSL для ClickHouse;
- Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде;
- Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels;
- Опыт настройки и диагностики репликации MariaDB;
- Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации;
- Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий;
—Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO;
- Опыт эксплуатации Linux-серверов;
- Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB;
- Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры;
- Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;
- Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты;
- Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата;
- Умение писать техническую документацию: инструкции, runbook’и, чек-листы, postmortem-отчёты.
Желательные требования:
- Опыт или уверенное понимание Galera Cluster;
- Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем;
- Опыт работы с большими объёмами данных: десятки или сотни ТБ;
- Опыт работы с ClickHouse Keeper или ZooKeeper;
- Опыт эксплуатации ClickHouse / MariaDB на bare metal;
- Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;
- Опыт нагрузочного тестирования ClickHouse и MariaDB;
- Опыт построения процедур disaster recovery;
- Опыт подготовки архитектурных и эксплуатационных документов для заказчиков;
- Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями;
- Опыт проведения регламентных работ с минимальным downtime;
- Опыт аудита продуктивных инсталляций у заказчиков.
Что важно в кандидате:
- Инженерная аккуратность и понимание рисков production-среды;
- Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production;
- Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы;
- Клиентоориентированность и зрелая коммуникация;
- Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках;
- Способность лидировать технические встречи, фиксировать решения и следующие шаги;
- Готовность документировать решения и передавать знания команде.
Условия:
- Постоянная занятость;
- Работа с продуктивной, тестовой и лабораторной инфраструктурой;
- Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;
- Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных.
Всегда рады новым талантам и новым успехам наших сотрудников!