Мониторинг Linux‑серверов и контейнеров (Prometheus + Grafana)
Внедрили мониторинг Linux и Docker: метрики, дашборды и алерты по дискам, памяти и доступности сервисов. Перестали узнавать о проблемах от пользователей.
Ситуация
Инфраструктура росла, но мониторинга не было: о заполнении диска и падениях сервисов узнавали постфактум.
Что сделали
- Собрали карту сервисов и критичность (что “болит” бизнесу)
- Настроили сбор метрик Linux (CPU/RAM/диски/FS) и контейнеров
- Сделали дашборды Grafana для техкоманды и руководства
- Настроили алерты: место/IO, ошибки бэкапа, падение сервисов, истечение сертификатов
- Описали правила: уровни важности, окна обслуживания, “тишина” на плановых работах
Результат
Проблемы стали выявляться до того, как их заметят пользователи. Снизили простои и получили прозрачность по инфраструктуре.