Как преврать хаос в систему и вернули инженерам часы продуктивной работы.
В крупной ИТ-инфраструктуре каждый запрос на создание дашборда превращался в мини-проект. Заказчики (владельцы информационных систем) хотели видеть единую панель с ключевыми метриками своего продукта: от инфраструктуры (CPU, RAM, Disk) до специфических показателей приложения (RPS, latency, коды ответов, глубина очередей).
Решающим фактором стали аварийные конференции. Когда система падала, время шло на минуты, а инженеры тратили его на переключение между вкладками и попытки сопоставить разрозненные графики. Необходимо было в моменте увидеть картину целиком: например, latency на сервере в тот момент, когда RPS на приложении просел, а пользователи начали получать 500-е ошибки. В существующей системе это было сделать крайне сложно.
Был разработан инструмент, который позволяет любому пользователю создать кастомизированный, стандартизированный дашборд в Grafana буквально за несколько кликов, без участия инженера и без необходимости знать внутреннее устройство системы мониторинга.
Ввод имен серверов или загрузка списка. Мгновенная проверка наличия в мониторинге и определение шаблонов (Linux, Nginx, Postgres...).
Выбор хостов, динамический фильтр метрик на основе обнаруженных шаблонов (ОС, Nginx, СУБД, Kafka...).
Пользователь нажимает «Создать». Система собирает дашборд из пресетов в Grafana.
Уведомление об успехе, прямая ссылка и кнопка «Открыть» в новой вкладке.
Вдохновляясь принципами книги «The Wall Street Journal Guide to Information Graphics», мы ввели жесткий стандарт оформления:
Пользователи не имеют прямого доступа к редактированию источников данных. Работа только через безопасный портал с заранее проверенными запросами.
Новые технологии и продукты автоматически получают стандартизированные дашборды при появлении в мониторинге.
Команда нагрузочного тестирования: указывают сервера пре-прода и прода, выбирают метрики (ОС, приложение, БД), создают единый дашборд и сравнивают поведение систем бок о бок за минуту.