РазработкаВнедрение у заказчика
ИИ-мониторинг логов: повторяющиеся ошибки видно раньше, чем они станут инцидентом
Агент читает логи всего флота, сводит одинаковые ошибки в сигнатуры и раз в три часа приносит сводку.
раз в 3 часасводка по всему флоту
новые и старыеошибки разделяются автоматически
оба контуранаш флот и изолированная инсталляция клиента
Контекст
Где и с чего началось
Заказчик
Наш собственный контур и изолированный кластер корпоративного заказчика.
С чего начали
Метричные алерты ловят падения, но не ловят тихую деградацию: ошибка повторяется сотни раз в сутки и никого не будит, пока не сложится в инцидент.
Решение
Что мешало и что сделали
Было
- Логи читают только когда уже что-то упало
- Одна и та же ошибка выглядит по-разному из-за идентификаторов в тексте
- Непонятно, что новое, а что висит неделями
Стало
- Ошибки нормализуются в сигнатуры и группируются, чтобы не считать одно и то же по сто раз
- Сводка делит найденное на новое, непрерывное и уже виденное
- Отчёт уходит в рабочий канал вместе с документом на разбор
- Один и тот же прогон делается по обоим контурам
Внедрение
Как внедряли
- Подключение к хранилищу логов
- Настройка нормализации и порогов повторяемости
- Регулярный запуск и доставка сводки в канал
Результат
Что изменилось
Результат
- Повторяющиеся ошибки видны сводкой, а не после инцидента
- Разбор начинается с того, что реально повторяется чаще всего
Что это даёт бизнесу
- Деградации ловятся до того, как их заметит клиент
- Дежурный видит картину по всему флоту за минуту
Под капотом
Из чего собрано
Хранилище логовНормализация сигнатурРегулярные сводки
Разработка
Ещё кейсы этого отдела
Хотите так же?
Расскажите про свой процесс — разберём его на встрече и покажем, как это собирается на платформе.