Agentek
РазработкаВнедрение у заказчика

ИИ-мониторинг логов: повторяющиеся ошибки видно раньше, чем они станут инцидентом

Агент читает логи всего флота, сводит одинаковые ошибки в сигнатуры и раз в три часа приносит сводку.

раз в 3 часасводка по всему флоту
новые и старыеошибки разделяются автоматически
оба контуранаш флот и изолированная инсталляция клиента
Контекст

Где и с чего началось

Заказчик

Наш собственный контур и изолированный кластер корпоративного заказчика.

С чего начали

Метричные алерты ловят падения, но не ловят тихую деградацию: ошибка повторяется сотни раз в сутки и никого не будит, пока не сложится в инцидент.

Решение

Что мешало и что сделали

Было

  • Логи читают только когда уже что-то упало
  • Одна и та же ошибка выглядит по-разному из-за идентификаторов в тексте
  • Непонятно, что новое, а что висит неделями

Стало

  • Ошибки нормализуются в сигнатуры и группируются, чтобы не считать одно и то же по сто раз
  • Сводка делит найденное на новое, непрерывное и уже виденное
  • Отчёт уходит в рабочий канал вместе с документом на разбор
  • Один и тот же прогон делается по обоим контурам
Внедрение

Как внедряли

  1. Подключение к хранилищу логов
  2. Настройка нормализации и порогов повторяемости
  3. Регулярный запуск и доставка сводки в канал
Результат

Что изменилось

Результат

  • Повторяющиеся ошибки видны сводкой, а не после инцидента
  • Разбор начинается с того, что реально повторяется чаще всего

Что это даёт бизнесу

  • Деградации ловятся до того, как их заметит клиент
  • Дежурный видит картину по всему флоту за минуту
Под капотом

Из чего собрано

Хранилище логовНормализация сигнатурРегулярные сводки
Разработка

Ещё кейсы этого отдела

Хотите так же?

Расскажите про свой процесс — разберём его на встрече и покажем, как это собирается на платформе.