Перейти к содержанию

Автоматизация поиска первопричины инцидентов через корреляцию сигналов

7.0/10

Контекст

В Atlassian работают сотни взаимосвязанных микросервисов, и при инциденте объём телеметрии огромен. Поиск первопричины вручную — через дашборды метрик, логи и трейсы — требует от дежурного инженера глубоких знаний и времени, а каждая минута простоя важна.

Суть

Авторы предлагают рассматривать RCA как корреляцию по трём измерениям: типу сигнала, времени и топологии сервисов. Система модульная: отдельные детекторы для метрик (RED, статистические методы), трейсов и логов (кластеризация) порождают нормализованные события. Движок корреляции группирует совпадающие по времени аномалии скользящим окном, вычисляет оценку временной связности и дедуплицирует повторяющиеся последовательности через fingerprinting. Затем по графу зависимостей, построенному из OpenTelemetry-трейсов, определяется направление распространения: аномалия, возникшая раньше у вышестоящего сервиса, считается вероятным источником. Итог — ранжированные гипотезы с путём распространения, уликами и человекочитаемым объяснением. Авторы подчёркивают trade-offs: начинать с простых статистических методов, модульность окупается, дедупликация обязательна, граф — сильный prior, а объяснимость строит доверие; при этом статья описывает архитектуру и уроки, но не приводит измеренных результатов.

Вывод

Главный вывод авторов: автоматизированный RCA — это корреляционная задача, решаемая нормализованными событиями, временным выравниванием и графовым выводом. Модульность и объяснимость с самого начала важнее сложных моделей.