ICAM (Incident Cause Analysis Method) ICAM (Incident Cause Analysis… — Системный Аналитик — TG.ME

❓ ICAM (Incident Cause Analysis Method)

ICAM (Incident Cause Analysis Method) — метод разбора инцидентов
💚 ищет системные причины, а не останавливается на ошибке конкретного человека
💚 по итогам разбора формулируют меры, чтобы инцидент не повторился

💚 Ключевой вопрос метода — не «кто виноват?», а «почему система это допустила?»
💚 Подходит для ИТ-инцидентов: сбоев систем, киберинцидентов, отказов бизнес-процессов


Зачем нужен

❣ выводит разбор за пределы «человеческой ошибки»: наказание исполнителя не предотвращает следующий инцидент, а изменение системы — предотвращает
❣ выявляет скрытые системные проблемы, существовавшие задолго до инцидента
❣ даёт корректирующие действия, которые меняют барьеры защиты и организационные условия, а не симптомы
❣ создаёт общий язык для подразделений: категории факторов понятны всем


Когда применять

✨серьёзные инциденты: существенный ущерб, повреждения, риск для людей или бизнеса
✨повторяющиеся инциденты, когда предыдущие разборы «на глаз» не помогли
✨ситуации, где простой анализ вывел на системную проблему, которую надо разбирать глубже
✨сложные инциденты с участием нескольких подразделений


Как работает

🧀 В основе метода — модель «швейцарского сыра»:
Защита системы состоит из нескольких слоёв-барьеров, и в каждом есть слабые места — «отверстия»
Инцидент происходит, когда отверстия выстраиваются в одну линию и угроза проходит насквозь.

Отсюда два типа причин:

💠 Активные отказы: действия и ошибки, которые привели к событию
💠 Латентные условия: скрытые системные проблемы организации, которые существовали до инцидента

Причины разбираются по факторам:

➡ отсутствующие или несработавшие барьеры: контроли, которые должны были предотвратить или смягчить инцидент, но не справились
➡ действия людей и команд: что сделали или не сделали вовлечённые люди — включая ошибки и нарушения
➡ условия задачи и рабочей среды: состояние оборудования, нехватка времени, нагрузка, факторы среды, сбои коммуникации
➡ организационные факторы: управленческие решения, распределение ресурсов

Иногда выделяют пятую группу — человеческие факторы: усталость, стресс, ситуационную осведомлённость.


Как работает по шагам:

1⃣ Немедленное реагирование: локализовать инцидент, защитить людей и окружающую среду

2⃣ Сбор доказательств: физические, документальные и свидетельские — документы, логи, интервью. Доказательства быстро теряют качество, поэтому сбор начинается в течение часов; сам анализ — после стабилизации сервиса

3⃣ Хронология: восстановить последовательность событий и условий, в которых они происходили

4⃣ Анализ барьеров: какие контроли должны были предотвратить инцидент, где они отказали или отсутствовали

5⃣ Анализ действий и условий: что делали вовлечённые люди и в каких условиях — задачи, рабочая среда — они работали

6⃣ Анализ организационных факторов: какие решения, политика и культура допустили такие условия

7⃣ Рекомендации и отчёт: сформулировать корректирующие действия по принципу SMART — конкретные, измеримые, достижимые, релевантные, ограниченные по времени — и внести их в отчёт расследования

Команда расследования должна быть независимой


Пример

Ситуация: в финансовой компании произошёл сбой платформы — выставление счетов задержалось на две недели, компания понесла потери

Разбор по ICAM выявит:

💚 несработавший барьер: плановое обслуживание платформы было назначено внахлёст с критическими бизнес-операциями
💚 действия людей: инженеры неверно интерпретировали инструкции по перезагрузке системы
💚 латентные условия: реестр рисков устарел и не отражал ИТ-зависимости бизнес-процессов
💚 организационные факторы: ИТ-отдел работал изолированно, интеграция с бизнес-операциями была слабой

Итог: перестроили планирование между отделами, усилили управление подрядчиками, руководителям внедрили дашборд, который в реальном времени показывает состояние ИТ-систем.

💚 Все выводы — про изменение системы, а не про поиск виноватых.


📎 Материалы

1. Метод ICAM (Incident Cause Analysis Method)
2. Контрольный список шаблона метода анализа причин инцидента (ICAM)
3. Модель швейцарского сыра
4. Постмортем без наказаний: культура разбора ошибок, которая реально улучшает качество проектов
5. Инцидент-менеджмент с нуля: практический гайд для растущих команд

📚 Книги

1. Безопасные и надежные системы. Лучшие практики проектирования, внедрения и обслуживания как в Google — Хизер Адкинс, Бетси Бейер и др.

#инфраструктура

➿➿➿➿➿➿➿➿➿➿

🧑‍🎓 Более поробное сравнение в базе знаний по системному анализу
🔥7❤4👍1👏1
August 28, 2026 1.6K 41