Глава 2
Модели катастроф
Почему происходят аварии
Модели катастроф
Чтобы разобраться в том, что же такое человеческий фактор, нужно изучить модели катастроф. Как и почему происходят аварии. 

Один из подходов к авариям предполагает, что это деяние божественных сил. Но такой подход нам ничего не даёт, так как с этим ничего нельзя сделать.

Мы рассмотрим 4 модели:
1. цепочка событий
2. барьерная модель
3. системная модель
4. модель дрейфа или сдвига
2.1 Цепочка событий
Первой моделью аварий является цепочка событий. Это простая линейная модель событий, её ещё можно назвать эффектом домино. 

Цепочку событий предложил Герберт Уильям Хейнрих (в некоторых написаниях Генрих). Он был дипломированным инженером, более 20 лет вёл в Нью-Йоркском университете лекции по безопасности труда; был членом Американского общества инженеров по технике безопасности (American Society of Safety Engineers). Его считают основоположником научного подхода к охране труда. Хейнрих проанализировал 75 000 страховых случаев, во время работы в страховой компании Travelers Insurance Company. Результаты он изложил в книге «Предупреждение производственных травм: научный подход» (Industrial Accident Prevention, A Scientific Approach, 1931). 

Хейнрих описал цепочку событий как линейную цепочку ошибок, неправильных действий и опасных условий приводящих к несчастному случаю:

«возникновение травмы неизменно является результатом завершённой последовательности факторов, последним из которых является сам несчастный случай. Несчастный случай, в свою очередь, неизменно вызывается или допускается небезопасным действием человека и/или механической, или физической опасностью».

Хейнрих вывел распределение причин несчастных случаев как 88-10-2. 88% причин аварий составляют небезопасные действия работников, 10% - небезопасные механические или физические условия и 2% не поддаются предотвращению. 

По данным Хейнриха основной причиной (88%) несчастных случаев на рабочем месте являются небезопасные действия работника — как правило, самого пострадавшего. Это удобно для работодателей. И это тезис позволил работодателям и консультантам утверждать: во всём виноват работник, т. е. «человеческий фактор». На роль организаций Хейнрих отвёл всего лишь 10% аварий — как создание неблагоприятных условий. 

Цепочка событий простая и, поэтому привлекательная модель: 
  • есть чёткая линейная последовательность, которая привела к негативному результату. Событие А привело к событию Б, что привело к событию В — и так далее, вплоть до аварии
  • легко работать с предотвращением аварии — нужно лишь разорвать эту цепочку, и тогда негативного события не случится

А так как самым слабым звеном всех систем являются люди — то значит, можно и нужно с ним работать. Возложить ещё большую ответственность, провести дополнительное обучение, ввести новые профессиональные стандарты. Или вообще заменить человека роботами или автоматизацией.
Цепочка событий из оригинальной книги Хейнриха
Цепочка событий в сложных случаях
В ряде ситуаций цепочка событий хорошо описывает реальность.

Водитель не заметил знак поворота → Не снизил скорость → Вылетел с дороги.

Простая последовательность, в которой видны последствия и причины. Нужно быть внимательней, или ехать на меньше скорости, тогда бы аварии не было.

В более сложных происшествиях цепочка событий работает уже не так хорошо. Возникают вопросы:
  • Что является началом цепочки? Кто может решить и на каком основании?
  • Какие события включать, какие исключить из цепочки? На основании чего? 
  • Что, если события происходили одновременно? Линейная цепочка не позволяет учесть это. 
  • Насколько удаление одного звена может устранить потенциальную опасность? В сложных системах события не всегда идут линейно. 
  • Как учитывать системные факторы?
Пирамида Хейнриха
Пирамида
Повадился кувшин по воду ходить, тут ему и разбитым быть.

Кроме цепочки событий, Хейнрих предложил ещё одну модель: пирамиду происшествий, или треугольник Хейнриха. 
На каждый несчастный случай на рабочем месте, повлёкший тяжёлые последствия, приходится 29 случаев получения лёгких травм и 300 потенциально опасных происшествий без последствий.

Логика пирамиды простая, и опирается на два принципа: 
1. Закон больших чисел. Если всё время переходить дорогу в неположенном месте, то, скорее всего, всё закончится ДТП. 
2. Принцип подобия. Если сотрудник нарушает правила при переходе улицы, то, скорее всего, он будет нарушать правила и в других случаях. 

Пирамида предлагает простой вывод: чтобы снизить количество тяжёлых несчастных случаев — нам надо снижать базу пирамиды, количество небезопасных действий. Нужно, чтобы все соблюдали дисциплину во всём, в любых мелочах, и тогда тяжелых происшествий не будет. 

Пирамида оказалась привлекательной моделью. В 1969 Франк Берд младший предложил свою версию пирамиды, в которой на 1 тяжёлую травму приходилось 600 небезопасных действий. В 2003 году нефтегазовая компания ConocoPhillips Marine предложила третью версию пирамиды. В ней на 1 тяжёлую травму приходится 30 тысяч небезопасных действий. 
Одно из обоснований роста количества нарушений в основании пирамиды — это более совершенные системы учёта несчастных случаев и опасных происшествий. 

Но простота пирамиды не гарантирует её правильностью. Пирамида подразумевает общие причины у небезопасных действий и тяжёлых несчастных случаях. Однако это не так. Можно переходить маленькую улицу в центре города можно и в неположенном месте, это будет абсолютно безопасно. Переход же восьмиполосного шоссе вне перехода, скорее всего, закончится ДТП. Является ли переход маленькой улицы надёжным индикатором того, что человек будет переходить шоссе в неположенном месте? Дальнейшие исследования также показали несостоятельность пирамиды. 

За день до аварии на Deepwater Horizon праздновали шесть лет безаварийной работы. Согласно пирамиде — это должно гарантировать отсутствие серьёзных аварий на несколько лет вперёд. На следующий день погибло 11 человек и случился самый большой разлив нефти в истории. 

Так что следование пирамиде и контроль небезопасных действий отвлекает наши ресурсы от действительных причин аварий и несчастных случаев. 

2.2 Барьерная модель
Цепочка событий появилась в 1930х годах. С тех пор системы усложнялись: вводились дублирующие системы, защитные и предохранительные механизмы. Одной ошибки уже недостаточно — нужен был целый комплекс причин, чтобы преодолеть все защитные механизмы. 

После масштабных аварий в 70-х и 80-х появилась барьерная модель катастроф. Это усложненная модель цепочки событий с несколькими независимыми цепочками. Каждая цепочка идет линейно, пока они все не соберутся в единой точке и преодолеют все барьеры.  То есть у аварии есть множество причин, не всегда связанных между собой причинно-следственной связью.

В 1990 году Джеймс Ризон объяснил эту модель через метафору кусков швейцарского сыра: если дырки не выстраиваются в линию, аварии не происходит. Сейчас эта модель больше известна как модель Ризона или модель швейцарского сыра.
Модель швейцарского сыра
Бхопал
В 1970х годах компания Union Carbide построила в городе Бхопал (столица штата Мадхья-Прадеш, Индия) завод про производству пестицидов. В ночь на 3 декабря 1984 года произошла утечка 42 тонн метилизоцианата (MIC) из резервуара для хранения. Облако паров MIC покрыло территорию площадью около 40 км², распространившись на близлежащие трущобы и железнодорожный вокзал. В результате погибло 18 тыс. человек.

Это один из примеров аварии, которые можно объяснить барьерной моделью, когда не сработало множество защитных механизмов. 

Контрольно-измерительная аппаратура в диспетчерской не была адекватной: ее конструкция не учитывала экстремальные условия: показания приборов были зафиксированы на значениях, значительно меньших, чем те, которые фактически происходили внутри резервуара с MIC. Защитные меры, которые могли бы остановить или смягчить дальнейшее развитие событий, либо отсутствовали, либо оказались недостаточными. 

Ни один из операторов завода не проходил обучение действиям в чрезвычайных ситуациях. Система охлаждения резервуара была отключена и теперь была лишена жидкого хладагента; скруббер для отвода отходящих газов был спроектирован для нейтрализации утечек MIC в количествах в 200 раз меньших и при более низких температурах, чем те, которые фактически утекали.

Факельная башня (которая сжигала бы выходящий газ) была отсоединена от резервуаров с MIC, потому что ремонтники демонтировали проржавевшую трубу и так и не установили её на место. В конце концов, водяная завеса, призванная сдержать газовое облако, достигала лишь 12 метров в высоту, в то время как MIC вырывался из отверстия на высоте более 30 метров.
Плюсы и минусы барьерной модели
В барьерной модели выделяют два уровня событий:
  • активные ошибки, небезопасные действия оператора; 
  • латентные ошибки или условия внутри организации, которые существуют в течении длительного периода времени, но становятся активными при определенных условиях. 

Барьерная модель хорошо объясняет несколько последних минут или часов, предшествующих катастрофе. Но достаточно плохо справляется с описанием системных, социально-экономических факторов, предшествующих катастрофе. 

Большой плюс модели — наконец-таки начали задумываться о системных, скрытых ошибках в системе. Ошибка оператора это следствие системных ошибок. 

Но эта модель не очень помогает в предотвращении катастроф. Исходя из модели более безопасная система: это либо система с большим количеством барьеров либо с более надежными барьерами.

Когда мы увеличиваем количество барьеров — мы еще больше усложняем систему, тем самым делаем ее еще более хрупкой, подверженной сбоям. Я часто встречаю этот подход в том, что нам нужно внедрить еще больше контролей, чтобы изменить процесс. Ничего хорошего из этого не получается. 

Повышать надежность каждого уровня — значит отлаживать и настраивать систему, делать ее более устойчивой. Но тогда нужно разбираться в системных, скрытых причинах, которые привели к ошибке, а тут модель работает не очень хорошо. ;) 
Добавление барьеров
Самое опасное что можно сделать исходя из барьерной модели — это добавлять барьеры. К сожалению, это стандартная реакция на любую ошибку: нам надо больше контролей. Но добавление барьеров усложняет системы, а более сложные системы больше подвержены авариям. Кроме это, расширяет модель рисков — добавляются риски, что новый барьер не сработает. 

Одна из чуть-чуть не случившихся аварий на атомной станции в реакторе «Ферми» произошла из-за того, что часть предохранительного устройства, установленного по настоянию комиссии по безопасности, заблокировала поток теплоносителя. Из более жизненных примеров можно вспомнить безумные листы согласования договоров по 20-30 подписей. Каждое дополнительное согласование — это еще один барьер. 

Как-то в одной больнице ввели двойную проверку введения лекарств, чтобы избежать попадания неправильных лекарств или неправильных доз в организм пациентов. Две медсестры должны проверять расчеты перед введением препарата. Но оказалось, проблем с лекарства стало больше. 
Причина в том, что дополнительный барьер или контроль не был независим от первого. Медсестры знают друг друга, знают работу друг друга. Более того, если они в находятся в дружеских отношениях, то они не смогут противоречить коллеге. Так что этот контроль только ухудшил ситуацию.

Добавление барьеров, т.е. усложнение систем не всегда приводит их к более надежной работе. Что приводит нас к следующей модели: системным авариям. 


2.3 Системная модель катастроф
Любая развитая технология неотличима от магии. 
3й закон Кларка. 

Мы уже начали создавать такие системы, которые мы сами не понимаем как они работают. 
Реальность. 

С развитием сложности и размеров систем появилась системная модель. Системная модель катастроф исходит из того, что аварии — это свойство системы, независимо от действий человека.

Чем больше и сложнее система, тем сложнее понять, что в ней происходит. Механизмы контроля и управления могут не показывать все, что происходит с системой, или они сами могут сбоить. Появилась поговорка, приписываемая конструкторам МиГ-29, что самая безопасная часть в системе — эта та, от которой удалось избавиться. 

Астронавт Майкл Коллинз в своих мемуарах рассказывал об опасениях перед полетом. Фрэнк Борман, командир «Аполлона-8», обратил его внимание на следующее:
Космический корабль состоит из примерно 5,6 миллиона движущихся частей. Если допустить, что каждая деталь будет функционировать на 99,9% (что, скажем прямо, тоже маловероятно), то с вероятностью 0,1% что-нибудь пойдет не так. Это означает, что примерно 5600 проблем затаились и ждут, чтобы устроить сюрприз.

Другими словами, аварии, как правило, являются одним из продуктов нормального функционирования системы, а не результатом сбоя или отказа внутри этой системы. Для аварий в сложных системах не нужно, чтобы что-то сломалось. Достаточно, чтобы ряд элементов начали действовать в новых или в немного других условиях. 

Кроме этого, любая техническая система работает в организационном и культурном контексте. У организации есть свои цели и задачи, и кроме технической сложности возникает еще организационная сложность: взаимодействия между людьми, заинтересованными лицами, инвесторами, государством и так далее. 

Если следовать этой модели, то гарантировать безаварийную работу систем невозможно, и вопрос лишь в том когда случится авария и какая она будет. 


Пожары как вид продукции
Эдвардс Деминг в книге «Выход из кризиса» приводит такой пример. В одной компании встала проблема: слишком много пожаров. Страховая компания сказала, что аннулирует страховку, если количество пожаров не уменьшится. Президент компании, приуныв от подобной перспективы, послал письмо каждому из 10 тыс. работников компании, призывая их снизить число пожаров.
Анализ количества пожаров по времени и силе выдавал хорошую картинку стабильной системы со средним числом пожаров 1,2 штуки в месяц. Статистическое доказательство есть в книге Деминга, и если необходимо, то можно обратиться к нему.

То есть, компания производит несколько видов продукции, и один из них — это пожары, и их производство стабильно. Несколько месяцев пожаров не будет, потом за несколько месяцев случится один пожар, потом — два с верхним пределом пять пожаров в месяц.

Система производства пожаров будет оставаться стабильной до тех пор, пока менеджмент не предпримет действий для уменьшения их частоты. И тут странно, что страховая не смогла просчитать стабильность пожаров — на стабильных событиях можно сделать хорошие деньги. 

Нормальные аварии
В 1984 году Чарльз Перроу предложил термин «нормальные аварии». Он показал, что это свойство самих систем — провоцировать отдельные сбои. То есть, сами системы устроены таким образом, что они могут ошибаться. И выход таких систем из строя — лишь вопрос времени. 

Представьте, что у вас важная встреча на другом конце города. Утром оказалось, что сломалась кофеварка. Вы запланировали поехать на поезде, и времени в запасе еще оставалось. Пока вы искали турку и варили кофе, по радио передали, что поезда на вашей ветке задерживаются из-за строительства новой станции. Вы понимаете, что на поезде вы можете опоздать, и решаете ехать на машине. Но вчера ваш партнер ездил на машине, вернулся поздно и не успел заправил ее. Вы заезжаете на заправку по пути, но они закрыты, так как принимают топливо. В результате, вы встаете без топлива на улице и опаздываете на встречу. 

При попытке объяснить, почему вы не можете приехать на встречу — вы не понимаете, как это можно объяснить. Поэтому просто говорите, что сегодня не получится. 

Любое из этих событий: заправка машины, введение новой станции, поломанная кофеварка — само по себе не повлияло бы на «аварию» — опоздание на встречу. Или, даже если бы все эти события случились, но не было бы необходимости ехать на важную встречу — они бы также не имели значения. 

Подобные цепочки возникают постоянно в нашей жизни: мало топлива в машине, поезда иногда не ходят, неожиданные пробки, сломанная кофеварка. Обычно они ни к чему не приводят. Но иногда они пересекаются, и тогда возникают неожиданные взаимодействия. Ремонт станции и поездка партнера на вашей машине обычно никак не связаны друг с другом, но тут они наложились, что привело к нежелательным последствиям, или аварии.
Взаимосвязи элементов
В системе все элементы взаимосвязаны. Иногда линейно: А влияет на Б, иногда по сложной цепочке: А влияет и на и Б и на С, Б влияет на А и Д. Взаимосвязь может быть различной степени зависимости друг от друга. 

Перроу ввел понятие тесной и слабой связи между элементами системы. Тесная связь, это когда изменение одного элемента точно вызывает изменение другого элемента. Если на железнодорожном вокзале путь занят поездом, то другой поезд прибыть на этот путь не может — ему нужно либо ждать, либо прибывать на другой путь. В свою очередь, это может вызвать сбои в движении других поездов и т.д. 

Слабая взаимосвязь — это когда изменение одного элемента может и не отразиться на другом элементе системы. Сломанный кондиционер мало повлияет на проведение занятий в школе. Будет или другая аудитория, или откроют окна, или занятие будет в этом классе. Да, будет неудобно, но не более того. 

Чем сложнее и теснее взаимосвязи внутри системы, тем больше эта система подвержена «нормальным» авариям. Как только один элемент выходит из строя — он сразу же начинает влиять на следующий, и т.д. и т.д. Эти цепочки событий могут ничем не заканчиваться, а могут в какой-то момент, при совпадении привести к аварии.

Если же элементы в системе связаны линейно и слабо, то такая система не будет подвержена авариям. Сбой, случившийся с одним элементов не окажет сильного влияния на другие части системы. Например, гольф-клуб. Если одна лунка будет испорчена, то в гольф все равно можно играть. 

В случае тесных и комплексных связей в системе, можно говорить о том, что системы начинают обладать новыми свойствами: «эмерджентными». У них могут возникать такие взаимозависимости, которые нельзя заранее продумать. Чем больше система и чем теснее взаимосвязи в ней, тем с большей вероятности возникнет новое свойство, которое приведет к аварии. 
То есть, для некоторых систем аварии являются нормальным свойством. 
Азорский планер
В 2001 году у самолета, летевшего по маршруту Торонто-Лиссабон закончилось топливо. Самолет благополучно приземлился на Азорских островах, совершив самое длинное планирование на самолете с неработающими двигателями.
Одним из факторов аварии было то, что пилоты не понимали, что происходит с самолетом. В правом двигателе перетерся шланг и самолет начал терять топливо из правого бака. Вначале, в 5:16 появился сигнал о высоком давлении масла в двигателе. Масло охлаждалось топливом, и когда шланг протерся, масло переохладилось и загустело. Пилоты не могли понять причину и подумали что это компьютерный сбой. В 5:36 прозвучал сигнал о дисбалансе в топливных баках. Они запустили стандартную процедуру перекачки топлива из левого бака в правый, тем самым усугубив ситуацию с потерей топлива. Визуально обнаружить потерю топлива не удалось: было темно и, персонал не обладал должным опытом.

Пилоты заподозрили что-то неладное и в 5:45 повернули на запасной аэродром. В 6:13 кончилось топливо в правом баке, еще через 13 минут — в левом. До аэродрома оставалось 120 километров на высоте 10 600 метров. Самолет спланировал на нерабочих двигателей до аэропорта и в 6:45 самолет удачно сел на Азорских островах. Все остались живы, 18 человек получили травмы при эвакуации. 

Возрастающая сложность систем повышает вероятность закона Мерфи. В ситуации с «Азорским планером» механик заменил испорченный шлаг от двигателя на такой же, от другой версии двигателя. Он оказался на несколько миллиметров короче — что оказалось критичным, так как из-за этого он и перетерся. 
Компания Ролс-Ройс выпустила специальное уведомление, что нельзя использовать запчасти от разных версий. Но если запчасти отличаются только тем, что одна длиннее другой на несколько миллиметров — то нужно теперь думать о том, чтобы их не перепутать!
Проблема сложных систем 
Юмористическая история очень хорошо подчеркивает, что такое сложные проекты в ИТ.

Маркетолог спрашивает программиста: в чём сложность поддержки большого проекта?
Программист: ну представь, что ты писатель и поддерживаешь проект “Война и мир”. У тебя ТЗ — написать главу как Наташа Ростова гуляла под дождём по парку. Ты пишешь “шёл дождь”, сохраняешь, вылетает сообщение об ошибке “Наташа Ростова умерла, продолжение невозможно”. Почему умерла? Начинаешь разбираться. Выясняется, что у Пьера Безухова скользкие туфли, он упал, его пистолет ударился о землю и выстрелил в столб, а пуля от столба срикошетила в Наташу. Что делать? Зарядить пистолет холостыми? Поменять туфли? Решили убрать столб. Получаем сообщение “Поручик Ржевский умер.” Выясняется, что он в следующей главе облокачивается о столб, которого уже нет..."

rol_foster: Сегодня полдня искали ошибку, из-за которой, образно говоря, у Наташи при прогулке с Пьером падают трусы. Одна из функций программы делает то, что делать не должна. Откатили на вчера - трусы на месте. Перелопатили весь код обновления, там вообще ни трусов, ни Наташи, ни даже Ржевского, тупо красят дом Болконских. Чуть ли не пошагово разбираем - все нормально. Но трусы падают. И, чтобы найти причину, придется перелопатить весь код, а это недели две минимум.
В общем, начальник задумчиво посмотрел на девушку и волевым решением выдал Наташе подтяжки
Новые системы и новые ошибки
Одной из причин нормальных аварий является то, что мы (человечество) постоянно создаем новые системы. Новизна каждый раз разная, но она есть. Это новые материалы, новые нагрузки, новые технологии, новые задачи. Мы осваиваем новые территории и постоянно сталкиваемся с новыми рисками. В таких системах ошибки неизбежны. Просто потому, что мы раньше такое не делали.

Такомский мост был открыт 01 июля 1940 года. 7 ноября этого же года он разрушился. Конструкторы не учли возникающую аэродинамическую нагрузку. Эта авария изменила подходы к проектированию всех большепролётных мостов в мире, начиная с 1940-х годов.

То есть, когда мы строим и делаем что-то новое, появляются какие-то новые риски, про которые мы даже раньше и не думали. В новых системах всегда будут возникать новые риски.
Такомский мост
Управленческая дилемма
Системы не создаются для того, чтобы быть безопасными. Безопасность важна, но цель системы не этом. Системы существуют для производства продукции, оказания услуг — для получения экономической и другой выгоды. 

У любой организации существует дилемма между рентабельностью и безопасностью. Если слишком много усилий тратить на безопасность, то возникнут проблемы с рентабельностью. Если же заниматься повышением рентабельности, то рано или поздно случится катастрофа. 

Стивен Кови в своей книге называл эту дилемму балансом между ресурсами и результатами. Если вкладываться в результаты — эксплуатировать доменную печь без плановых остановок и обслуживания, то у нас будут хорошие результаты, но скоро доменная печь сломается. Если мы будем слишком много времени уделять обслуживанию доменной печи, то она станет экономически невыгодной и у нас не будет ресурсов на ее поддержку. 

Таким образом, существует зона безопасности — баланса между возможным уровнем рентабельности / производительности и необходимым уровнем защиты и/или обслуживания системы. Эта зона баланса зависит от восприятия ситуации в организации и извне. Давление может идти со всех стороны: со стороны проверяющих органов, общественности, государства. Сотрудники могут испытывать давление со стороны компании и т.д. 

Рентабельность с одной стороны и надежность и безопасность с другой стороны противоречат друг другу. Можно создать систему по тщательному контролю оборудования, но это увеличит нагрузку на персонал и снизит полезное время работы оборудования, что, в свою очередь, снизит рентабельность компании. С другой стороны, можно начать выжимать максимум из оборудования, экономить на компонентах, что вначале сильно увеличит результаты, зато потом приведет к выходу из строя оборудования или аварии. 

С точки зрения проектного управления и выделения ресурсов это представляет проблему. Проекты, направленные на поддержание безопасности и/или требуемого уровня надежности невозможно (или очень сложно) оценить стандартными методами финансовой оценки. Поэтому иногда требуется законодательные требования о том, что нужно делать для поддержки необходимого уровня безопасности. 

Сход поезда с рельс, Осака
В 2005 году недалеко от Осаки, Япония, пригородный поезд сошел с рельс и врезался в многоквартирный дом. В результате аварии погибли по меньшей мере 56 пассажиров и 440 получили ранения. Поезд опаздывал на 90 секунд, и предполагалось, что он ехал вдвое быстрее разрешенной скорости на этом участке линии, когда пять из семи вагонов сошли с рельсов.

Следователи сосредоточили внимание на неопытном 23-летнем машинисте, который ранее получал выговор за проезд мимо платформы за 11 месяцев работы и, возможно, превышал скорость, чтобы компенсировать задержку. Премьер-министр Японии призвал чиновников «принять решительные меры для предотвращения будущих аварий».

Однако японские поезда известны своей точностью, благодаря чему пассажиры, путешествующие по незнакомым линиям, могут планировать сложные маршруты, будучи уверенными, что не пропустят пересадки из-за задержек. Точность и скорость являются ключевыми факторами успешной работы пригородной системы в густонаселенных городских районах. Возможно, машинист чувствовал, что выражает предпочтения и ожидания всего общества.

International Herald Tribune, 26 апреля 2005 г.
Давление со стороны компании
В идеальном мире компании выдерживают баланс между целями. В реальном же мире декларируемый баланс может не совпадать с реальным. 

Компании все время работают на пределе своих возможностей. И то, как баланс между рентабельностью и безопасностью соблюдается в реальной жизни повлияет на вероятность происшествия.

«Это лежит в основе вечного конфликта профессионального пилота», — пишет Уилкинсон в комментарии к делу Ноябрь Оскар. «Авиакомпании читают в одно ухо нравоучения: «Никогда не нарушайте правила. Никогда не рискуйте. Никогда не игнорируйте письменные процедуры. Никогда не ставьте под угрозу безопасность». А в другое шепчут: «Не тратьте время. Не тратьте наши деньги. Доставьте пассажиров к месту назначения — не ищите причин, почему вы не можете этого сделать».

В ряде случаев компании могут принимать репрессивные меры в отношении сотрудников, которые отказываются следовать «неформальным» указаниям. Так, недавно прошла информация в соцсетях, что машинистов, которые отказываются выходить на неисправных поездах — снимают с работы. Это не официальное указание, просто машинистов не ставят на смены. 

Если мы требуем от сотрудников выполнять свою работу эффективно, то можем ли мы требовать, чтобы они выполняли работу тщательно? И может ли сотрудник отказаться работать на небезопасном оборудовании? 

Поэтому, если мы говорим про человеческий фактор в каком-либо происшествии, то нам надо сравнить, а были ли у сотрудников достаточно ресурсов и полномочий, чтобы справиться с работой? 
При этом ресурсы могут быть разные. Это может быть необходимые или качественные инструменты, либо обучение, либо достаточное время, для работы.
Боинг MAX
Катастрофа Боинг MAX — хороший пример аварии, вызванной нарушением баланса между прибылью и поддержкой. Чтобы разобраться в этом случае, необходимо немного углубиться в историю. 

В 90х годах прошлого века были тяжелые времена для авиастроителей. Падение спроса в гражданской авиации, сокращение военных заказов. В 1995 году сократили более 70 тыс. рабочих. В 1997 Боинг купил компанию МакДоннелл-Дуглас. 

В объединенной компании ведущую роль начали играть менеджеры из МакДоннелл-Дугласа — они были более понятным для аналитиков с Уолл Стрит. В компаниях начали вводить различные программы сокращения затрат, увольнения опытных сотрудников (с самыми большими зарплатами) и так далее. Потихоньку инженерная школа Боинга проиграла в культурной войне финансовой школе МакДоннелла.  

В 2004 Боинг запускает разработку нового самолета 787 Дримлайнер. Однако, из-за проблем с проектированием (что не удивительно), поставки начались только в 2011 году. Airbus же, в 2010 выпустила среднемагистральный А320, более экономичный. А320 составил основную конкуренцию 737 и DC9 МакДонелл-Дугласа

Боинг в ответ хочет выпустить новый самолет, еще более экономичный чем Airbus, и хочет выпустить максимально быстро. Чтобы сократить время разработки и сертификации, новый самолет запускают как обновление 737. 

Для экономии делают двигатели большего размера. Разместить их под крыльями уже не получалось, поэтому их вынесли вперед и выше. Это изменило аэродинамическую модель самолета — он все время задирал нос вверх. Это было видно даже на испытаниях моделей самолета в аэродинамической трубе. 

Чтобы избавиться от этого недостатка, разработали MCAS: система улучшения характеристик маневрирования. Сообщать об этой системе пилотами и компаниям не стали, так как это потребовало бы дополнительного обучения пилотов и сертификации в FAA — мы же помним, нам надо быстрее. 

Сама система MCAS была написана не очень хорошо — по команде от одного датчика система начинала опускать нос вниз. И продолжала это делать каждые 5 секунд с маниакальным упорством. Чтобы добить всех, главный технический пилот Boeing написал, что обучение работе с MCAS на симуляторе не требуется. 
Боинг компании Lion Air 22 раза дергал нос вниз. Пилот, бывший военный летчик, каждый раз вытаскивал Боинг из этого пике. Когда он решил, что надо понять, что работает не так, и отключить эту систему — он передал управление второму пилоту. А он уже не смог удержать самолет на высоте. 

После первой катастрофы с Lion Air Боинг предпочел обвинить в аварии пилотов индонезийской компании, обновлений в системе не было. Только после второй аварии Боинг MAX поставили на прикол до исправления ситуации. 

Отвечая на вопрос The Washington Post о том, почему компания не остановила полеты MAX, когда она впервые узнала о софте, убившем 189 человек, президент компании Дейв Калхун сказал: «Я не жалею об этом решении. И я не думаю, что мы ошиблись в то время и в том месте». 
2.4 Сдвиг или Дрейф
Все системы существуют во времени, и системы никогда не являются статичными. Меняется окружающая среда, политические, экономические факторы, свойства системы — меняется все. 

Это приводит нас к другой модели аварий: сдвигу или дрейфу: аварии, как постепенное изменение, ухудшение ситуации. Авария или несчастный случай не возникают резко сразу — предпосылки плавно появляются во времени, когда организации и люди постепенно меняют свои представления о том, что считается нормальным. 

То, что раньше считалось адекватным контролем или защитой, в новых условиях уже может не быть таковым. Или текущая ситуация приближает систему к пределу возможностей, заставляя её работать с меньшим запасом прочности. Такое изменения происходят, в том числе, из-за управленческой дилеммы. 

Например, трансформаторы нужно обслуживать раз в год. Но в компании 1000 трансформаторов и на обслуживание всех нет ресурсов. Тогда трансформаторы можно начать обслуживать с периодом в 1,5 года, или даже 2 года. Какое-то время эффект будет только позитивный, количество аварий не изменится. Аварийность может начать возрастать через несколько лет, что будет сложно увязать с решениями такой давности. 

Подобные изменения могут происходить медленно и плавно. Люди такие изменения редко замечают, однако организация все больше и больше отклоняется от нормы. В какой-то момент времени текущий статус становится новой нормой. Но система сдвигается еще дальше, и организация еще дальше отклоняется от нормы. Если в какой-то момент сравнить новую и старую нормы, то они кажутся совершенно различными. 

Разлив дизельного топлива в 2020 году в Норильске попадает в такую категорию. Основной причиной стала разгерметизация резервуара № 5 на ТЭЦ-3 так как просело свайное основание, из-за таяния вечной мерзлоты. Руководство компании знало об аварийном состоянии резервуара с 2017 года, однако продолжало его использовать.

«Норникель» настаивал, что решающую роль в аварии сыграло глобальное потепление, а причины утечки топлива не могли быть предотвращены действиями руководства. Согласно версии компании, до аварии опоры резервуара служили «без нареканий» более 30 лет (!), а проверки проводились каждые два года.

То есть, катастрофы готовятся годами. В компании накапливаются отклонения от корректных норм и правил. Самое печальное, что часть людей будет считать этот курс нормальным, просто потому что катастроф или аварий давно не было. 
Практический сдвиг
Процессы в компании, как в социо-экономической системе также подвержены свдигу или дрейфу. Концепцию практического сдвига предложил полковник армии США Скотт А. Снук. Он, в 1991 году расследовал инцидент, когда 2 самолёта армии США сбили свои же вертолёты, что привело к гибели 26 человек. Все меры предосторожности, придуманные чтобы избежать огня по своим, не сработали.  

Что интересно, концепция изложена в руководствах по безопасности полётов, а не в бизнес-литературе. Наверное компании не так заботятся об ошибках, как в авиации. 

Концепция практического сдвига простая. Все процессы в компаниях разрабатываются и описываются в теоретической среде, в идеальных условиях, с допущением, что всё можно спрогнозировать и проконтролировать. Предполагается, что и соседние процессы работают так, как оно должно быть. 
То есть, рисуется сферический конь в вакууме. Мы думаем, что:
a) у нас есть всё необходимое; 
b) люди обучены, мотивированы и они есть;
c) люди будут следовать прописанным политикам и процедурам. 

Но системы работают в реальных условиях: техника ломается, люди болеют и увольняются, материалы не привозят или привозят не того качества — и ещё куча других событий. 

Люди адаптируют систему к реальности, так что она может работать, несмотря на все недостатки. Если выполнять все процессы так, как написано — компания остановится. Это же и есть итальянская забастовка. Чтобы система заработала — где-то нужно отойти от описанного процесса.

На практике процесс никогда не работает как в теории. Практический сдвиг — разница между процессом в идеальных условиях, где пони какают радугой и процессом в реальности, где слесарь Вася запил и никто, кроме него не может работать на этом станке. 

Любая система дрейфует, вне зависимости от того, насколько тщательно и продуманно она спроектирована. Причины сдвига: 
  • техника, работающая не так, как ожидалось; 
  • процедуры, которые иногда не выполнимы; 
  • изменения в системе, в том числе новые и дополнительные компоненты; 
  • взаимодействие с другими системами; 
  • культура компании и охрана труда;
  • достаточность (или недостаток) ресурсов (оборудования или материалов); 
  • изменение процессов и так далее.
С одной стороны, ну и что такого? Система-то работает, всё же нормально. Маленькие компании могут вообще без описанных процессов работать, и ничего такого. Но в больших компаниях процессы взаимосвязаны. Но взаимодействие процессов, включая системы контроля или предупреждающие системы, системы защиты — строиться исходя из идеальной картинки, а реальной. А значит, все эти системы защиты могут не работать. Ну как, в тренировочном режиме, конечно, они сработают — их запустят. Но вот в реальности — их работа похожа на бросок монетки: могут сработать. А могут и не сработать. 
То есть мы управляем чёрным ящиком. В какой момент система даст сбой зависит от многих причин: может быть завтра, может через год, или через 10 лет. Но сбой будет. 

Чтобы такого сбоя не было — надо постоянно (ещё раз — постоянно) выявлять отклонения реальных процессов от описанных и корректировать. Иногда реальные процессы, иногда — описанные. 

Если подвести итоги:
  1. Ни одна система не работает по описанным процессам на 100%. Если кто говорит, что процесс идёт, как описано — это обман! Или карта не есть территория. 
  2. Любая система со временем деградирует. Скорость отклонения у каждой системы своя. Энтропия всё время возрастает. 
  3. Чем больше отклонение реальных процессов от описанных — тем вероятнее будет сбой или ошибка.  
  4. Чтобы этого не произошло — нужно постоянно корректировать и обновлять процессы. 
Практический сдвиг
Система на пределе
Рядом с моделью сдвига и системной моделью находится принцип нагрузки: «система всегда работает на границе своих возможностей». 
Обычно у системы есть резервы и ресурсы, которые могут помочь справиться с каким-либо инцидентом, не допустить его перерастание в аварию. Однако, резервы не всегда экономически выгодны. Если станок может работать быстрее, почему бы его не запустить быстрее? 

Это как старая байка про соломинку: 
Жил да был жадный торговец. Поехал он на базар купить соломы. Купил – и давай грузить тюки с соломой верблюду на спину! Грузит, грузит, и всё ему мало. «Смотри, – говорят ему, – как бы верблюд твой не умер от такой тяжести, имей совесть!» – «Ничего, – отвечает жадина, – выдержит!» И продолжает грузить. Верблюд уже еле-еле на ногах стоит, а купец только руки потирает, подсчитывает будущие барыши. Наконец, тронулся верблюд с места, а жадина не выдержал: «Ну ещё чуть-чуть!» – и положил на спину верблюду еще одну одну соломинку. Ноги у верблюда подкосились, он упал и умер. Остался купец ни с чем – не на себе же ему солому везти? А с тех пор люди стали говорить: «Одна соломинка может сломать спину верблюду».

Естественным пределом нагрузки является поломка системы. Фуры грузят пока они могут ехать или пока не поймают гаишники с превышением веса. Сотрудников оставляют после работы, пока они не начнут жаловаться. 

Результат работы под нагрузкой похож на теорию сдвига: постепенное ухудшение характеристик системы, сдвиг нормальной работы. Кроме этого, при отсутствии резервов взаимосвязи компонентов в системе становятся более тесными. Если у нас был резерв полуфабрикатов, то выход станка из строя не представлял проблемы. Если же резерва нет, то при поломке станка останавливается вся линия. 

Нагружать систему можно достаточно долго. Есть же даже шутка: 
- как выполнить работу максимально быстро? 
- надо поручить ее самому загруженному работнику! 
Человек на пределе
Системы требуют от человека все больше и больше: больше знаний, больше умений, больше скорость. Для ряда направлений системы уже подошли к пределам возможностей человека. Так, для пилотирования истребителей пятого поколения необходимо справляться с большими перегрузками, уметь ориентироваться в пространстве, работать с большим потоком информации, моментально маневрировать. Человек является самым слабым элементов системы: техника может больше. 

Это можно посмотреть на статистике роста ошибок в зависимости от уровня техники. В 50-е годы ошибки пилота составляли 30% всех летных происшествий (для военной авиации), в 70-е – от 40 до 60%, в начале 80-х – более 70%. В период войсковой эксплуатации самолетов 4 поколения (с 1982 по 1993 годы) уровень достиг 75%.

Если техника требует от человека большего, то количество ошибок будет увеличиваться. Естественно, истребительная авиация 5-го поколения не самая распространенная система, но тенденция наблюдается везде. Экономические условия требуют снижения затрат, что также увеличивает нагрузку на сотрудников. 

Новые технологии только повышают нагрузку на людей. Тут можно вспомнить недобрым словом изобретения, которые следят на нагрузкой на людей. Была новость про метод контроля за производительностью сотрудников в компании Amazon: датчики в перчатках и шлеме. Если скорость движения работника на рабочем месте ниже требуемой, то раздаётся сигнал, как и если он смотрит не в «правильную» сторону больше 15 секунд. Мою знакомую уволили с руководящей позиции со словами: «Ваша мышка не двигалась в течении 40 минут!». 

Системы сами начинают требовать от людей все больше и больше, что делает системы еще более хрупкими, более чувствительным к ошибкам. 

Успех и принцип паранойи
Pride goes before a fall

У теории сдвига есть интересное следствие: успехи порождают аварии. 

Когда организация добивается успеха, ее руководители обычно приписывают успех себе или своей организации, а не удаче или стечению обстоятельств. Сотрудники становятся более уверенными в своих собственных способностях, в навыках своего руководителя и в существующих процессах и процедурах. Они доверяют информации, которую собирают по существующим каналами, полагая, что это вся информация, которую им нужно знать.

Успех приходит к дальнейшей гонке за успех. Если компания добилась выдающихся результатов, то в будущем ждут подобных же результатов. Все хотят результатов не ниже того что было. 

Успех сужает кругозор, меняет взгляды, укрепляет единый способ ведения бизнеса, порождает чрезмерную уверенность в адекватности существующих методов и снижает принятие противоположных точек зрения. Даже более того, отсутствие негативных исходов может трактоваться как успех. Если все работало уже 20 лет и работало без ошибок — то зачем нам менять принципы и подходы? 

Как только системы добиваются успеха — они костенеют, начинают придерживаться старых принципов, до тех пор пока не станет слишком поздно. 

Успех мог получиться из-за случайного сочетания факторов. И следующий раз факторы могут сложиться по-другому и результаты не будут такими же хорошими. 

Как говорил Энди Гроув: выживают только параноики. 

Получается что все системы развиваются по пилообразному графику: успех — закостевание — кризис — трансформация. Чем выше дерево, тем больше ему падать. Чем больше система, и чем дольше у нее была спокойная и успешная жизнь — тем больнее она упадет. 

Поэтому нам нужны кризисы. Чем чаще, тем лучше. Принцип Челомея говорит: чтобы система была устойчивой, ее надо трясти.
Этапы развития безопасности
В авиации есть руководство по обеспечению безопасности полетов, которое издается Международной организацией гражданской авиации. Очень интересная книга, в каком-то плане лучший учебник по управлению рисками. Жаль, что я нашел его относительно недавно. 

В Руководстве выделяют 4 этапа в обеспечении безопасности полетов, эволюция того, как пытались сделать перелеты максимально безопасными. 

1 этап: Технический
С начала 1900-х по конец 1960-х годов основной фокус был на технической безопасности. Что логично — техника только развивалась, развивалось наше понимание того, почему происходят инциденты и аварии. Основной целью этого этапа было совершенствование технических систем. К 50-м годам количество инцидентов снизилось из-за совершенствования систем, а деятельность по обеспечению безопасности полетов распространилась на нормотворчество и надзор.

2 этап: Человеческий фактор
К началу 1970-х годов техника стала достаточно надежной, правила полетов устоялись, и в целом количество авиационных происшествий значительно снизилось. Основной причиной инцидентов стали называть ошибки людей. Что логично, техника стала достаточно надежной. Но при расследовании аварии не изучали эксплуатационный и организационной контекст. Только в начале 1990-х годов было признано, что люди работают в сложных условиях, которые влияют и определяют поведение человека.

3 этап: Организационный
С середине 1990-х годов безопасность стала рассматриваться системно и захватывала как организационные, так и человеческие и технические факторы. Было введено понятие "происшествие организационного характера". Этот подход учитывал воздействие, например, организационной культуры и политики на безопасности полетов. 

4 этап: Общесистемный
Начинает развиваться с началом XXI века. Этот подход еще больше расширяет контекст обеспечения безопасности. Он следует из того, что авиация рассматривается как большая сложная система и необходимо учитывать еще более широкий контекст.  Существует множество примеров происшествий и инцидентов, из которых следует, что взаимодействие между организациями внесли свой вклад в отрицательный исход событий. То есть, обеспечение безопасности уже выходит за рамки одной компании, и должно охватывать всю систему. 

На мой взгляд, большинство компаний сейчас остались на втором этапе. Техника работает достаточно надежно, но организационный контекст и культура не учитываются - так что основная причина инцидентов это человек. В западных компаниях пытаются работать на уровне культуры, но на мой взгляд, до полного учета организационного контекста достаточно далеко. Хотя, может быть и есть крутые компании — но про них мало известно. 

Этап развития безопасности (с) РУБП
Модели и их применение
Модели катастроф описывают реальность лишь в каком-то приближении. Где-то оказываются более правдоподобными одни модели, где-то другие. Модели больше отражают наш подход к предотвращению аварий — что мы делаем, чтобы подобных аварий не было.
Цепочка событий и барьерная модель нас возвращает к человеку, как к непосредственной причине аварий. Системная модель и модель сдвига — говорят о том, что причина аварий заложена в системе и необходимо работать с системой, чтобы аварий не было.

Вместе с тем, тут может показаться что есть противоречие. Если мы говорим, что человеку свойственно ошибаться, то почему же он не может являться причиной аварий? Для этого нам необходимо разобраться с тем, что такое ошибка и какие ошибки бывают.