Автоматизация оставляет людей с самыми сложными инцидентами
Инструменты автоматического реагирования на инциденты, часто называемые «ИИ-SRE» (термин, который нравится далеко не всем), работают впечатляюще. Особенно чудесно, когда они разруливают рутинную проблему ночью, и тебе не нужно просыпаться из-за проблемы с ёмкостью.
Однако рутинные инциденты — это именно то, как сотрудники поддержки вырабатывают интуицию и практику в понимании поведения систем. Когда ИИ сталкивается с непривычной, сложной проблемой, которую не может решить, инженеры должны взять управление на себя. Но они будут менее подготовлены, чем были бы без автоматизации.
Исследовательница человеческого фактора Лизанн Бейнбридж описала этот парадокс в знаменитой статье 1983 года «The Ironies of Automation». Она объяснила: автоматизация снижает возможности операторов тренировать рутинную работу, одновременно оставляя их ответственными за новые и аномальные ситуации. Поэтому операторы должны быть более квалифицированными и получать ещё больше обучения, чем раньше.
В ближайшие годы среднее время восстановления (MTTR) для большинства инцидентов снизится благодаря ИИ-помощи. Но для сложных проблем время восстановления может вырасти — потому что инженеры потеряют контакт с системами и будут с трудом их исследовать.
Авиация обучает пилотов редким отказам
Авиационная промышленность может служить вдохновением.
Автоматизация выполняет большую часть полёта, но пилоты остаются ответственными за ситуации, которые автоматика не может управлять: отказы двигателя, ненадёжные приборы, прерванные взлёты, срывы потока и другие аномальные состояния.
Такие события крайне редки. Современные турбовентиляторные двигатели, например, испытывают менее одного незапланированного выключения на 100 000 часов полёта. Другими словами, это настолько редко, что коммерческий пилот может завершить всю карьеру, так и не встретив такое вне симулятора.
Но когда отказ происходит, пилоты должны реагировать быстро и правильно. На рейсе TransAsia Airways 235 пропеллер правого двигателя перешёл в режим флюгера вскоре после взлёта. Хотя самолёт был спроектирован для продолжения полёта на одном двигателе, экипаж неправильно определил проблему. Самолёт сорвался в штопор и упал всего через 117 секунд после первого предупреждения.
Лётчики коммерческой авиации регулярно возвращаются в симуляторы для отработки редких чрезвычайных ситуаций. По правилам FAA (США) командиры должны проходить переподготовку или проверку компетентности каждые шесть месяцев, включая сценарии, такие как отказ двигателя при взлёте.
Хотя большинство软件 инцидентов не угрожают жизни, это не причина не совершенствовать своё мастерство. Оказывается, технология, которая создала проблему, может помочь её решить.
Индустрии нужны симуляторы инцидентов
В компании Rootly, где работает автор, установлено партнёрство с Uptime Labs для применения этой идеи через реалистичные симуляции инцидентов. Инженеры занимают место командира инцидента при имитационном отказе электронной коммерции, используя инструменты наблюдаемости и координируя работу с LLM-powered участниками в Slack.
Результат ощущается реальным. Нужно выяснить, что происходит не так, одновременно удерживая реагирование в организованном состоянии и имея дело с генеральным директором и поддержкой клиентов. Практикуются навыки, важные при инциденте: разбор неполной информации, чёткая коммуникация, координация людей и фактическое управление ответом.
ИИ может также помочь сохранить эти навыки
А что насчёт использования ИИ в качестве тренера? Те, кто отвечает на инциденты, могут попросить агента объяснить предпринятые шаги, изученные сигналы и доказательства диагноза.
Но объяснение и наблюдение — не замена практике. Можно почерпнуть кое-что, наблюдая, как играет Серена Уильямс, но теннис учат, только выйдя на корт. То же самое с реагированием на инциденты.
Более половины десятилетия карьеры было посвящено созданию школы разработки программного обеспечения, основанной на прогрессивном образовании: обучение через практику. Это было очное, но преподавателей не было; студенты работали над проектами вместо прослушивания лекций. Когда Dropbox сказал, что выпускники, которых они наняли, были ещё недостаточно опытны в устранении неполадок, были созданы проекты, которые давали студентам сломанную инфраструктуру и требовали диагностировать и отремонтировать её. По большинству практических навыков практическое образование превосходит пассивное обучение в разы.
Симуляция инцидентов должна стать частью готовности к дежурству
По мере того как LLM берут на себя всё больше работы, команды разработчиков рискуют накапливать «долг понимания»: растущий разрыв между тем, как работают системы, и тем, насколько хорошо те, кто их поддерживает, их понимают.
Инженеры должны регулярно взаимодействовать с системами, которые они отслеживают, справляться с незнакомыми отказами, практиковаться в работе под давлением и отрабатывать координацию и коммуникацию, необходимые при критическом инциденте (SEV0). Настольные учения и chaos engineering — не ново, но практика стала ещё более важной в эпоху LLM.
Бейнбридж рекомендовала давать операторам регулярный прямой контроль и использовать симуляцию для предотвращения деградации навыков. В этом парадокс автоматизации: чем успешнее она становится, тем менее подготовленными могут оказаться люди к моменту её отказа.