Отслеживание уровня обслуживания
Наблюдение за согласованными целями по доступности и производительности продукта неделю за неделей, с сигналом о том, что тренд идёт не туда, до того, как это станет сбоем.
DevOps
Инженер, который присоединяется к вашей команде и отвечает за аптайм, инциденты и дежурство по одному продукту месяц за месяцем, а не разовый аудит.
Бизнес в Дубае обычно решает нанять выделенного SRE-инженера, когда у продукта появляются реальные пользователи, простой начинает стоить реальных денег, а работа по надёжности неравномерно ложится на разработчиков, которые вообще-то должны заниматься новыми функциями. Вместо короткого аудита это человек, который присоединяется к команде, постоянно отвечает за состояние сервиса и оценивается месяц за месяцем по тому, как продукт реально ведёт себя в продакшне.
Собственная книга Google об SRE формулирует это прямо: SRE, это “то, что происходит, когда инженера-программиста просят спроектировать операционную команду”, строя автоматизированные системы вместо ручной операционной работы. Эта формулировка особенно важна именно для выделенного найма, поскольку описывает человека, который пишет код, чтобы сократить рутину, а не только смотрит на дашборды и реагирует.
На этой странице разобрано, что реально делает выделенный SRE-инженер, встроенный в команду в Дубае, какие навыки проверить, и чем эта роль отличается от более короткого проекта по настройке практики надёжности, который отдельно описан на нашей странице SRE-консалтинга.
За что отвечает выделенный инженер
Работа, которая имеет смысл только как постоянная роль внутри команды.
Наблюдение за согласованными целями по доступности и производительности продукта неделю за неделей, с сигналом о том, что тренд идёт не туда, до того, как это станет сбоем.
Руководство реагированием, когда что-то ломается, ведение графика дежурств и разбор произошедшего после, чтобы та же самая поломка не повторилась.
Автоматизация задач, которые команда сейчас делает вручную, чтобы сервис работал, освобождая время разработчиков для новых задач вместо тушения пожаров.
Наблюдение за использованием ресурсов относительно роста, чтобы продукт масштабировался с опережением спроса, а не реагировал на него под давлением в загруженный период.
Работа с разработчиками над более безопасными практиками релизов, например постепенным раскатыванием, чтобы неудачное развёртывание затронуло небольшую часть пользователей, а не всех сразу.
Проведение безоценочных разборов после инцидента, сфокусированных на том, что позволила системе, а не на том, кто был на смене.
Важные навыки
Доказательства реальной ответственности, а не просто знакомство с инструментами мониторинга.
| Навык или инструмент | Как выглядит хороший уровень | Почему это важно |
|---|---|---|
| Мониторинг и оповещения | Настраивал оповещения так, чтобы они срабатывали на реальные проблемы, а не на каждый небольшой всплеск | Усталость от оповещений приводит к тому, что реальные инциденты пропускают |
| Умение писать код | Пишет реальную автоматизацию и инструменты, а не только шелл-скрипты по памяти | Сокращение рутины, в терминах самой книги про SRE, требует навыка инженера-программиста |
| Руководство инцидентом | Вёл инцидент как человек, координирующий реагирование, спокойно и под давлением | Растерянное реагирование превращает небольшой сбой в долгий |
| Разбор инцидентов | Может показать реальный документ с разбором, сфокусированным на причинах в системе, а не на вине конкретного человека | Без этой привычки одна и та же поломка склонна повторяться |
| Готовность вести дежурство долгосрочно | Действительно хочет постоянную ответственность, а не просто короткий проект | Выделенная роль работает только если человек остаётся вовлечён дольше первых нескольких недель |
О книге Google про SRE стоит спросить кандидата напрямую: читал ли он её, и в чём согласен или не согласен с ней исходя из реального опыта, это говорит больше, чем список инструментов мониторинга в резюме. Эта таблица служит и брифом, по которому мы работаем, когда клиент просит нас нанять SRE-инженера в Дубае для своей команды в рамках поддержки в подборе персонала.
Форматы сотрудничества
Большинство компаний, которые хотят нанять выделенного SRE-инженера в Дубае, уже прошли ту точку, где помогает короткий проект. Роль требует человека, встроенного в вашу команду, в вашем графике дежурств, отвечающего за один и тот же продукт неделю за неделей, а это именно то, что даёт наша модель выделенного разработчика. Если бизнес вместо этого хочет сам спроектировать практику надёжности, целевые показатели, политику допустимых сбоев и процесс работы с инцидентами, прежде чем решить, нанимать ли постоянного сотрудника, это более короткий консалтинговый проект, описанный на нашей странице SRE. Поддержка в подборе персонала также доступна там, где клиент хочет нанять этого человека напрямую в свой штат, а не работать с нами на постоянной выделенной основе.
Оценка кандидата
Вопросы, которые вскрывают реальную операционную ответственность.
Попросите нас провести эту оценку в рамках поддержки в подборе персонала, или используйте её сами, прежде чем подтверждать выделенное сотрудничество.
Что сломалось, как это обнаружили, что сделали, и что изменили после, чтобы это не повторилось тем же образом.
У сильного кандидата в голове конкретные цифры и цели, а не смутное ощущение “поддерживать всё в рабочем состоянии”.
Что-то, что заменило ручную, повторяющуюся задачу, и что случилось с нагрузкой на команду после того, как это заработало.
Как он распределяет силы, избегает выгорания и со временем улучшает график дежурств, поскольку это задумано как постоянная роль, а не спринт.
Кандидат, который реально задерживал рискованное развёртывание и может объяснить почему, понимает реальные полномочия этой роли.
Сертификации
Единого органа, который сертифицирует именно “SRE” как дисциплину, не существует.
Облачные провайдеры предлагают сертификации, которые касаются практики надёжности в рамках их собственной платформы, например диплом Google Cloud Professional Cloud DevOps Engineer, который охватывает мониторинг, реагирование на инциденты и целевые показатели уровня обслуживания именно в Google Cloud.
Книга Google про SRE, это самый цитируемый источник в отрасли, а не сертифицирующий орган, поэтому стоит попросить кандидата обсудить её напрямую. Реальный документ с разбором инцидента и настоящая история инцидента весят больше любого значка, когда вы решаете нанять SRE-инженера в Дубае.
Особенности ОАЭ
Одна область, которая встаёт вопрос, когда реагирование на инциденты затрагивает данные клиентов.
Разбор реального инцидента часто означает изучение логов или записей в базе данных, которые включают данные клиентов. Федеральный декрет-закон № 45 от 2021 года, федеральный закон ОАЭ о защите данных, продолжает действовать и во время инцидента, и это стоит обсудить перед тем, как нанять SRE-инженера в Дубае, до первого сбоя, а не во время него.
Понятное, честное обновление по инциденту простым языком значит для большинства клиентов в Дубае больше, чем технические детали. Заранее подготовить простой шаблон статусного обновления, это небольшой практический шаг, о котором стоит договориться с выделенным инженером заранее.
Эта роль относится к нашей категории DevOps, части раздела нанять разработчиков в Дубае. Если ваш приоритет, это настроить саму практику надёжности, целевые показатели, политику допустимых сбоев и процесс, а не встроить одного инженера, смотрите нашу страницу SRE. DevOps-инженер охватывает более широкий пайплайн, на котором работает эта роль, а платформенный инженер строит инструменты самообслуживания, которые снижают операционную нагрузку изначально. Для серверов и облачных мощностей, лежащих в основе, смотрите инженер по инфраструктуре.
Прямые ответы
За состояние одного или нескольких работающих сервисов: работают ли они, насколько быстро отвечают, как обрабатываются инциденты, и автоматизацию, которая сокращает повторяющуюся ручную работу. Это другой фокус, чем разработка новых функций.
Консалтинг подходит для настройки самой практики, целевых показателей и процесса. Выделенный найм подходит уже работающему продукту с реальными пользователями, где кто-то должен каждую неделю отвечать за аптайм и дежурство, а не просто один раз спроектировать подход.
Он может снизить зависимость от разработчиков в рутинных инцидентах, но здоровая система дежурств обычно всё равно включает людей, которые лучше всех знают код. Выделенный инженер обычно возглавляет дежурство и улучшает его, а не исключает из него всех остальных.
В хорошо выстроенной практике большая часть времени уходит на автоматизацию, мониторинг и предотвращение проблем, а реагирование на инциденты занимает меньшую долю. Если инциденты преобладают каждую неделю, это само по себе сигнал, что роли или системе нужно внимание.
Обычно это бизнес с работающим продуктом, которым пользуются реальные клиенты, где простой стоит реальных денег, и где работа по надёжности сейчас неравномерно ложится на разработчиков, уже занятых новыми функциями.
Источники
Фиксированная цена в письменном виде
Получили. Мы уже готовим ваше предложение.
В рабочее время вы получите его в течение 45 минут. Проверьте почту, там письмо с подтверждением.