Слогер Создать блог
Разработка

Что спрашивают на интервью SRE: пять вопросов и как на них отвечать

Инженер, проведший около трёхсот собеседований, задаёт вопросы не про алгоритмы, а про реальные сбои. Разбираем каждый — что он проверяет и где кандидаты сыпятся.

Собеседование на SRE часто выглядит одинаково: белая доска, задачка на литкод, вопрос про балансировку нагрузки по заученному шаблону. Инженер, который провёл примерно триста таких интервью, называет это бессмысленным и задаёт совсем другие вопросы. Логика простая: SRE — это про поведение в момент, когда система уже горит, и проверить его можно только разговором о реальных случаях.

«Проведи меня через свой последний крупный инцидент»

Это тест на конкретику. Сильный инженер вспоминает графики, хронологию, момент, когда до него дошло, в чём дело, и что он сделал бы иначе. Он назовёт время до восстановления, долю упавших запросов, что показывали дашборды. Если ответ звучит как «ну, был сбой, мы его починили» — человека там, скорее всего, не было.

Готовиться стоит заранее: возьмите два своих худших дежурства и разложите каждое на таймлайн. Не «мы перезапустили сервис», а «в 02:14 упал p99, в 02:19 заметили, в 02:31 нашли рост ретраев, в 02:47 выкатили фикс». Детали и есть доказательство.

«Телефон звонит в три ночи. Опиши первые десять минут»

Здесь проверяют процессную дисциплину. Хороший ответ: подтвердить алерт, оценить влияние на пользователей, оповестить нужных людей, начать диагностику. Плохой — сразу лезть по SSH на первую попавшуюся машину и что-то там крутить.

Разница принципиальная. Первый подход не даёт утонуть в деталях, пока бизнес теряет деньги. Второй — классическая ловушка: три часа копания в логах одного инстанса, когда проблема была в конфиге балансировщика.

«Расскажи, как ты убил алерт»

Ключевое слово — «убил». Рассказ про добавленное правило не считается. Вопрос про то, понимает ли человек гигиену оповещений как отдельную дисциплину. Хороший пример: алерт срабатывал на пике трафика и каждый раз закрывался сам через десять минут — порог подняли или правило выкинули. Опытный дежурный держит список шумных правил и регулярно его чистит, потому что уставший от ложных срабатываний инженер перестаёт реагировать на настоящие.

«Чем SLI отличается от SLO?»

Проверка базы, причём без подвоха. SLI — это метрика, которую вы измеряете: доля успешных запросов, задержка. SLO — цель по этой метрике, договорённость о том, какой уровень считается нормальным. Кандидаты с солидным стажем путают эти понятия чаще, чем хотелось бы.

«Какой самый полезный инструмент ты написал для себя?»

Ответ должен быть маленьким, конкретным и скучным. Скрипт, который экономит пять минут в день и живёт в личном репозитории. Если в ответе звучит «внутренняя платформа» или «фреймворк для всего» — это мимо. Такие мелочи говорят о человеке больше, чем рассказ про архитектуру на миллион.

Чего в интервью быть не должно

«Разверни связный список на доске». SRE — не соревнование по программированию, и заучивание учебника по алгоритмам здесь ничего не доказывает. Вопрос в другом: сможет ли этот человек разобрать сломанную систему в три часа ночи, когда половина сервисов молчит, а дашборды врут.

ВопросЧто проверяетПлохой ответСильный ответ
Последний крупный инцидентБыл ли человек реально в эпицентре«Был сбой, мы его починили»Таймлайн, метрики, вывод на будущее
Три часа ночи, первые 10 минутПроцессную дисциплинуСразу SSH на первый попавшийся хостПодтвердить, оценить влияние, оповестить, диагностировать
Убитый алертОтношение к гигиене оповещенийРассказ про новый алертКонкретное шумное правило и почему его убрали
SLI и SLOБазу без подвохаПутаница в терминахМетрика отделена от цели
Полезный инструмент для себяСпособность строить мелочиВнутренняя платформа, фреймворкСкрипт на пять минут в день

Как готовиться: короткий чек-лист

  1. Соберите две-три истории про инциденты с цифрами и хронологией.
  2. Отрепетируйте вслух первые десять минут дежурства — от подтверждения алерта до диагностики.
  3. Вспомните хотя бы один удалённый алерт и объясните, чем он мешал.
  4. Освежите определения SLI, SLO и SLA и разницу между ними — это спрашивают почти всегда.
  5. Найдите свой самый скучный полезный скрипт и будьте готовы объяснить, зачем он нужен.

Типичные ошибки

  • Общие слова. «Мы улучшили мониторинг» без деталей читается как «я не участвовал».
  • Прыжок к решению. Ответ начинается с «я зашёл на сервер» — значит, процесс не показан.
  • Попытка удивить масштабом. Рассказ про собственную платформу на вопрос о личных скриптах звучит как отрыв от реальности.
  • Зазубренные определения без примеров. SLI и SLO из памяти выдаст почти любой, а показать их на своём сервисе — единицы.

И ещё одно: не пытайтесь звучать умнее, чем есть. Интервьюер с опытом нескольких сотен собеседований чует воду за минуту. Лучше честно сказать «такого не делал, но вот как бы я подошёл» — это тоже полноценный ответ.

Смысл этих вопросов — не отсеять, а увидеть рабочего инженера. Того, кто был в настоящих сбоях, помнит цифры, умеет действовать по порядку и не боится признать, что где-то замешкался. Всё остальное на собеседовании — декорация.

По материалам: career. Текст переработан редакцией Слогера.

← На главную

Рекламное место — Конец поста
Реклама · Слогер

Комментарии (0)

Войдите, чтобы комментировать.

Пока нет комментариев. Будьте первым.