Внутри Yandex Infrastructure: как управлять одним из самых нагруженных деплоев в стране

Из подкаста «Деплой» узнаем: зачем Yandex Infrastructure создаёт собственную контейнеризацию, дорабатывает Linux и пишет свой SSH. А также, какое качество ценится в нашей команде больше знаний и навыков.

О герое

Андрей окончил Московский государственный университет приборостроения и информатики (сегодня МИРЭА), после чего попал в IT-школу Яндекса. Его пригласили в Яндекс на работу младшим системным администратором, а затем он стал руководителем группы сисадминов. Позже перешёл на позицию разработчика Java и занимался стабилизацией сложных проектов.

В Яндексе уже более 13 лет, сейчас отвечает за разработку систем деплоя. Андрей рассказывает, за счёт чего системы Яндекса выдерживают любые нагрузки, зачем отключать дата-центры от розетки и какой будет инфраструктура с развитием ИИ через 5 лет.

Делимся цитатами из подкаста, в котором Андрей также объясняет, какими задачами занимаются разные команды платформы деплоя.

Концепция антихрупкости

Инфраструктура должна выдерживать рост нагрузки и отказ компонентов — нужно иметь выход из любой ситуации. Поэтому в Яндексе мы многое пишем сами, а не берём открытые решения, с которыми на этапе роста упираемся в потолок. У нас есть концепция антихрупкости: мы строим архитектуру таким образом, чтобы поломка одного приложения никак не влияла на весь пайплайн. Никто ничего не заметит.

И всегда есть план Б — в любой ситуации каждый сервис продолжает работать. Это базовый принцип надёжности нашей инфраструктуры.

Учения

Мы проводим учения, например, отключаем дата-центр от розетки. Когда я устраивался в Яндекс 13 лет назад, инфраструктуры как таковой ещё не было, а учения уже были. Некоторые наши технологические решения появляются как раз по мотивам таких учений. Из любой аварии мы получаем опыт.

Главное качество сотрудника

Кандидат не обязательно должен обладать сразу всеми знаниями и навыками: опыта может не быть, мы научим. Важно, чтобы глаза горели и человек понимал, чем мы занимаемся. Ценность наших сотрудников — в том, что они не супермегаразработчики, а алгоритмисты. К нам приходят ребята с бриллиантовыми головами, которые эти алгоритмы щёлкают как орешки.

Но главное качество любого сотрудника — умение решать проблему. Даже если ты не знаешь, что делать, нужно уметь разобраться, найти нужных людей, которые тебе подскажут, и решить проблему.

Как меняется инфраструктура в эпоху ИИ

ИИ — это рычаг, множитель. Если ты эксперт, и используешь ИИ для эффективности, то он решает задачи. Если знания и навыки на нуле, то ты умножаешь на ноль, ничего не получится.

Любой человек сможет и код написать, и выкатить его, но дальше начнутся проблемы. Ему нужно будет чинить этот код и поддерживать. Для ИИ нужно дорогое оборудование: мало его просто купить, нужны самые лучшие инженеры, которые смогут заставить его работать эффективно. Это именно те люди, которые умеют решать проблемы: они останутся в профессии и будут при помощи ИИ умножать свой потенциал.

Хотите стать частью команды Deploy Platform? Сейчас мы ищем DevOps-инженера, который сможет включиться в построение гибридных облаков и обеспечить безопасную эксплуатацию кластера.

Внутри Yandex Infrastructure: как управлять одним из самых нагруженных деплоев в стране
Войдите, чтобы сохранить пост