Антон Бушный
K2 Cloud
Облачная платформа — это огромная и сложная система, работающая на большом количестве физических серверов. «Железная» инфраструктура служит ее фундаментом — во многом именно от того, насколько она продумана, зависит доступность и надежность сервисов.
В этом докладе разберем, как мы в K2 Cloud прошли путь в этой сфере от полного хаоса до стандартизированной, но в то же время гибкой системы, которая позволяет быстро адаптироваться под динамичный темп развития Облака. Рассказ будет про то, как мы, зачастую используя метод проб и ошибок, приходили к оптимальным решениям во многих задачах из самых разных сфер: от области электротехники до написания кода на Python.
Разберем конкретные инженерные решения: стандарты построения стоек и коммутации (с учетом того, что мы не используем OCP-решения), распределение электрической нагрузки по PDU и мониторинг питания. Также расскажем, как осуществляется масштабирование инфраструктуры: отдельный блок — автоматизация подготовки и ввода нового оборудования, позволяющая существенно экономить трудозатраты.
Покажем, как работает наш инструментарий на базе Redfish API для управления BMC-контроллерами серверов от разных вендоров в связке с Cobbler для разливки ОС по PXE и конфигурированием через Puppet. Помимо этого покажем разработанные нами с нуля утилиту для самотестирования сервера после ввода и консольный клиент для системы инвентаризации (обе утилиты написаны на Python).
Подводя итоги, покажем, как выглядел ввод нового оборудования «до» и «после»: как стандарты помогли при запуске новых регионов Облака и его частных инсталляции и насколько удалось сократить время ввода серверов в эксплуатацию.
Доклад будет полезен системным архитекторам, инженерам эксплуатации ЦОД и всем, кто работает непосредственно с физическим железом: вы унесете с собой набор проверенных решений — от компоновки стойки до автоматизации.
K2 Cloud