Доклад

Сломаться или стать сильнее? Зарисовки инцидентов c K8s в инфре MWS Cloud

Даже самая надежная и отказоустойчивая инфраструктура, развернутая по всем заветам HA, иногда может сбоить. В докладе расскажу, как устроены наши отказоустойчивые K8s-кластера в инфраструктуре, как мы автоматизировали их управление через CAPI на масштабах сотен серверов. И наконец, как вся эта отказоустойчивая конструкция может развалиться.

В качестве основного блюда — погрузимся в причины нескольких самых интересных инцидентов вокруг K8s, разберем root cause и сделаем выводы. Внутри ваши любимые buzzwords: Cilium, BGP, Cluster API.

Спикеры

Доклады