Открытие конференции
Говорим о расписании, сессиях и делимся информацией.
Новые доклады публикуем каждую неделю, не пропустите обновления.
Говорим о расписании, сессиях и делимся информацией.
В докладе рассматривается путь от эксплуатации с помощью ИИ к самоуправляемой инфраструктуре: уровни автономности, агентные контуры управления, динамические песочницы, операционная безопасность, верификация и меняющаяся роль человека-оператора.
MWS Cloud Platform
История внедрения DORA-метрик: от их декомпозиции и формулирования ценности до результатов внедрения и разбора ошибок.
Контур
Важно не только внедрить харденинг, но и постоянно проверять, что он действительно применяется на всех хостах и не «уезжает» со временем. В докладе я расскажу, как мы полностью автоматизировали этот процесс: от формирования эталона и динамического инвентаря до проверок через Ansible, метрик в Prometheus и визуализации в Grafana.
MWS Cloud Platform
Расскажу, как мы переносили Kafka с VM в Kubernetes.
Mindbox
Командный воркшоп, где вы тушите боевой инцидент в реальном времени — по механикам настолок.
МТС Банк
В крупной IT-организации данные о системах, API, командах, владельцах и интеграциях часто разрознены между порталами, репозиториями, документацией и чатами. Это замедляет поиск информации, усложняет архитектурные решения и повышает риски изменений.
В докладе я расскажу, как Middleware Service Hub превращает разрозненные данные в связанный технологический контекст, развивается от каталога компонентов к Digital Twin организации и становится основой для Architecture as Code, API governance и AI Harness.
Райффайзен Банк
Как устроены наши отказоустойчивые K8s-кластера в инфраструктуре, как мы автоматизировали их управление через CAPI на масштабах сотен серверов.
MWS Cloud Platform
Основная идея выступления — на практике показать возможности улучшения «стандартного» Kubernetes.
Флант
Пути, карты и надежность. Как уже сегодня сделать так, чтобы ваши сервисы были доступны на 100%? Практики SRE и что такое CRE: как в облаке и на земле обеспечить доступность и отказоустойчивость сервисов (а не только инфраструктуры).
Yandex Cloud
Доклад показывает, как построить масштабируемую систему динамических тестовых окружений и избавиться от проблем с общими стендами. Слушатели узнают, какие технологии и архитектурные решения позволяют ускорить разработку, тестирование и проверку изменений.
Blackhub Games
Доклад — практический опыт масштабирования, observability политик и awareness вокруг них, — чтобы каждая команда понимала, что происходит в ее кластере, не дожидаясь инцидента.
MWS Cloud Platform
Покажу, как построить каскадный деплой на FluxCD и не распространять ошибочное изменение сразу на все окружения. Разберу два подхода: GitOps promotion через Kargo.io и Gitless-доставку через OCI artifacts, а также Prometheus gates как механизм stop/go-решений между dev, stage и production.
Mindbox
Доклад о построении большой «железной» инфраструктуры и о том, как мы в K2 Cloud прошли путь в этой сфере от полного хаоса до стандартизированной, но в то же время гибкой системы, которая позволяет быстро адаптироваться под динамичный темп развития облачной платформы.
K2 Cloud
Доклад осветит онбординг, механизмы обучения, передачи знаний, используемые технологии и условия труда. Вы сможете узнать о том, чем вы платите за привилегии и «печеньки».
ИТ Школа РТК
Самые горячие вопросы из трендов найма от интервьюеров из бигтеха. Приходите пропитаться инженерной культурой и освежить знания!
judies.tech
Хотите почувствовать себя в роли DevVibeOps — тогда вам ко мне! :)
Collabo
Доклад строится на двух частях: сетевая изоляция зараженной инфраструктуры и то, как ее делать инженерам. И куда бежать, если надо разворачивать новую инфраструктуру.
Kaspersky
Fail Talks — это откровенные и полезные истории о провалах в DevOps-практиках.
Сравним возможности ArgoCD и Flux, kubectl, Helm и Nelm/werf в упорядочивании развертывания, отслеживании готовности и управлении жизненным циклом ресурсов.
Флант
К вам пришла ML-команда: «LLM'ка отвечает в контейнере, теперь отдайте ее пользователям и поддерживайте».
Разберем, что норовит пойти не так по дороге в заветный продакшен: веса и GPU, первый токен, ключи и доступы, обновления, метрики и аварии. И как со всем этим справиться с наименьшими потерями.
Впрод
Расскажем, с какими сложностями столкнулись, покажем, как превратили хаос в управляемую систему: что пошло не так на старте, какие инструменты реально сработали и как мы измеряли эффект.
2ГИС
2ГИС
Хочу рассказать, как мы и зачем в Dodo Engineering внедряли OpenTelemetry и Observability-as-Service, какие грабли собрали в процессе, какие гипотезы проверяли и почему вам это все надо или не надо.
Dodo Engineering
За прикладным уровнем AI-систем — MLOps, моделями и инференсом — стоит платформа, которую нужно заставить работать: Kubernetes, операционная система, драйверы NVIDIA и весьма капризное серверное железо. На примере реальных расследований из эксплуатации GPU-кластеров на базе Talos Linux покажу, как искать причины сложных проблем на стыке этих слоев — и почему реальная причина часто оказывается совсем не там, где ее ждешь.
Т-Банк
Как обновление Cluster API чуть не уничтожило наши кластера — как митигировали, что поменяли и как работаем дальше.
MWS Cloud Platform
Опишу, как мы создавали у себя DevOps Cookbook. Что это такое в нашем понимании, как мы пришли к тому, что он нам необходим.
Как мы перешли от «стены текста» к боту-помощнику. И наши планы на будущее.
Райффайзен Банк
Доклад будет посвящен тому, как построить агентскую систему, где контролем над вашей инфрой владеет агент. Можно ли позволить себе потерять над ним контроль?
SIPKI Tech
Нейросети и LLM часто воспринимаются как неприступная «магия», но на деле их периметр защищен слабее классических IT-систем.
G-HACK
Расскажу, как импортозамещение NGFW в банке превратилось в пересборку сетевой модели production Kubernetes: namespace-level доступы, миграция в облако и отказ от привычной модели авторизации трафика.
Точка
Рассмотрим на практике популярные open-source инструменты, которые позволяют улучшить безопасность Kubernetes в Runtime.
Luntry
Каждое второе входящее резюме врет (17 лет опыта в Kubernetes при том, что ему 12), а нейросеть, которая это ловит, либо разоряет на счетах, либо врет сама, либо принимает решение по найму, которое потом нельзя объяснить юристам.
Покажу, как это лечится каскадом из трех уровней моделей с дорогой в конце, тремя защитными слоями и реальными цифрами до и после — на живой коллекции пойманных фабрикаций.
Миграция с Managed Spark в Kubernetes — это не перенос кода, а проектирование отдельного управляемого compute-слоя, который стал частью ML-платформы: поддерживаемые base images, CI/CD, Airflow, Spark Operator, YuniKorn, секреты и observability.
В докладе покажу, как сделать запуск Spark-задач удобным для DE/ML-инженеров и сохранить управляемость в эксплуатации кластера.
MAGNIT TECH
Современные мощные серверные GPU по дефолту охлаждаются жидкостью. Расскажу, какие варианты возможны при создании вычислительного GPU-кластера или дата-центра для ИИ, а также какие выгоды получаем и чем расплачиваемся.
ТК СВЯЗЬ
• К какой архитектуре мы пришли, построив корпоративный ChatGPT-like сервис на 10К пользователей с DAU 1000+ на этапе разработки.
• Как в такой схеме реализовать практически любое бизнес-правило.
• С какими трудностями мы столкнулись и как решили их силами нашей команды.
Патчи — снижаем TTFT и E2E, интегрируем наши сервисы, реализуем кастомную логику.
Обновления базовых версий компонентов, как наложить патчи на сотни новых коммитов.
Как дать доступ всем и не положить модели нагрузкой.
• Что мы выяснили, пока ресерчили море опенсорса. Упор на инференс, к каким бэкендам и конфигурациям мы пришли.
• Реализация агента и как мы будим Jupyter-кернелы за 1-2 секунды, не давая им заснуть.
MAGNIT TECH
Пройдемся по двум упражнениям, которые помогали мне развивать observability.
Яндекс
Реальный опыт эволюции подхода управления централизованной конфигурацией проектов Gitlab, Hashicorp Vault и других в 2ГИС: от простых bash-скриптов до связки Terraform и Terragrunt.
Организация структуры конфигураций команд и групп, чтобы обрабатывать сотни проектов за минуты вместо часов.
2ГИС
Подводим итоги конференции, вспоминаем яркие моменты и рассказываем о дальнейших планах.