Открытие конференции
Говорим о расписании, сессиях и делимся информацией.
Новые доклады публикуем каждую неделю, не пропустите обновления.
Говорим о расписании, сессиях и делимся информацией.
В докладе рассматривается путь от эксплуатации с помощью ИИ к самоуправляемой инфраструктуре: уровни автономности, агентные контуры управления, динамические песочницы, операционная безопасность, верификация и меняющаяся роль человека-оператора.
MWS Cloud Platform
Нейросети и LLM часто воспринимаются как неприступная «магия», но на деле их периметр защищен слабее классических IT-систем.
G-HACK
Пути, карты и надежность. Как уже сегодня сделать так, чтобы ваши сервисы были доступны на 100%? Практики SRE и что такое CRE: как в облаке и на земле обеспечить доступность и отказоустойчивость сервисов (а не только инфраструктуры).
Yandex Cloud
Миграция с Managed Spark в Kubernetes — это не перенос кода, а проектирование отдельного управляемого compute-слоя, который стал частью ML-платформы: поддерживаемые base images, CI/CD, Airflow, Spark Operator, YuniKorn, секреты и observability.
В докладе покажу, как сделать запуск Spark-задач удобным для DE/ML-инженеров и сохранить управляемость в эксплуатации кластера.
MAGNIT TECH
Важно не только внедрить харденинг, но и постоянно проверять, что он действительно применяется на всех хостах и не «уезжает» со временем. В докладе я расскажу, как мы полностью автоматизировали этот процесс: от формирования эталона и динамического инвентаря до проверок через Ansible, метрик в Prometheus и визуализации в Grafana.
MWS Cloud Platform
Доклад показывает, как построить масштабируемую систему динамических тестовых окружений и избавиться от проблем с общими стендами. Слушатели узнают, какие технологии и архитектурные решения позволяют ускорить разработку, тестирование и проверку изменений.
Blackhub games
Покажу, как построить каскадный деплой на FluxCD и не распространять ошибочное изменение сразу на все окружения. Разберу два подхода: GitOps promotion через Kargo.io и Gitless-доставку через OCI artifacts, а также Prometheus gates как механизм stop/go-решений между dev, stage и production.
Mindbox
За прикладным уровнем AI-систем — MLOps, моделями и инференсом — стоит платформа, которую нужно заставить работать: Kubernetes, операционная система, драйверы NVIDIA и весьма капризное серверное железо. На примере реальных расследований из эксплуатации GPU-кластеров на базе Talos Linux покажу, как искать причины сложных проблем на стыке этих слоев — и почему реальная причина часто оказывается совсем не там, где ее ждешь.
Т-Банк
Опишу, как мы создавали у себя DevOps Cookbook. Что это такое в нашем понимании, как мы пришли к тому, что он нам необходим.
Как мы перешли от «стены текста» к боту-помощнику. И наши планы на будущее.
Райффайзен Банк
Пройдемся по двум упражнениям, которые помогали мне развивать observability.
Яндекс
Как устроены наши отказоустойчивые K8s-кластера в инфраструктуре, как мы автоматизировали их управление через CAPI на масштабах сотен серверов.
MWS Cloud Platform
Сравним возможности ArgoCD и Flux, kubectl, Helm и Nelm/werf в упорядочивании развертывания, отслеживании готовности и управлении жизненным циклом ресурсов.
Флант
Самые горячие вопросы из трендов найма от интервьюеров из бигтеха. Приходите пропитаться инженерной культурой и освежить знания!
judies.tech
Доклад о построении большой «железной» инфраструктуры и о том, как мы в K2 Cloud прошли путь в этой сфере от полного хаоса до стандартизированной, но в то же время гибкой системы, которая позволяет быстро адаптироваться под динамичный темп развития облачной платформы.
K2 Cloud
К вам пришла ML-команда: «LLM'ка отвечает в контейнере, теперь отдайте ее пользователям и поддерживайте».
Разберем, что норовит пойти не так по дороге в заветный продакшен: веса и GPU, первый токен, ключи и доступы, обновления, метрики и аварии. И как со всем этим справиться с наименьшими потерями.
Впрод
Доклад осветит онбординг, механизмы обучения, передачи знаний, используемые технологии и условия труда. Вы сможете узнать о том, чем вы платите за привилегии и «печеньки».
История внедрения DORA-метрик: от их декомпозиции и формулирования ценности до результатов внедрения и разбора ошибок.
Контур
Как обновление Cluster API чуть не уничтожило наши кластера — как митигировали, что поменяли и как работаем дальше.
MWS Cloud Platform
Расскажем, с какими сложностями столкнулись, покажем, как превратили хаос в управляемую систему: что пошло не так на старте, какие инструменты реально сработали и как мы измеряли эффект.
2ГИС
2ГИС
Доклад — практический опыт масштабирования, observability политик и awareness вокруг них, — чтобы каждая команда понимала, что происходит в ее кластере, не дожидаясь инцидента.
MWS Cloud Platform
Расскажу, как импортозамещение NGFW в банке превратилось в пересборку сетевой модели production Kubernetes: namespace-level доступы, миграция в облако и отказ от привычной модели авторизации трафика.
Точка
Командный воркшоп, где вы тушите боевой инцидент в реальном времени — по механикам настолок.
МТС Банк
В крупной IT-организации данные о системах, API, командах, владельцах и интеграциях часто разрознены между порталами, репозиториями, документацией и чатами. Это замедляет поиск информации, усложняет архитектурные решения и повышает риски изменений.
В докладе я расскажу, как Middleware Service Hub превращает разрозненные данные в связанный технологический контекст, развивается от каталога компонентов к Digital Twin организации и становится основой для Architecture as Code, API governance и AI Harness.
Райффайзен Банк
• К какой архитектуре мы пришли, построив корпоративный ChatGPT-like сервис на 10К пользователей с DAU 1000+ на этапе разработки.
• Как в такой схеме реализовать практически любое бизнес-правило.
• С какими трудностями мы столкнулись и как решили их силами нашей команды.
Патчи — снижаем TTFT и E2E, интегрируем наши сервисы, реализуем кастомную логику.
Обновления базовых версий компонентов, как наложить патчи на сотни новых коммитов.
Как дать доступ всем и не положить модели нагрузкой.
• Что мы выяснили, пока ресерчили море опенсорса. Упор на инференс, к каким бэкендам и конфигурациям мы пришли.
• Реализация агента и как мы будим Jupyter-кернелы за 1-2 секунды, не давая им заснуть.
MAGNIT TECH
Хотите почувствовать себя в роли DevVibeOps — тогда вам ко мне! :)
Collabo
Доклад строится на двух частях: сетевая изоляция зараженной инфраструктуры и то, как ее делать инженерам. И куда бежать, если надо разворачивать новую инфраструктуру.
Kaspersky
Реальный опыт эволюции подхода управления централизованной конфигурацией проектов Gitlab, Hashicorp Vault и других в 2ГИС: от простых bash-скриптов до связки Terraform и Terragrunt.
Организация структуры конфигураций команд и групп, чтобы обрабатывать сотни проектов за минуты вместо часов.
2ГИС
Рассмотрим на практике популярные open-source инструменты, которые позволяют улучшить безопасность Kubernetes в Runtime.
Luntry
Расскажу, как мы переносили Kafka с VM в Kubernetes.
Mindbox
Каждое второе входящее резюме врет (17 лет опыта в Kubernetes при том, что ему 12), а нейросеть, которая это ловит, либо разоряет на счетах, либо врет сама, либо принимает решение по найму, которое потом нельзя объяснить юристам.
Покажу, как это лечится каскадом из трех уровней моделей с дорогой в конце, тремя защитными слоями и реальными цифрами до и после — на живой коллекции пойманных фабрикаций.
Подводим итоги конференции, вспоминаем яркие моменты и рассказываем о дальнейших планах.