Егор Андреев
Впрод
К DevOps/SRE-команде приходит ML-команда: «Модель выбрали, в контейнере отвечает. Теперь сделайте так, чтобы этим можно было пользоваться каждый день». Звучит привычно, но в LLM-инференсе быстро вылезают вещи, которых в обычном сервисе может и не быть.
Веса загружаются долго, GPU внезапно заняты, первый токен приходит слишком поздно, а новая версия модели не хочет запускаться на вчерашнем кластере. Потом появляются ключи, доступы, несколько команд и вопрос, кто заметит проблему до того, как пользователи начнут писать в чат.
Я расскажу, как принять такой прототип в эксплуатацию: что проверить до установки, какие метрики смотреть и какие аварии заранее предусмотреть. Пройдем путь от одного запущенного контейнера до сервиса, который можно обновлять, поддерживать и расследовать.
Поговорим и о границах: когда хватает простого регламента, а где уже пора идти в автоматизацию. В конце у слушателей будет чек-лист для первого запуска и понимание, где не стоит строить сложную платформу раньше времени.
Впрод