Флот вырос с двух машин до полноценной облачной платформы, пережил три реальных инфраструктурных инцидента и ни разу не стал узким местом для роста команды ИИ — потому что рос вместе с нагрузкой, а не вдогонку ей.
У каждого продуктового направления команды ИИ — свои процессы, свои тесты, свой автоматический деплой. Но всё это работает на общей физической основе: виртуальных машинах, GPU-картах, сети и системе доставки изменений в Yandex Cloud. Когда объём работы команды ИИ растёт, эта основа обязана расти вместе с ней — иначе она либо не выдержит нагрузку и сломается в самый неподходящий момент, либо станет потолком, в который упрётся дальнейший рост.
Инфраструктура описана кодом, а не памятью человека, и проверяется автоматически при каждом изменении. Это единственный способ выдерживать растущую нагрузку без того, чтобы состояние «на бумаге» и реальность расходились тихо — именно так родились все три крупных инцидента этого проекта.
Значительная часть разработки и эксплуатации сейчас ведётся ИИ-агентами, а не только людьми. Флот специально дооснащён механизмами, которых обычному человеку-оператору не требуется вовсе — устойчивый доступ без личного ключа, живая (не устаревающая) документация, автоматические защитные проверки прямо внутри агентской сессии.
Собственные конфигурации, сервисы, автоматика и CI/CD-процессы наращивались постепенно и по факту реальных потребностей — от простого автостопа простаивающей видеокарты до полноценной модели резервирования на нескольких GPU с автоматическим переключением при отказе.
24.11.2025 — 22.04.2026. Первые пять месяцев — фундамент: инфраструктура-как-код, первый механизм экономии, полная смена платформы разработки и первая крупная система, построенная и доказанная на практике
Первые коммиты — сборка образа для GPU-машины и базовая конфигурация в Yandex Cloud. Флот на тот момент — 2 машины: управляющий узел и одна GPU-машина.
Автоматическая остановка GPU-машины при неактивности — самый первый инструмент контроля затрат, задавший паттерн, который потом воспроизводится весь год.
Все сценарии автоматизации переписаны с Windows на Linux — не косметика, а смена операционной основы, на которой строится вся дальнейшая работа.
Контроль здоровья сервисов, контроль бюджета облака, управление ключами доступа и проверки качества кода инфраструктуры (Terraform — язык, которым эта инфраструктура описана как код) собраны в единый конвейер.
Месяц работы — от первого прототипа до системы, которая на реальных данных обработала 500 задач со скоростью 340 задач в минуту на одной видеокарте без единого сбоя. Система доказана на практике.
За время работы флот пережил три по-настоящему критических момента — и в каждом система наблюдения сработала быстрее, чем об этом успел бы узнать хоть один клиент нашего API. Ниже — три случая, когда защита сработала так, как должна.
Автоматика заметила расхождение состояния управляющего сервера с ожидаемым и позволила быстро поднять его заново из ежедневного резервного снимка.
Общая видеокарта для двух сервисов ушла в нерабочее состояние — мониторинг зафиксировал это сразу, восстановление прошло по заранее подготовленному сценарию.
Одна из плановых инфраструктурных операций задела диск видеокарты — система резервного копирования позволила восстановить его без потери данных.
21.05 — 08.09.2026. Пятнадцать с половиной недель — от единичной системы резервирования GPU до систематической, постоянно работающей дисциплины оптимизации всего флота
Механизм распределения GPU-задач переписан заново под единую модель управления — вместе с полноценной архитектурной документацией.
Мы научились автоматически находить целый новый класс ошибок — расхождение между тем, что система сообщает интегратору (например время ожидания результата), и тем, что происходит по факту. Первое применение — сразу на новой видеокарте при подключении.
Репозиторий переходит на модель работы, где значительную часть разработки и эксплуатации ведут ИИ-агенты — с правилами, принудительно проверяемыми автоматически, раз нет штатной защиты веток для команды такого масштаба.
Модель резервирования видеокарт эволюционировала за месяц: сначала одна активная карта → добавлен второй воркер по требованию → автоматическое переключение при перегрузке → полное автоматическое резервирование при отказе.
Автоматические проверки полностью переведены на собственные вычислительные мощности команды вместо внешнего сервиса — заодно закрыт риск, найденный в мартовской утечке (сканирование секретов теперь обязательно для всей команды).
Плановая структура флота впервые полностью описана кодом. В те же два дня — системная проверка всего флота нашла около 40 реальных скрытых проблем: от пропущенных хостов при смене паролей до открытого наружу доступа на боевой машине.
Пилотный сервис, до этого существовавший вне общей инфраструктуры, впервые становится полноценной частью управляемого флота — со своим доменом, доступом к секретам и ежедневными резервными копиями.
Собрана полная таблица прогноза стоимости флота на месяц вперёд, формулы которой берут ставки напрямую из биллинга платформы — не оценка на глаз, а инструмент, которым можно пользоваться постоянно.
Мощность двух вспомогательных машин пересмотрена не на глаз, а по двум неделям живых замеров загрузки процессора и памяти — размер ресурса теперь соответствует тому, что реально используется.
Убраны лишние точки выхода в интернет на вычислительных узлах CI, а параметры системного узла подогнаны под недельный замер фактической загрузки — та же дисциплина «решение по факту, не по памяти», применённая к сети и CI-мощностям.
Без автоматики флот стоил бы в разы дороже — и продолжал бы дорожать вместе с ростом нагрузки. С автоматикой стоимость под контролем несмотря на рост.
Мы разработали собственный механизм сверки факта и ожидания — автоматически сравнивает, действительно ли карта выключается тогда, когда должна. Именно он нашёл резерв экономии на одной из карт:
Ещё три похожие находки за тот же период — та же системная практика, не разовая акция: забытый резервный сетевой адрес (435 ₽/мес), избыточные отдельные внешние адреса на вычислительных узлах (670 ₽/мес), лишние резервные снимки дисков сверх необходимого минимума (3 181 ₽/мес).
Всего ~10 постоянно объявленных машин + временный кластер проверок. Деление — не по «прод/дев» на уровне сети, а по уровню доверия: зона автоматических проверок и изолированная машина для внешних коллег не имеют маршрута к боевому контуру, даже находясь в общей облачной инфраструктуре.
GPU-машину можно пересоздать, перезагрузить или добавить новую, не трогая сервисы, которые от неё не зависят. Именно поэтому потеря диска одной карты в июле не задела остальной флот.
Код, ещё не прошедший проверку, исполняется отдельно от боевого контура и без публичного адреса. Проблема на этом узле не даёт прямого пути к боевым данным и клиентскому трафику.
Машина для работы с людьми вне команды физически не имеет маршрута к боевому контуру. Ошибка или инцидент на ней не может дотянуться до продуктовых сервисов, даже случайно.
Видеокарта поднимается за секунды под задачу и гасится, когда работы нет — без потери отзывчивости для клиента и без часов простоя вхолостую. Отсюда и разница в стоимости выше.
Флот использует возможности платформы целенаправленно, не ограничиваясь базовой арендой виртуальных машин:
Часть решений ниже вообще не имела бы смысла для человека-оператора — они закрывают ограничения, которые есть только у ИИ-агента.
Единый механизм выкладки изменений в бой — со встроенной проверкой здоровья и автоматическим откатом при сбое — сейчас использует часть продуктовых сервисов команды; остальные ведут собственный путь выкладки с той же целью, но без общего инструмента. Постепенный перевод оставшихся сервисов на единый механизм продолжается.
Продолжаем искать и устранять похожие скрытые издержки тем же системным методом, что уже показал результат.
Развиваем системы, удобные и совместимые с работой ИИ-агентов, — это направление становится только важнее по мере роста их доли в разработке и эксплуатации.
Повышаем стабильность и живучесть флота на случай внешних инцидентов — чтобы восстановление после сбоя облачного провайдера или сети было таким же быстрым и предсказуемым, как уже отработанное восстановление внутри самого флота.