AI ready: почему дата-центр для ИИ сложнее обычного модульного ЦОДа
Локальный AI-контур объединяет инженерную инфраструктуру, вычислительные ресурсы и прикладные сервисы искусственного интеллекта. На уровне идеи такая система выглядит логичным развитием модульного ЦОДа: есть контейнер, стойки, электропитание, охлаждение и мониторинг. Однако при установке GPU-серверов привычный подход быстро перестаёт работать.
Главная причина - существенно более высокая плотность мощности. Если стандартная стойка в модульном ЦОДе обычно потребляет 5-20 кВт, то для AI ready-модуля расчётный диапазон составляет 32-45 кВт. Базовой точкой пилотного проекта выбраны 40-42 кВт на стойку. Такой уровень соответствует конфигурациям с ускорителями класса H100 и H200, предназначенными для обучения и инференса крупных моделей.
МЦОД и AI ready: разные исходные условия
Классический модульный ЦОД обычно проектируют от ИТ-задачи к инженерной инфраструктуре. Сначала определяют необходимое количество стоек и серверов, затем рассчитывают электропитание, охлаждение, резервирование и мониторинг.
Для AI ready последовательность иная. Вначале необходимо оценить тепловыделение GPU, выбрать способ отвода тепла, определить сценарии отказов и обслуживания, а уже затем согласовать инженерные решения с фактической ИТ-нагрузкой.
| Параметр | Стандартный МЦОД | AI ready-модуль |
|---|---|---|
| Логика проектирования | От количества стоек и ИТ-ёмкости | От теплового баланса, мощности и отказоустойчивости |
| Нагрузка на стойку | В среднем 5-20 кВт | Около 32-45 кВт |
| Электропитание | Один или два ввода 0,4 кВ, A/B - опционально | Обязательная схема A/B до каждой стойки, резервирование 2N |
| Охлаждение | Воздушное, холодные и горячие коридоры | Гибридное: жидкостное плюс воздушное |
| Компоновка | Типовые машинный и электротехнический отсеки | Пространство с трубопроводами, подпольем, сервисными проходами |
| Мониторинг | Основные инженерные параметры | Связанный контроль энергии, холода, протечек, АКБ, PDU и стоек |
Иными словами, AI ready - это не просто контейнер с более мощными серверами. Это инженерная система, в которой вычислительная нагрузка напрямую определяет требования к энергетике, охлаждению, планировке и эксплуатации.
Почему GPU меняют требования к охлаждению
Обычные серверы преимущественно охлаждаются воздушным потоком. Для умеренной плотности это решение остаётся эффективным и относительно простым в эксплуатации. Но при мощности стойки в 40 кВт и выше воздушная схема становится сложнее: увеличиваются объёмы воздуха, требования к вентиляторам, шуму, распределению потоков и резервированию климатического оборудования.
Поэтому для AI ready рассматривается водо-воздушная схема. Основную нагрузку принимает жидкостное охлаждение - In-Rack или Direct-to-Chip. Тепло от наиболее горячих компонентов отводится непосредственно к теплоносителю. Воздушный контур при этом сохраняется, но используется главным образом для охлаждения вспомогательных элементов, инженерных систем и остаточного тепловыделения.
Такой подход требует предусмотреть не только чиллеры и теплообменники. В проекте появляются насосные группы, трубопроводы, запорная арматура, датчики протечек, узлы регулирования и сценарии аварийного переключения. Каждый дополнительный элемент становится частью цепочки отказоустойчивости.
Электропитание: резервировать нужно не только серверы
Для обычного МЦОДа схема A/B может применяться в зависимости от требований конкретной площадки. В AI ready резервирование питания до каждой стойки становится базовым условием. Причина заключается не только в стоимости GPU-серверов, но и в характере вычислительных задач.
Потеря питания во время обучения крупной модели может привести к остановке длительного вычислительного процесса, потере части результатов и необходимости повторного запуска. При инференсе отказ отдельной стойки способен нарушить работу прикладного сервиса и увеличить задержки для пользователей.
Кроме серверов, необходимо отдельно проверить питание систем охлаждения. Если ИТ-оборудование подключено по схеме 2N, но насосы, чиллеры или автоматика зависят от единственной линии, фактическая отказоустойчивость модуля будет ниже заявленной.
Аккумуляторные батареи и эксплуатационные ограничения
При подборе ИБП обычно в первую очередь считают требуемое время автономной работы. Для AI ready этого недостаточно. Важны также масса батарейных шкафов, температурный режим, вентиляция, срок службы, возможность поэлементного мониторинга и доступность замены компонентов.
Высокая плотность мощности увеличивает токовые нагрузки и тепловыделение в электротехническом помещении. Следовательно, аккумуляторные батареи и силовое оборудование также становятся частью теплового баланса. Их нельзя рассматривать как изолированный элемент энергосистемы.
Кроме того, контейнерная компоновка ограничивает пространство для обслуживания. Если батарейные модули, распределительные устройства или силовые шкафы установлены слишком плотно, регламентные работы могут потребовать остановки соседнего оборудования.
Компоновка должна учитывать обслуживание
В стандартном модульном ЦОДе часто используют типовую планировку: машинный зал, электротехническое помещение, стойки, проходы и оборудование кондиционирования. В AI ready этого недостаточно.
Необходимо заранее заложить:
- трассы жидкостного контура;
- зоны подключения и отключения стоек;
- подпольное пространство или верхние инженерные каналы;
- ширину проходов для замены GPU-серверов;
- места для временного размещения оборудования;
- доступ к фильтрам, насосам, теплообменникам и узлам автоматики;
- защиту от протечек и конденсата.
Сервисный сценарий нужно проверять ещё до изготовления модуля. Важно понимать, сможет ли инженер заменить сервер, насос или силовой компонент без демонтажа соседних систем. Для высокоплотной инфраструктуры ремонтопригодность - не вторичный параметр, а одно из исходных требований проекта.
Мониторинг: от отдельных датчиков к единой картине
В обычном ЦОДе можно контролировать температуру, влажность, состояние ИБП, электропитание и работу кондиционеров раздельно. Для AI ready такой подход создаёт риск пропустить взаимосвязь между событиями.
Нужен единый контур наблюдения, который сопоставляет:
- потребление каждой стойки;
- температуру на входе и выходе;
- параметры жидкостного контура;
- давление и расход теплоносителя;
- состояние насосов и теплообменников;
- наличие протечек;
- нагрузку на ИБП и PDU;
- состояние аккумуляторных батарей;
- работу серверов и GPU;
- изменение микроклимата в помещении.
Например, рост температуры GPU может быть вызван не неисправностью сервера, а снижением расхода теплоносителя. Увеличение потребления стойки способно привести к перегрузке распределительного устройства или нарушить расчётный баланс охлаждения. Поэтому данные должны анализироваться совместно, а система - предупреждать об отклонениях до возникновения аварии.
Расчётные сценарии пилота
В рамках пилотного AI ready-модуля проверяются несколько вариантов нагрузки. Нижний сценарий связан с менее плотными конфигурациями на базе A100 или L40S. Такие решения подходят для умеренных задач обучения, инференса и разработки.
Основной сценарий ориентирован на H100 и H200 с плотностью около 40-42 кВт на стойку. Верхняя граница позволяет оценить запас по электропитанию, охлаждению и резервированию. Дополнительно рассматриваются конфигурации следующего поколения, включая более производительные ускорители, условно обозначаемые как B200.
Такой диапазон нужен не для того, чтобы заранее выбрать единственную конфигурацию. Он позволяет проверить, насколько универсальным получится модуль и где находятся реальные пределы его инженерной инфраструктуры.
Пять выводов по итогам проектирования
Первый вывод: AI ready нельзя получить простым усилением стандартного МЦОДа. Изменяется сама логика разработки - проект начинается не со стоек, а с тепловой и энергетической модели.
Второй вывод: жидкостное охлаждение становится практически обязательным при высокой плотности GPU. Воздушная схема может использоваться как вспомогательная, но не всегда способна самостоятельно отвести требуемый объём тепла.
Третий вывод: отказоустойчивость должна охватывать весь контур. Резервировать нужно не только вводы и ИБП, но и насосы, автоматику, теплообменники, каналы связи и системы управления.
Четвёртый вывод: AI-интегратор не может автоматически отвечать за инженерную инфраструктуру. Даже качественно настроенные серверы не обеспечат стабильную работу, если модуль неправильно рассчитан по питанию, холоду или сервисному доступу.
Пятый вывод: практический пилот важнее теоретической архитектуры. Многие решения невозможно полноценно проверить на схемах: реальные температуры, шум, доступ к оборудованию, поведение автоматики и удобство обслуживания проявляются только на работающем объекте.
Открытые вопросы
Финальная конфигурация AI ready-модуля пока не утверждена. В ходе разработки предстоит уточнить предельную плотность стойки, оптимальный состав жидкостного контура, требования к качеству теплоносителя и сценарии перехода на резервное охлаждение.
Отдельного внимания требуют эксплуатационные процессы. Необходимо определить периодичность обслуживания, порядок замены GPU-серверов, процедуру локализации протечки и правила работы при частичной деградации инженерных систем.
Остаётся и вопрос масштабирования. Один модуль можно спроектировать как автономный объект, но при объединении нескольких блоков понадобится согласовать общие энергосети, систему охлаждения, диспетчеризацию и управление вычислительными ресурсами.
Главный результат проектирования уже очевиден: AI ready - это самостоятельный класс инфраструктуры. Внешне он похож на модульный ЦОД, но внутри требует иной последовательности расчётов, более плотной интеграции инженерных систем и постоянного контроля взаимосвязей между вычислениями, энергией и теплом. Именно поэтому создание локального контура для ИИ нельзя свести к установке GPU-серверов в готовый контейнер.


