Дата-центр Z.AI на 1 ГВт без чипов Nvidia

Смена парадигмы на рынке аппаратного обеспечения

Создание масштабной вычислительной инфраструктуры для искусственного интеллекта традиционно ассоциировалось с продукцией одной американской компании. Однако китайская исследовательская лаборатория Z.AI, известная также как Zhipu AI, официально завершила развертывание нового центра обработки данных общей мощностью 1 ГВт. Главная техническая особенность этого объекта заключается в полном отсутствии аппаратных ускорителей от Nvidia. Вся архитектура построена исключительно на базе отечественных китайских полупроводниковых решений, что является важным прецедентом для всей технологической индустрии. Этот шаг свидетельствует о серьезных сдвигах в глобальной цепочке поставок высокотехнологичного оборудования.

Реализация такого проекта демонстрирует способность китайских инженеров проектировать, строить и вводить в эксплуатацию вычислительные кластеры сверхвысокой плотности в условиях жестких экспортных ограничений со стороны США. Дата-центр объединяет несколько автономных сегментов, каждый из которых содержит более 10 000 специализированных процессоров. Это позволяет компании обучать передовые модели с сотнями миллиардов параметров, обеспечивая необходимую пропускную способность и стабильный уровень синхронизации данных на аппаратном уровне. Успешный запуск такого комплекса доказывает, что альтернативные кремниевые экосистемы способны удовлетворять самые высокие требования индустрии искусственного интеллекта.

Экспортные ограничения как стимул для инноваций

В течение последних лет правительство США ввело ряд строгих экспортных ограничений, которые сделали невозможными поставки высокопроизводительных графических процессоров, таких как A100 или H100, на территорию Китая. Первоначально эти меры имели цель сдержать развитие китайского сектора машинного обучения. Вместо этого ограничения сработали как мощный стимул для внутренних инвестиций в разработку альтернативных архитектур. Компании были вынуждены пересмотреть свои стратегии и обратиться к внутренним ресурсам, что значительно ускорило развитие локальных технологических компаний.

Лаборатория Z.AI вместо попыток обойти санкции через серые схемы поставок, инвестировала ресурсы в создание инфраструктуры, которая полностью опирается на локальных поставщиков. Это решение позволило не только избежать рисков, связанных с логистикой иностранных компонентов, но и оптимизировать аппаратное обеспечение под конкретные задачи компании, связанные с тренировкой больших языковых моделей. Такой подход обеспечивает больший контроль над жизненным циклом оборудования и независимость от внешнеполитических факторов.

Инженерные решения гигаваттного масштаба

Проектирование центра обработки данных мощностью 1 ГВт требует решения беспрецедентных инженерных задач. Такой объем энергопотребления сопоставим с потребностями небольшого города. Для обеспечения стабильной работы инфраструктуры Z.AI интегрировала новейшие системы распределения питания и управления тепловыделением. Масштаб проекта потребовал разработки новых стандартов прокладки кабельных трасс и организации бесперебойного питания на уровне каждой отдельной серверной стойки.

Энергетическая инфраструктура и жидкостное охлаждение

Традиционные системы воздушного охлаждения не способны эффективно отводить тепло от стоек с высокой плотностью ИИ-ускорителей. Поэтому в новом дата-центре массово применяются технологии прямого жидкостного охлаждения. Специальный теплоноситель циркулирует непосредственно через радиаторы, установленные на процессорах, что позволяет поддерживать оптимальные температурные показатели даже при пиковых нагрузках. Это не только предотвращает перегрев, но и значительно продлевает срок службы кремниевых кристаллов.

Система питания построена по принципу глубокого резервирования. Использование интеллектуальных блоков распределения питания позволяет динамически перераспределять нагрузку между различными кластерами в зависимости от текущих задач, минимизируя потери электроэнергии и повышая общий показатель энергоэффективности PUE (Power Usage Effectiveness) объекта до рекордно низких значений.

Архитектура аппаратных кластеров

Основой вычислительной мощности системы стали китайские ускорители нейронных сетей. Аналитики рынка указывают на массовое использование процессоров серии Huawei Ascend 910B как наиболее вероятного базового компонента. Эти процессоры разработаны специально для задач глубокого машинного обучения, имеют тензорные ядра собственной архитектуры и являются прямыми конкурентами западных аналогов в сегменте тренировки больших массивов данных.

Сравнение архитектур масштабных дата-центров
Технический параметр Инфраструктура Z.AI Традиционные западные решения
Общая мощность 1 ГВт 100 — 500 МВт
Процессоров в кластере Более 10 000 8 000 — 16 000
Тип ускорителя Серия Ascend Серия H100 или H200
Сетевой протокол Оптимизированный RoCEv2 InfiniBand
Метод охлаждения Прямое жидкостное Воздушное или гибридное
Программный стек CANN и локальные фреймворки CUDA

Для эффективного объединения десятков тысяч чипов в единую вычислительную сеть инженеры отказались от закрытого протокола InfiniBand в пользу оптимизированной версии RoCEv2 (RDMA over Converged Ethernet). Это обеспечивает высокоскоростную передачу данных с минимальными задержками непосредственно в оперативную память соседних узлов в обход центрального процессора. Эта технология критически важна для минимизации времени ожидания во время распределенного обучения нейросетей.

Формирование независимой программной экосистемы

Аппаратное обеспечение является лишь фундаментом инфраструктуры. Исторически главным преимуществом решений Nvidia была экосистема CUDA, которая стала индустриальным стандартом. Для эффективного использования китайских чипов инженеры Z.AI должны были разработать и адаптировать мощный программный стек, способный переводить сложные математические операции на архитектуру отечественных тензорных ядер без потери производительности.

Адаптация среды CANN

Специалисты лаборатории интегрировали собственные решения с открытыми фреймворками и средой CANN (Compute Architecture for Neural Networks). Этот программный стек включает специализированные инструменты для автоматического распределения нагрузки между тысячами узлов, инновационные механизмы сжатия градиентов при синхронизации и умные системы изоляции неисправных сервисов.

Если во время обучения один из чипов выходит из строя, система способна изолировать его, перераспределить нагрузку на соседние узлы и продолжить процесс без полной остановки кластера. Результаты длительных стресс-тестов подтвердили, что инфраструктура способна работать стабильно в течение многих недель непрерывной экстремальной нагрузки, что необходимо для тренировки современных LLM.

Обучение моделей серии GLM

Вся эта гигантская инфраструктура построена с четкой целью — ускорение разработки и обучения языковых моделей серии General Language Model (GLM). Лаборатория Z.AI уже доказала конкурентоспособность своих алгоритмов, выпустив модели, которые по многим бенчмаркам приближаются к передовым западным аналогам. Наличие собственных вычислительных мощностей позволит компании значительно ускорить цикл выпуска новых версий.

Параллелизм на уровне конвейера

Использование кластеров на более чем 10 000 узлов позволяет резко сократить время тренировки моделей с более чем 500 миллиардами параметров. Увеличенная пропускная способность внутренней сети позволяет использовать большие размеры батчей и более эффективно параллелить вычисления как на уровне тензоров, так и на уровне конвейера (pipeline parallelism). Алгоритмы автоматически определяют оптимальный способ разбиения графа вычислений для максимальной загрузки каждого доступного ядра.

Успешный запуск обучающих сессий на новом дата-центре доказывает, что аппаратное отставание в сфере литографии частично компенсируется масштабными горизонтальными связями, продуманной архитектурой сети и глубокой оптимизацией программного кода под конкретные задачи.

Глобальные экономические последствия

Запуск вычислительного объекта такого масштаба без компонентов доминирующего американского поставщика имеет далеко идущие последствия для всей глобальной индустрии полупроводников. Это сигнал для других стран о возможности построения суверенной цифровой инфраструктуры.

  • Диверсификация рынка Успех проекта стимулирует другие крупные технологические компании инвестировать в собственные разработки процессоров, уменьшая зависимость от монополистов.
  • Стимулирование конкуренции Появление сильных игроков в сфере аппаратного обеспечения для ИИ заставит существующих лидеров снижать цены и ускорять инновации.
  • Новые отраслевые стандарты Опыт построения гигаваттных систем с жидкостным охлаждением и использованием RoCE-сетей формирует новые отраслевые стандарты проектирования дата-центров будущего.

В долгосрочной перспективе появление мощных альтернативных экосистем будет способствовать снижению цен на вычислительные мощности и дальнейшему совершенствованию архитектур ИИ-процессоров за пределами традиционных платформ. Проект Z.AI является лишь первым шагом в формировании биполярного мира в индустрии искусственного интеллекта, где доминирование одной архитектуры постепенно уходит в прошлое.

Источники:

Андрей Коннектов
Об авторе

Андрей Коннектов

Специалист по Wi-Fi и сверхскоростным сетям, следит за развитием стандартов связи.

0 Comments

Ответить

2500
Пожалуйста, введите комментарий
Пожалуйста, укажите ваше имя