Вычислительная инфраструктура

Cluster Networking

Сеть кластера

актуальноТекущий рабочий стандарт

Направления: Инженерия ИИ · Распределённый ML

Топология соединений и скорость обмена, которые определяют, доедет ли обучение до линейного ускорения.

Ключевые тезисы

  • Fat-tree — иерархия коммутаторов с одинаковой суммарной полосой на каждом уровне: любая пара узлов общается без узкого места.
  • InfiniBand и RoCE дают RDMA — обмен идёт напрямую между памятью узлов, минуя ядро ОС.
  • Внутри узла карты соединяет NVLink; он на порядок быстрее сети, поэтому процессы стараются группировать по узлам.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

В обычном дереве узлы соединены каналами одинаковой скорости, поэтому чем ближе к корню, тем сильнее сужение: все нижние узлы делят один канал наверх. Fat-tree убирает это сужение — на каждом уровне суммарная пропускная способность вверх равна суммарной полосе вниз, и любая пара узлов может общаться на полной скорости независимо от остальных.

  • Non-blocking: произвольная перестановка «каждый с каждым» проходит без конкуренции за каналы — именно то, что делает AllReduce на сотнях узлов предсказуемым.
  • InfiniBand / RoCE дают RDMA: данные идут из памяти в память, минуя ядро ОС и копирования.
  • NVLink и NVSwitch соединяют карты внутри узла на скорости в разы выше сетевой.
  • Topology-aware placement: процессы одной задачи стараются разместить в одном узле или стойке, чтобы обмен шёл по быстрым каналам.
На практике

того, что кластер упёрся в сеть: время шага растёт при увеличении числа узлов, хотя вычислительная часть на карту не изменилась. Проверяется прогоном синтетического AllReduce (nccl-tests) без обучения.

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Вычислительная инфраструктура» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Обучение на GPU

GPU Architecture85%

Архитектура GPU · Вычислительная инфраструктура

Тысячи простых ядер, сгруппированных в мультипроцессоры, и иерархия памяти, в которую упирается почти любое ускорение.

AI Accelerators85%

Ускорители: GPU, TPU, NPU · Вычислительная инфраструктура

Чем специализированный чип отличается от универсальной видеокарты и когда эта разница окупается.

GPU in PyTorch85%

GPU в PyTorch · Вычислительная инфраструктура

Как проверить доступность ускорителя, разложить тензоры по устройствам и понять, куда ушла видеопамять.

Distributed Training85%

Распределённое обучение · Вычислительная инфраструктура

Как разложить обучение на несколько GPU: копиями модели по данным, шардами состояния или разрезанием самой модели.

Collective Operations85%

Коллективные операции · Вычислительная инфраструктура

AllReduce, Broadcast, AllGather — примитивы, которыми процессы обучения обмениваются тензорами.

Training Throughput85%

Ускорение обучения · Вычислительная инфраструктура

Что делать, когда число GPU фиксировано: снизить точность, накопить градиент, пересчитать активации, разгрузить загрузчик данных.

Mixed Precision85%

Смешанная точность · Оптимизация обучения

Обучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.

Batch size85%

Размер батча · Оптимизация обучения

Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.

Кому эта тема нужна

Спрашивают на собеседовании: YADROИнфраструктура обучения.

Тема в работе целиком

Разбор архитектуры, где эта тема — один из кирпичей: требования, развилки, цифры и режимы отказа.

Следующий шагТема в работе: Обучение, когда данные не влезают в узелСквозной разбор архитектуры, где эта тема — один из кирпичей: требования, бюджет, развилки и режимы отказа.Перейти →

Глава «Вычислительная инфраструктура» последний раз правилась . Нашли ошибку — напишите.