Раздел 26

Compute Infrastructure

Вычислительная инфраструктура

GPU и специализированные ускорители, распределённое обучение, сеть кластера и приёмы, которые превращают недели обучения в дни. Место, где качество модели упирается не в идею, а в пропускную способность памяти.

Что означают метки тем
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

AI Acceleratorsновинка

Ускорители: GPU, TPU, NPU

Чем специализированный чип отличается от универсальной видеокарты и когда эта разница окупается.

GPU Architectureактуально

Архитектура GPU

Тысячи простых ядер, сгруппированных в мультипроцессоры, и иерархия памяти, в которую упирается почти любое ускорение.

GPU in PyTorchактуально

GPU в PyTorch

Как проверить доступность ускорителя, разложить тензоры по устройствам и понять, куда ушла видеопамять.

Capacity Planningактуально

Планирование инфраструктуры

Облако, свой сервер или аренда — выбор, который делают до первой строчки кода и переигрывают дорого. Считается не ценой железа, а полной стоимостью владения.

Backups and Redundancyактуально

Резервирование и бэкапы

RAID защищает от отказа диска, бэкап — от ошибки человека. Это разные задачи, и подмена одного другим обнаруживается в худший момент.

GPU Inferenceновинка

GPU-инференсиз «Системный дизайн ML-сервисов»

Как выжать из видеокарты пропускную способность и не переплачивать.

Distributed Trainingновинка

Распределённое обучение

Как разложить обучение на несколько GPU: копиями модели по данным, шардами состояния или разрезанием самой модели.

Collective Operationsактуально

Коллективные операции

AllReduce, Broadcast, AllGather — примитивы, которыми процессы обучения обмениваются тензорами.

Cluster Networkingактуально

Сеть кластера

Топология соединений и скорость обмена, которые определяют, доедет ли обучение до линейного ускорения.

Infrastructure as Codeактуально

Инфраструктура как код

Конфигурация серверов и кластера описывается файлами в репозитории, а не последовательностью команд в чужой памяти. Разница видна, когда кластер надо поднять второй раз.

Scalingактуально

Масштабированиеиз «Системный дизайн ML-сервисов»

Горизонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.

Kubernetesактуально

Kubernetesиз «MLOps»

Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.

Training Throughputактуально

Ускорение обучения

Что делать, когда число GPU фиксировано: снизить точность, накопить градиент, пересчитать активации, разгрузить загрузчик данных.

Distillationновинка

Дистилляцияиз «Генеративный ИИ»

Обучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.

Mixed Precisionактуально

Смешанная точностьиз «Оптимизация обучения»

Обучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.

Batch sizeактуально

Размер батчаиз «Оптимизация обучения»

Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.

Pruningактуально

Прунингиз «Глубокое обучение»

Удаление наименее значимых весов, каналов или голов внимания из уже обученной сети ради скорости инференса.

Distributed Hyperparameter Searchактуально

Распределённый подбор гиперпараметров

Десятки обучений на кластере вместо одного: пространство поиска, параллельные trials, ранняя остановка безнадёжных.

Hyperparameter tuningактуально

Настройка гиперпараметровиз «Практика ML»

Поиск конфигурации модели по валидационной метрике — последний, а не первый шаг работы.

Experiment Trackingактуально

Трекинг экспериментовиз «MLOps»

Фиксация параметров, метрик, артефактов и версии кода для каждого запуска.

9 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.