Compute Infrastructure
Вычислительная инфраструктура
GPU и специализированные ускорители, распределённое обучение, сеть кластера и приёмы, которые превращают недели обучения в дни. Место, где качество модели упирается не в идею, а в пропускную способность памяти.
Что означают метки тем
AI Acceleratorsновинка
Ускорители: GPU, TPU, NPUЧем специализированный чип отличается от универсальной видеокарты и когда эта разница окупается.
GPU Architectureактуально
Архитектура GPUТысячи простых ядер, сгруппированных в мультипроцессоры, и иерархия памяти, в которую упирается почти любое ускорение.
GPU in PyTorchактуально
GPU в PyTorchКак проверить доступность ускорителя, разложить тензоры по устройствам и понять, куда ушла видеопамять.
Capacity Planningактуально
Планирование инфраструктурыОблако, свой сервер или аренда — выбор, который делают до первой строчки кода и переигрывают дорого. Считается не ценой железа, а полной стоимостью владения.
Backups and Redundancyактуально
Резервирование и бэкапыRAID защищает от отказа диска, бэкап — от ошибки человека. Это разные задачи, и подмена одного другим обнаруживается в худший момент.
GPU Inferenceновинка
GPU-инференсиз «Системный дизайн ML-сервисов»Как выжать из видеокарты пропускную способность и не переплачивать.
Distributed Trainingновинка
Распределённое обучениеКак разложить обучение на несколько GPU: копиями модели по данным, шардами состояния или разрезанием самой модели.
Collective Operationsактуально
Коллективные операцииAllReduce, Broadcast, AllGather — примитивы, которыми процессы обучения обмениваются тензорами.
Cluster Networkingактуально
Сеть кластераТопология соединений и скорость обмена, которые определяют, доедет ли обучение до линейного ускорения.
Infrastructure as Codeактуально
Инфраструктура как кодКонфигурация серверов и кластера описывается файлами в репозитории, а не последовательностью команд в чужой памяти. Разница видна, когда кластер надо поднять второй раз.
Scalingактуально
Масштабированиеиз «Системный дизайн ML-сервисов»Горизонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.
Kubernetesактуально
Kubernetesиз «MLOps»Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.
Training Throughputактуально
Ускорение обученияЧто делать, когда число GPU фиксировано: снизить точность, накопить градиент, пересчитать активации, разгрузить загрузчик данных.
Distillationновинка
Дистилляцияиз «Генеративный ИИ»Обучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
Mixed Precisionактуально
Смешанная точностьиз «Оптимизация обучения»Обучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
Batch sizeактуально
Размер батчаиз «Оптимизация обучения»Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.
Pruningактуально
Прунингиз «Глубокое обучение»Удаление наименее значимых весов, каналов или голов внимания из уже обученной сети ради скорости инференса.
Distributed Hyperparameter Searchактуально
Распределённый подбор гиперпараметровДесятки обучений на кластере вместо одного: пространство поиска, параллельные trials, ранняя остановка безнадёжных.
Hyperparameter tuningактуально
Настройка гиперпараметровиз «Практика ML»Поиск конфигурации модели по валидационной метрике — последний, а не первый шаг работы.
Experiment Trackingактуально
Трекинг экспериментовиз «MLOps»Фиксация параметров, метрик, артефактов и версии кода для каждого запуска.
9 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.