Вычислительная инфраструктура

AI Accelerators

Ускорители: GPU, TPU, NPU

новинкаНовое или быстро растущее направление

Направления: Инженерия ИИ · Распределённый ML

Чем специализированный чип отличается от универсальной и когда эта разница окупается.

Ключевые тезисы

  • NPU — чип под : массивы MAC-блоков, целочисленная арифметика, низкое энергопотребление на ватт.
  • TPU строится вокруг систолического массива и рассчитан на большие матричные операции в обучении и .
  • универсальнее всех: любая новая архитектура запускается на нём сразу, а на NPU — после портирования и .

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

ЧипУстройствоСильная сторонаОграничение
тысячи ядер + Tensor Coresуниверсальность, любой фреймворкэнергопотребление и цена
TPUсистолический массивбольшие матричные операции, обучениеэкосистема и доступность
NPUмассивы MAC-блоков, INT8 на устройстве, вычисления на ваттузкий набор поддерживаемых операций

NPU выигрывает там, где модель фиксирована и её нужно выполнять много раз при жёстком энергобюджете: телефон, камера, промышленный контроллер. Обучать на нём обычно нельзя, а новая архитектура требует конвертации и — и часть операций может не поддерживаться вовсе.

На практике

Практическое правило: обучение и эксперименты — на , массовый известной модели — там, где дешевле по совокупной стоимости; для граничных устройств это почти всегда NPU.

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Вычислительная инфраструктура» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Обучение на GPU

GPU Architecture85%

Архитектура GPU · Вычислительная инфраструктура

Тысячи простых ядер, сгруппированных в мультипроцессоры, и иерархия памяти, в которую упирается почти любое ускорение.

GPU in PyTorch85%

GPU в PyTorch · Вычислительная инфраструктура

Как проверить доступность ускорителя, разложить тензоры по устройствам и понять, куда ушла видеопамять.

Distributed Training85%

Распределённое обучение · Вычислительная инфраструктура

Как разложить обучение на несколько GPU: копиями модели по данным, шардами состояния или разрезанием самой модели.

Collective Operations85%

Коллективные операции · Вычислительная инфраструктура

AllReduce, Broadcast, AllGather — примитивы, которыми процессы обучения обмениваются тензорами.

Cluster Networking85%

Сеть кластера · Вычислительная инфраструктура

Топология соединений и скорость обмена, которые определяют, доедет ли обучение до линейного ускорения.

Training Throughput85%

Ускорение обучения · Вычислительная инфраструктура

Что делать, когда число GPU фиксировано: снизить точность, накопить градиент, пересчитать активации, разгрузить загрузчик данных.

Mixed Precision85%

Смешанная точность · Оптимизация обучения

Обучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.

Batch size85%

Размер батча · Оптимизация обучения

Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.

Тема в работе целиком

Разбор архитектуры, где эта тема — один из кирпичей: требования, развилки, цифры и режимы отказа.

Следующий шагТема в работе: Тяжёлый трансформер в продСквозной разбор архитектуры, где эта тема — один из кирпичей: требования, бюджет, развилки и режимы отказа.Перейти →

Глава «Вычислительная инфраструктура» последний раз правилась . Нашли ошибку — напишите.