Чем специализированный чип отличается от универсальной и когда эта разница окупается.
Ключевые тезисы
- NPU — чип под : массивы MAC-блоков, целочисленная арифметика, низкое энергопотребление на ватт.
- TPU строится вокруг систолического массива и рассчитан на большие матричные операции в обучении и .
- универсальнее всех: любая новая архитектура запускается на нём сразу, а на NPU — после портирования и .
Подробный разбор
| Чип | Устройство | Сильная сторона | Ограничение |
|---|---|---|---|
| тысячи ядер + Tensor Cores | универсальность, любой фреймворк | энергопотребление и цена | |
| TPU | систолический массив | большие матричные операции, обучение | экосистема и доступность |
| NPU | массивы MAC-блоков, INT8 | на устройстве, вычисления на ватт | узкий набор поддерживаемых операций |
NPU выигрывает там, где модель фиксирована и её нужно выполнять много раз при жёстком энергобюджете: телефон, камера, промышленный контроллер. Обучать на нём обычно нельзя, а новая архитектура требует конвертации и — и часть операций может не поддерживаться вовсе.
Практическое правило: обучение и эксперименты — на , массовый известной модели — там, где дешевле по совокупной стоимости; для граничных устройств это почти всегда NPU.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Вычислительная инфраструктура» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Обучение на GPU
GPU Architecture85%
Архитектура GPU · Вычислительная инфраструктураТысячи простых ядер, сгруппированных в мультипроцессоры, и иерархия памяти, в которую упирается почти любое ускорение.
GPU in PyTorch85%
GPU в PyTorch · Вычислительная инфраструктураКак проверить доступность ускорителя, разложить тензоры по устройствам и понять, куда ушла видеопамять.
Distributed Training85%
Распределённое обучение · Вычислительная инфраструктураКак разложить обучение на несколько GPU: копиями модели по данным, шардами состояния или разрезанием самой модели.
Collective Operations85%
Коллективные операции · Вычислительная инфраструктураAllReduce, Broadcast, AllGather — примитивы, которыми процессы обучения обмениваются тензорами.
Cluster Networking85%
Сеть кластера · Вычислительная инфраструктураТопология соединений и скорость обмена, которые определяют, доедет ли обучение до линейного ускорения.
Training Throughput85%
Ускорение обучения · Вычислительная инфраструктураЧто делать, когда число GPU фиксировано: снизить точность, накопить градиент, пересчитать активации, разгрузить загрузчик данных.
Mixed Precision85%
Смешанная точность · Оптимизация обученияОбучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
Batch size85%
Размер батча · Оптимизация обученияЧисло объектов на одно обновление весов: влияет на скорость, память и качество обобщения.
Разбор архитектуры, где эта тема — один из кирпичей: требования, развилки, цифры и режимы отказа.
Глава «Вычислительная инфраструктура» последний раз правилась . Нашли ошибку — напишите.