Google заявила, что стоимость памяти для серверов AI упала на 75%, и предложила стратегию двойного подхода к программному и аппаратному обеспечению
Сообщение ChainCatcher, форум по памяти SEMICON Taiwan 2026 пройдет 1 числа. Старший директор по инфраструктуре цепочки поставок Google Cloud, входящей в Alphabet, Нихил Чериан отметил, что с распространением многомодальных и смешанных экспертных архитектур вычисления ИИ перешли от ограничений по вычислительной мощности к ограничениям по памяти, высокопроизводительная память уже составляет более 75% стоимости аппаратного обеспечения AI-серверов. Столкнувшись с ограничениями по емкости, пропускной способности и потреблению энергии, Google преодолевает узкие места в памяти AI с помощью стратегии двойного трека программного и аппаратного обеспечения, включая распределение нагрузки для вывода и обучения, а также алгоритмы без потерь.
Google применяет стратегию распределения нагрузки в аппаратной архитектуре, выпуская TPU 8i для вывода с низкой задержкой и TPU 8t, специализированный для сверхмасштабного обучения. TPU 8i оснащен 288 ГБ высокочастотной памяти, объем SRAM на чипе увеличен в 3 раза до 384 MiB, что позволяет разместить динамическое состояние диалога и кэш ключей внутри чипа, достигая нулевой задержки вне чипа. TPU 8t формируется из 9600 чипов, образующих сверхбольшой вычислительный кластер, HBM с совместным пулом достигает 2 PB, устраняя узкие места передачи данных вне чипа, в сочетании с технологией TPU Direct Storage.
Google разработал алгоритм без потерь TurboQuant, который позволяет сжать кэш ключей больших моделей с 32 бит до 3 бит, уменьшая использование памяти в 6 раз без потери точности, что обеспечивает ускорение вычислений внимания в 8 раз, внедряя технологии интеграции старого поколения DRAM для продления жизненного цикла компонентов.






