BTC $79,731.75 +0.44%
ETH $2,456.52 +0.19%
BNB $764.50 +7.02%
XRP $1.41 +0.64%
SOL $102.77 +1.48%
TRX $0.3330 +1.24%
DOGE $0.0877 +3.23%
ADA $0.2164 +1.39%
BCH $249.48 -0.79%
LINK $11.86 +2.16%
HYPE $85.19 +0.64%
AAVE $130.06 -0.43%
SUI $0.8008 +6.79%
XLM $0.1834 +1.94%
ZEC $1,010.54 +2.87%
BTC $79,731.75 +0.44%
ETH $2,456.52 +0.19%
BNB $764.50 +7.02%
XRP $1.41 +0.64%
SOL $102.77 +1.48%
TRX $0.3330 +1.24%
DOGE $0.0877 +3.23%
ADA $0.2164 +1.39%
BCH $249.48 -0.79%
LINK $11.86 +2.16%
HYPE $85.19 +0.64%
AAVE $130.06 -0.43%
SUI $0.8008 +6.79%
XLM $0.1834 +1.94%
ZEC $1,010.54 +2.87%
first_img

Google заявила, что стоимость памяти для серверов AI упала на 75%, и предложила стратегию двойного подхода к программному и аппаратному обеспечению

2026-09-02 10:17:35

Сообщение ChainCatcher, форум по памяти SEMICON Taiwan 2026 пройдет 1 числа. Старший директор по инфраструктуре цепочки поставок Google Cloud, входящей в Alphabet, Нихил Чериан отметил, что с распространением многомодальных и смешанных экспертных архитектур вычисления ИИ перешли от ограничений по вычислительной мощности к ограничениям по памяти, высокопроизводительная память уже составляет более 75% стоимости аппаратного обеспечения AI-серверов. Столкнувшись с ограничениями по емкости, пропускной способности и потреблению энергии, Google преодолевает узкие места в памяти AI с помощью стратегии двойного трека программного и аппаратного обеспечения, включая распределение нагрузки для вывода и обучения, а также алгоритмы без потерь.

Google применяет стратегию распределения нагрузки в аппаратной архитектуре, выпуская TPU 8i для вывода с низкой задержкой и TPU 8t, специализированный для сверхмасштабного обучения. TPU 8i оснащен 288 ГБ высокочастотной памяти, объем SRAM на чипе увеличен в 3 раза до 384 MiB, что позволяет разместить динамическое состояние диалога и кэш ключей внутри чипа, достигая нулевой задержки вне чипа. TPU 8t формируется из 9600 чипов, образующих сверхбольшой вычислительный кластер, HBM с совместным пулом достигает 2 PB, устраняя узкие места передачи данных вне чипа, в сочетании с технологией TPU Direct Storage.

Google разработал алгоритм без потерь TurboQuant, который позволяет сжать кэш ключей больших моделей с 32 бит до 3 бит, уменьшая использование памяти в 6 раз без потери точности, что обеспечивает ускорение вычислений внимания в 8 раз, внедряя технологии интеграции старого поколения DRAM для продления жизненного цикла компонентов.

app_icon
ChainCatcher Building the Web3 world with innovations.