Google cho biết chi phí bộ nhớ máy chủ AI đã giảm 75%, thúc đẩy chiến lược phần mềm và phần cứng song song
Tin tức từ ChainCatcher, Diễn đàn đỉnh cao bộ nhớ SEMICON Đài Loan 2026 sẽ diễn ra vào ngày 1, Giám đốc cao cấp cơ sở hạ tầng chuỗi cung ứng Google Cloud thuộc Alphabet, Nikhil Cherian, chỉ ra rằng, với sự phổ biến của kiến trúc đa mô hình và chuyên gia hỗn hợp, tính toán AI đã chuyển từ giới hạn sức mạnh tính toán sang giới hạn bộ nhớ, bộ nhớ hiệu năng cao đã chiếm hơn 75% chi phí danh sách vật liệu phần cứng của máy chủ AI. Đối mặt với các nút thắt về dung lượng, băng thông và tiêu thụ năng lượng, Google đã vượt qua nút thắt bộ nhớ AI thông qua chiến lược song song phần mềm và phần cứng như phân luồng phần cứng cho suy luận và đào tạo, thuật toán lượng tử không mất mát.
Google đã áp dụng chiến lược phân luồng trong kiến trúc phần cứng, ra mắt TPU 8i dành cho suy luận độ trễ thấp và TPU 8t chuyên về đào tạo quy mô lớn. TPU 8i được trang bị bộ nhớ băng thông cao 288 GB, dung lượng SRAM trên chip tăng gấp 3 lần lên 384 MiB, đưa trạng thái đối thoại động và bộ nhớ cache khóa vào bên trong chip, đạt được độ trễ bằng không bên ngoài chip. TPU 8t thông qua 9600 chip tạo thành cụm tính toán siêu lớn, với bể chia sẻ HBM đạt quy mô 2 PB, loại bỏ nút thắt truyền dữ liệu bên ngoài chip, kết hợp với công nghệ TPU Direct Storage.
Google đã phát triển thuật toán lượng tử không mất mát TurboQuant không cần đào tạo, nén bộ nhớ cache khóa của mô hình lớn từ 32 bit xuống 3 bit, giảm 6 lần chiếm dụng bộ nhớ mà không mất độ chính xác, mang lại tốc độ tính toán chú ý nhanh gấp 8 lần, áp dụng công nghệ tích hợp DRAM thế hệ cũ để kéo dài vòng đời linh kiện.






