Bellek duvarını aşmak için Google, TPU 8i'ye 288 GB HBM koydu ve önbelleği 3 bite indirdi
Google Cloud tedarik zinciri altyapısı kıdemli direktörü Nikhil Cherian, SEMICON Taiwan 2026 bellek zirvesinde yapay zekâ altyapısının işlem sınırlı bir düzenden bellek sınırlı bir düzene geçtiğini söyledi. Cherian'a göre yüksek başarımlı bellek, bir yapay zekâ sunucusunun donanım parça listesinin yüzde 75'inden fazlasını oluşturuyor. Şirketin yanıtı iki ayrı yonga ve bir sıkıştırma yöntemi: çıkarım için 288 GB HBM taşıyan TPU 8i, eğitim için 9.600 yongayı tek havuzda toplayan TPU 8t ve anahtar-değer önbelleğini 32 bitten 3 bite indiren TurboQuant.
Yapay Zekâ··Akşam
Sunucu parça listesinde bellek payı, Cherian'a göre yüzde 75'i aştı
Google Cloud tedarik zinciri altyapısı kıdemli direktörü Nikhil Cherian, SEMICON Taiwan 2026 bellek zirvesinde büyük modellerin, çok kipli sistemlerin, uzman karışımı mimarilerin ve eylemci yapay zekânın altyapıyı işlem sınırlı bir düzenden bellek sınırlı bir düzene taşıdığını söyledi. Cherian'ın anlatımında yüksek başarımlı bellek, bir yapay zekâ sunucusunun donanım parça listesinin yüzde 75'inden fazlasını oluşturuyor; kapasite, bant genişliği, gecikme ve güç tüketimi ölçeklenmenin önündeki darboğaz. Uzman karışımı modeller ağırlıkları tutmak için geniş HBM kapasitesi istiyor; eylemci yapay zekâ uslamlama akışlarını uzatıyor ve anahtar-değer önbelleği bağlam uzunluğuyla, çok turlu diyalogla birlikte büyüyor. Cherian, pahalı işlem yongalarının bellek beklediği durumların ortaya çıkabildiğini, bu sırada elde tutulan işlem kapasitesinin tümüyle kullanılamadığını söyledi.[1], [2]
Eğitim ve çıkarım ayrı TPU'lara bölündü
Google, bellek duvarını aşmak için donanımda özelleşmeyi ve yazılımda eniyileştirmeyi birlikte kullanıyor; eğitim ve çıkarım yüklerini ayrı tasarlanan tensör işleme birimlerine dağıtıyor. Çıkarım için tasarlanan TPU 8i, HBM kapasitesini 288 GB düzeyine, yonga üstü SRAM'i 384 MiB düzeyine çıkarıyor; amaç anlık konuşma durumunu ve anahtar-değer önbelleğini yonga içinde tutmak, veriyi dış belleğe gönderip geri almanın gecikmesini azaltmak. TPU 8t ise çok büyük ölçekli eğitim için 9.600 yongayı tek bir kümede birleştiriyor; bellek havuzlaması toplam HBM ölçeğini yaklaşık 2 PB düzeyine çıkarıyor ve buna TPU doğrudan depolama eşlik ediyor. Bu donanım rakamlarının tümü Google'ın kendi bildirimi; bağımsız bir ölçüm yayımlanmadı.[1], [2]
Önbellek, TurboQuant ile 32 bitten 3 bite iniyor
Google, yazılım tarafında modeli yeniden eğitmeden çalışan bir nicemleme yöntemi olan TurboQuant'ı geliştirdi; yöntem büyük dil modelinin çalışma belleğini 32 bitten 3 bite indiriyor. Şirket, bellek kullanımının altı kata varan oranda azaldığını, dikkat mekanizmasının hesabının sekiz kat hızlandığını ve doğruluk kaybı yaşanmadığını bildiriyor; bu hızlanma rakamları da bağımsız olarak ölçülmedi. Cherian, çıkarım talebinin ileride eğitimi geçeceğini söyledi: yapay zekâ kurumsal ürünlere, tüketici hizmetlerine ve eylemci uygulamalara yayıldıkça veri merkezlerinin kesintisiz çıkarım vermesi gerekiyor. Şirket ayrıca mevcut sunucu parçalarını geri dönüştürüyor ve kendi arayüz ile sistem teknolojileriyle DDR4 gibi eski kuşak belleği yeni yapay zekâ sunucularına yeniden takmayı deniyor. TrendForce'un kendi öngörüsü tabloyu gider tarafından tamamlıyor: DRAM ile NAND flash bellek, bulut sağlayıcılarının sermaye harcamasının 2026'da yüzde 47'sini, 2027'de yüzde 68'ini oluşturuyor; aynı öngörüde sunucu DRAM sözleşme fiyatları 2026 için yaklaşık yüzde 270, kurumsal SSD fiyatları yaklaşık yüzde 235 artıyor.[1], [2]