Gartner, yapay zekâ ajanlarının kullanımı arttıkça çıkarım harcamasının yükseleceğini öngörüyor; TrendForce sıvı soğutmanın yaygınlaştığını, NVIDIA ise model dosyasını küçülten yöntemi duyurdu. Verim kazançları, yapay zekâ altyapısındaki giderleri yazılım, işlem gücü ve soğutma arasında kaydırıyor.
Yapay Zekâ··Öğle
Belirteç fiyatı düşerken eylemci faturası şişiyor
Computerworld'ün 17 Ağustos'ta aktardığı Gartner modeli öngörüyor: belirteç giderleri 2030'a kadar yüzde 95 düşecek, eylemci iş akışlarındaki çıkarım harcaması 2028'e kadar 5 katından fazla artacak. Analistler Will Sommer ve Sabine Zimmerhansl bunu, birim fiyat gerilerken tüketimin yükselmesini gizleyen bir belirteç yanılsaması olarak tanımlıyor. Gartner'ın sayıları piyasada gözlenen faturalar değil, kendi belirteç iktisadı modelinden çıkan öngörüler; şirket gelişmiş eylemcilerin görev başına giderini basit bir sohbet botunun 150 katına kadar çıkarıyor, orta ölçekli bir eylemci modelin eğitimini 2,5 kat, eylemci çıkarımını 5 kat pahalı buluyor. Model basit bir iş akışını çıkarım belirteci başına 0,05 dolar, özetlemeyi 0,10 dolar, karmaşık iş akışlarını 0,30 dolar ve planlama işini 0,40 dolar dolayında fiyatlıyor.[1]
Sıvı soğutma yonga kurulumlarının yarısını aşıyor
TrendForce 17 Ağustos'ta, sıvı soğutmanın 2026'da yapay zekâ yongası kurulumlarının yüzde 53'ünü kapsayacağını, 2025'teki yaklaşık yüzde 33'ten yükseleceğini ve 2027'de yüzde 60'a yaklaşacağını bildirdi. Araştırma şirketi geçişi, tek bir yonganın 1 kilowatt ısıl tasarım gücünü aşmasına bağlıyor; yüzdeler bildirilmiş sevkiyatlar değil, TrendForce'un kendi tahminleri. Raf ölçeğindeki sistemler artık yüzlerce kilowatt çekiyor; şirket NVIDIA'nın raf ölçeğindeki sevkiyatlarının 2026'da ikiye katlanacağını öngörüyor ve Vera Rubin platformunun fansız, tümüyle sıvı soğutmalı bir tasarımla ağ kartlarına, optik modüllere ve güç sistemlerine kadar genişlediğini aktarıyor. AMD Helios rafını yılın ikinci yarısında çıkaracak; Google ise yapay zekâ sunucularının yüzde 80'inden fazlasında sıvı soğutmayı hâlihazırda kullanıyor.[2]
NVIDIA model dosyasını damıtarak küçültüyor
NVIDIA, Nemotron 3.5 Lightning modelinin NVFP4 sürümünü nicemleme farkındalıklı damıtmayla ürettiğini açıkladı; şirkete göre dosya 65,85 GB boyutundan 21,19 GB boyutuna iniyor ve verim 4 kat artabiliyor. Yöntem iki aşamalı: önce tam duyarlıklı öğretmen modelden eğitim sonrası nicemlemeyle düşük duyarlıklı bir öğrenci çıkarılıyor, sonra öğrenci donmuş öğretmene karşı KL ıraksaması kaybıyla eğitiliyor. Şirketin yayımladığı tablolara göre ara bir kontrol noktasında eğitim sonrası nicemleme yüzde 96,33 ortanca kurtarma verirken damıtmayla oran yüzde 99,72'ye çıkıyor; yayımlanan son sürümde daha temkinli nicemleme kullanılıyor ve ortanca kurtarma eğitim sonrası nicemlemede yüzde 99,24, damıtmada yüzde 98,97 oluyor. Damıtmanın kazancı Terminal-Bench v2.1 ve SWE-Bench Multilingual gibi eylemci ve kodlama başarımlarında toplanıyor; sayıların tümü NVIDIA'nın kendi ölçümleri ve bağımsız bir doğrulama yayımlanmadı.[3]