Satıştan kaldırılan paket bir kapasite göstergesidir

OpenAI, ayda 200 dolarlık Pro paketine yeni abonelik alımını durdurdu. Ürün yöneticisi Thibault Sottiaux'nun verdiği gerekçe yük: 3 Eylül'de yayımlanan Astra modeline gelen talep altyapıyı zorluyor ve Pro katmanı sistemler üzerinde tüm katmanlar arasında en ağır yükü oluşturuyor. Uygulama programlama arayüzü erişimi ile daha ucuz Go ve Plus paketleri açık kaldı, mevcut Pro aboneleri erişimini koruyor.[1]

En pahalı pakette yeni aboneliği durdurup ucuz paketleri açık tutmak, sunum sınırına işaret eder; bir fiyatlama kararı bu biçimi almaz. Şirket, müşterisi hazır olan geliri almamayı seçiyor. Rakamın kendisi de dikkat ister: burada ölçülen, kurulu donanımın toplamı ya da duyurulmuş kapasite değil, bugün sunulabilen eşzamanlı istek sayısıdır.[1]

Aynı raflardan daha çok yanıt çıkarmanın iki yolu

Amazon SageMaker Inference'a eklenen önek duyarlı yönlendirme, aynı metinle başlayan istekleri aynı sunucuya gönderiyor ve o önek için önbelleğe alınmış anahtar-değer çiftlerini yeniden kullanıyor. AWS'nin yayımladığı ölçümlerde, 7 adet ml.p5.48xlarge sunucuda çalışan Llama 3.1 70B ile uzun bağlamlı işlerde ilk belirtece kadar geçen ortanca süre yüzde 71 ile yüzde 77 arasında düştü, önbellek isabet oranı yaklaşık yüzde 25'ten yüzde 82'ye çıktı ve aynı iş yükünde iş hacmi yüzde 15 ile yüzde 16 arttı. Sınır bellidir ve rakamlar sağlayıcının kendi ölçümleridir.[2]

Model önbelleği ikinci yoldan gidiyor. Amazon SageMaker HyperPod üzerinde model ağırlıkları düğümün yerel NVMe diskine önceden indiriliyor, çıkarım sunucusunun kapsayıcı görüntüsü bir bölme istemeden önce çekiliyor. AWS ölçek büyütmenin ağırlık önbelleğiyle yaklaşık yüzde 60 hızlandığını, okumaların yaklaşık 7 GB/s hızla yapıldığını ve 600 GB'ı aşan DeepSeek-R1 boyutundaki bir model için normalde 30 dakikayı geçen indirmenin ortadan kalktığını bildiriyor. Kazanılan şey hesap gücü değil, sunucunun iş yapmadan geçirdiği süredir.[3]

Bu üç gelişme tek bir niceliğin üzerinde çalışıyor: teslim edilen yanıt başına harcanan sunucu süresi. Önek duyarlı yönlendirme aynı öneki ikinci kez hesaplamayı, model önbelleği ise diskten indirme beklemesini bu paydadan çıkarıyor; OpenAI'nin durdurduğu paket ise aynı paydanın bölene yetmediği noktayı gösteriyor. Başka bir açıklama da mümkündür: Pro satışının durması ticari bir önceliklendirme olabilir, çünkü kurumsal arayüz müşterileri ile abonelik müşterileri aynı donanım havuzunu paylaşıyor olmak zorunda değil.[1], [2], [3]

Çıktı başına gider şimdiden ne gösteriyor?

OpenDesign Arena, 13 modeli ağ uygulamaları, panolar, mobil ekranlar ve açılış sayfaları üzerinde puanladı. GPT-6 Astra 82,7 puanla ilk sırada yer aldı ve tasarım başına 1,61 dolar ile 11,1 dakika harcadı; DeepSeek V4.1 Flash 81,2 puan alırken tasarım başına 0,023 dolar ve 5,3 dakika harcadı. Puan farkı 1,5; dakika farkı iki kattan fazla.[4]

Bu tutarlar sıralamanın ödediği liste fiyatlarıdır, yani alıcının ödediğini ölçer; sağlayıcının kendi gideri görünmez kalır. Dakika sütunu farklı bir şey söylüyor: o süre, bir çıktı için tutulan sunucunun gerçek meşguliyetidir ve fiyatlandırma politikasından bağımsızdır. Bir sağlayıcının kapasitesi ne kadar sıkışırsa, bu sütun fiyat listesinden daha çok iş görür.[4]

Buradan izlenebilir bir eşik çıkıyor. OpenAI Pro aboneliğinin yeniden açılması için tarih vermedi; satışın 31 Aralık 2026'ya kadar yeniden açılması, sıkışan niceliğin eşzamanlı sunum kapasitesi olduğunu ve bu kapasitenin büyütülebildiğini gösterir. Aynı tarihe kadar açılmaması, sınırın hesap gücü tahsisinden daha derin bir yerde, bellek ya da bant genişliği tarafında durduğuna işaret eder. İzlenecek somut olay tektir: Pro paketinde yeni abonelik alımının 31 Aralık 2026'ya kadar yeniden açılıp açılmaması.[1]