Şirketin kendi tablosu
DeepSeek, genel denemeye açtığı V4-Flash-0731 için mimariyi ve parametre sayısını değiştirmediğini, sürümün bir eğitim ve eğitim sonrası iyileştirmesi olduğunu belirtti. Kendi yayımladığı ölçümlerde önizleme sürümüne göre Terminal Bench 2.1 61,8'den 82,7'ye, NL2Repo 39,4'ten 54,2'ye, Cybergym 38,7'den 76,7'ye, DeepSWE ise 7,3'ten 54,4'e çıkıyor. Aynı tabloda Claude Opus 4.8 için Terminal Bench 2.1 değeri 85,0; DSBench-FullStack'te Opus 4.8 71,6 puanda, DeepSeek'in yeni sürümü 68,7 puanda. Bu sayıların tamamı şirketin kendi ölçümü ve bağımsız bir değerlendirme henüz yok.[1]
Bir geliştirici için dürüst karşılaştırma noktası rakip model değil, aynı ağırlık ailesinin önizleme sürümü. O eksende dört sayının üçü birbirine benziyor: on beş ile otuz sekiz puan arası kazanç. DeepSWE'deki 7,3'ten 54,4'e geçiş bu desenin dışında duruyor ve tek başına kırk yedi puan taşıyor. Aynı mimari, aynı parametre sayısı ve aynı ölçüt üzerinde bu genlikte bir fark, açıklamanın adını koyduğu tek değişkenle, yani eğitim sonrası çalışmayla, kendiliğinden açıklanmıyor.[1]
Aynı sürümde değişen ikinci şey
Aynı sürüm, arayüz tarafında Responses biçimini doğrudan desteklemeye başladı ve Codex'e uyarlandı. Aracı ölçütlerinde puan yalnızca modelin ürettiği metinden çıkmıyor; araç çağrılarını taşıyan katmanın çağrıyı doğru biçimlendirip yanıtı geri verebilmesi de puana giriyor. Bu yüzden DeepSWE'deki genliğin bir kısmının, modelin yeteneğinden değil ölçüm düzeneğiyle uyumun düzelmesinden gelmiş olması akla yakın bir okuma. Buna karşı ileri sürülebilecek açıklama da güçlü: önizleme sürümü araç kullanımı için yeterince eğitilmemiş olabilir ve o durumda kırk yedi puan gerçek bir yetenek farkıdır.[1]
İki okumayı ayıran deney pahalı değil. Aynı araç katmanı, aynı görev kümesi ve aynı puanlama yöntemi sabit tutularak iki sürüm yan yana koşulduğunda, farkın ne kadarının düzenekten geldiği doğrudan görülür. Şirketin yayımladığı tablo bu koşulların hangisinin sabit tutulduğunu söylemiyor. Bir ölçüt puanı iş akışı sonucu değildir; hangi katmanın kazandırdığı belirlenmeden sayı, satın alma kararına dönüştürülebilecek bir bilgi taşımıyor.[1]
Fiyatın altındaki sayı
Fiyatlandırmada önbellek ıskası hâlinde milyon giriş belirteci başına 0,14 dolar, önbellek isabetinde 0,0028 dolar ve milyon çıkış belirteci başına 0,28 dolar açıklandı. Karşılaştırma olarak verilen değerler GPT-5.6 Sol için 5 dolar ve 30 dolar, Claude Fable 5 için 10 dolar ve 50 dolar, Claude Sonnet 5 için 3 dolar ve 15 dolar. Bu aralık, bir ekibin yeniden deneme bütçesini, geniş dallanmayı ve ikinci bir gözden geçirme turunu hesapta tutulabilir hâle getiriyor.[1]
Belirteç başına ücret ile tamamlanan görev başına maliyet aynı şey değil: ucuz bir model daha çok deneme, daha çok gözden geçirme ve daha çok hata kurtarma gerektirdiğinde aradaki fark kapanır. Bu ayrımı ölçecek işaret bağımsız bir değerlendirmede duruyor. 31 ekim 2026'ya kadar, araç katmanı açıklanmış bağımsız bir ölçüm Terminal Bench 2.1 sonucunu birkaç puan içinde yeniden üretirse kazanç model tarafındadır; sonuç belirgin biçimde düşük kalırsa düzenek uyumu açıklaması ağırlık kazanır.[1]