Fiyat listesi aynı, karar noktası yeni

Anthropic 24 Temmuz'da Claude Opus 5'i yayımladı ve modeli milyon giriş belirteci başına 5 dolar, milyon çıkış belirteci başına 25 dolar fiyatla sunuyor. Bu, Opus 4.8'in fiyatıyla aynı. Şirket modelin kendi üst modeli Claude Fable 5'in yeteneğine yarı fiyatla yaklaştığını söylüyor; model Claude.ai, API, Claude Code ve Claude Cowork üzerinden erişilebiliyor.[1]

Aynı duyuruda üç yeni denetim aracı var: bir çaba ayarı, konuşma ortasında araç değiştirme ve güvenlik sınıflandırıcısı devreye girdiğinde isteği başka bir modele yönlendiren otomatik geri dönüş. Son ikisi beta. Bence bir yazılım ekibi için asıl değişiklik burada: seçim artık tek bir istek için ne kadar çaba satın alınacağına dönüşüyor, hangi modelin çağrılacağına değil. Bunun aksi de mümkün — çaba ayarı, uzun süredir var olan örnekleme bütçesinin yeni bir adı olabilir ve iş akışında hiçbir şeyi değiştirmeyebilir.[1]

Ölçümlerin tamamı satıcıdan geliyor

Duyurudaki sayılar iddialı: Frontier-Bench v0.1'de diğer modellerin üzerine çıkıldığı ve Opus 4.8'in iki katı sonuç alındığı, CursorBench 3.2'de Fable 5'in yüzde 0,5'lik farkla altında kalındığı, ARC-AGI 3'te bir sonraki en iyi modelin üç katı puan alındığı belirtiliyor. Hepsi Anthropic'in kendi ölçümü; duyuruda bağımsız bir doğrulamaya yer verilmiyor.[1]

Sürüm numarasına dikkat etmek gerekiyor: Frontier-Bench v0.1, ilk sürümünde bir başarım kümesi. Bir modelin ilerlemesiyle o kümenin kurgusunu bu aşamada ayırmak zor, çünkü aynı görev seti ve aynı puanlama başka bir taraf tarafından henüz uygulanmadı. Aynı sorun gider iddiaları için de geçerli: yarı gider ya da üçte bir gider ifadeleri hem birim fiyatı hem de görev başına tüketilen belirteç sayısını içeriyor, ikisi ayrı ayrı verilmiyor. Elbette sonuçlar bağımsız çalışmalarda da tutabilir; o zaman bu itiraz düşer.[1]

Kontrol nereye gitti

Ayarın gerçekten ölçülebilir hale gelmesi için tek bir koşul yeterli: 31 Ekim 2026'ya kadar Anthropic dışında bir taraf, görev kümesini ve puanlama yöntemini sabit tutarak Frontier-Bench v0.1 veya CursorBench 3.2 sonuçlarını Opus 5 ile Anthropic dışı en az bir model üzerinde yayımlarsa, çaba ayarının getirdiği gider farkı sınanabilir bir sayıya döner. Böyle bir yayın çıkmazsa elimizde kalan, satıcı karşılaştırması olarak okunmalı.[1]

Bu arada otomatik geri dönüşün pratik bedeli şimdiden belli. Sınıflandırıcı devreye girdiğinde isteğin başka bir modele yönlendirilmesi hata mesajını ortadan kaldırıyor, ama yanıtı hangi modelin ürettiği sorusunu ekliyor. Yeniden üretilebilirliğe ihtiyaç duyan bir ekip için bunun karşılığı somut: her isteğin yanıtını hangi modelin verdiğini kendi tarafında tutmak, artık isteğe bağlı bir ayrıntı değil.[1]