Tek model, iki koşu
Thomson Reuters'ın kendi yürüttüğü Deep Research değerlendirmesinde aynı model iki kez ölçüldü. Yalnızca web erişimiyle çalıştığında Thomson'ın olgusal doğruluğu 0,53'te kaldı; GPT-5.4 aynı koşulda 0,65 aldı. Şirketin kendi içeriğine erişim açıldığında Thomson 0,83'e çıktı, GPT-5.4 ise 0,82'de kaldı.[1]
Bir geliştirici için bu iki koşu, tek bir puanın içinde birbirine karışan iki ayrı şeyi ayırıyor: modelin genel yeteneği ve uzanabildiği arşiv. Değerlendirme ekibinden Andrew Bean de kazancın, kendi araçları üzerinde eğitilip alıştırma yapabilmekten geldiğini söylüyor. Yine de bu okumanın tek açıklama olmadığını belirtmek gerekir; iki koşuda arama arayüzü de değişmiş olabilir, dolayısıyla farkın bir bölümü arşivin kendisinden değil, kuruma özel araçların tasarımından geliyor olabilir.[1]
Yapım kararının bilançosu
Harcamanın dağılımı da öğretici. Personel ve işlem gücü olarak 2 yılı aşkın sürede yaklaşık 40 milyon dolar gitti; son eğitim koşusunun kendisi 450.000 dolar tuttu. Temel, Alibaba'nın açık Qwen3.5-397B modeli. Snowdon adlı ara sürüm, güvenlik, etik ve siyasi tarafsızlık için Imperial College ile birlikte yeniden eğitildi. Eğitim, Westlaw, Practical Law, Checkpoint ve Reuters arşivlerine dayanıyor ve yüzlerce tam zamanlı alan uzmanı sürece katıldı.[1]
Teknoloji yöneticisi Joel Hron ile araştırma başkanı Jonathan Schwartz, öndeki bir modeli ince ayardan geçirmek yerine bu yolu seçmelerini üç gerekçeye bağlıyor: ince ayarın genel yeteneği aşındırma eğilimi, sağlayıcının çıkarım giderlerine bağlanmak ve zamanla biriken bir varlığa sahip olmak. Model şimdilik tek bir yerde çalışıyor: CoCounsel Legal içindeki Tabular Analysis özelliğinde, yani küçük ve ucuz bir modelin ekonomik olarak anlamlı olduğu belge inceleme işinde. Bu, bu köşede 15 Ağustos'ta savunulan ölçüye uyuyor: bir geliştirici için belirleyici sayı, ilan edilen belirteç fiyatı yerine belirtilen çaba düzeyinde tamamlanan görev başına giderdir.[1], [2]
Dışarıdan sınanabilecek olan
Genel ölçütlerde tablo daha sade. Stanford LegalBench'te Thomson 0,823 alıyor ve Gemini 3.1 Pro ile GPT-5.5'in gerisinde kalıyor; Harvey Legal Agent ölçütünde Opus 4.8'in hemen arkasında duruyor. Bean, modeli diğerlerinin menzili içinde ama henüz lider değil diye tanımlıyor. Bu sayıların tamamı şirketin kendi testlerinden geliyor. Şirket ayrıca elindeki içeriğin yüzde 10'undan azını kullandığını söylüyor.[1]
Bu yüzden asıl sınav, planlanan açık sürümde. Şirket küçük bir sürümü ticari olmayan bir lisansla Hugging Face'te yayımlamayı düşünüyor. Eğer o sürüm 30 Kasım 2026'ya kadar yayımlanır ve dışarıdan yapılan bağımsız değerlendirmeler onu arşive erişim olmadan bildirilen LegalBench düzeyine yakın bulursa, kazancın büyük bölümünü arşivin taşıdığı okuması güçlenir. Değerlendirmeler modeli tek başına belirgin biçimde daha yukarıda gösterirse, ağırlığın eğitim yönteminde olduğu sonucuna varmak gerekir.[1]