Küçük model, büyük iddia: Laguna S 2.1

Poolside'ın duyurusunu okurken beni durduran parametre sayısı değildi; 118 milyar parametrenin yalnızca yaklaşık 8 milyarının her jetonda çalışması oldu. Şirket üç yıldır esas olarak devlet ve savunma müşterilerine kodlama modeli satıyordu; şimdi ağırlıkları Hugging Face'te OpenMDW-1.1 lisansıyla açıyor, chat.poolside.ai'de girişsiz deneme sunuyor ve eğitimi dokuz haftadan kısa sürede bitirdiğini söylüyor. Kendi paylaştığı — henüz bağımsız doğrulanmamış — rakamlara göre Terminal-Bench 2.1'de yüzde 70,2, SWE-Bench Multilingual'de yüzde 78,5 alıyor.[1]

İtiraf edeyim: beni asıl ikna eden bu sayılar değil, mimari seçim. Her jetonda 118 milyarın sekizde birini çalıştırmak, 'daha büyük model' yerine 'daha iyi yönlendirilmiş model' bahsi. Model katmanı metalaşıyor, değer yukarı taşınıyor — bu sefer taşıyan da küçük bir laboratuvar oluyor.[1]

Google'ın hızlı katmanı, yavaş amiral gemisi

Aynı gün Google üç model çıkardı: jeton kullanımını yüzde 17'ye kadar düşüren Gemini 3.6 Flash, sınıfının en ucuzu Gemini 3.5 Flash-Lite ve yalnızca hükümetlere sınırlı pilotla açılan güvenlik açığı avcısı Gemini 3.5 Flash Cyber. Ama amiral gemisi Gemini 3.5 Pro Şubat'tan beri güncellenmedi; Logan Kilpatrick ekibin modeli ortaklarla test ettiğini ve 'yakında gelmesini' umduklarını söyledi, Bloomberg ise gecikmeyi Google'ın kendi performans hedeflerini tutturamamasına bağlamıştı.[2]

16 Temmuz'da model katmanının metalaştığını yazmıştım.[3]

19 Temmuz'da ajan katmanının gerçekten ucuzladığını savundum.[4]

Current AI gelişmesini de 20 Temmuz'da bu çerçevede değerlendirdim.[5]

Bugün aynı dersi iki laboratuvar iki yönden veriyor: biri küçük kalıp akıllı yönlendirerek, diğeri amiral gemisini bekletip iş atlı katmanı hızla göndererek. Sıradaki testim aynı kalıyor — açık ağırlıklı Laguna S 2.1'in bir ay içinde üç ayrı açık kaynak projesinde uyarlanıp uyarlanmadığına bakacağım; kazanç gerçekten mimariyse, orada da görünmesi gerekir.[1], [2]