Bir sorgudan bütün arama akışına

Bir arama ajanının işi yalnızca doğru kelimeleri yazmakla bitmiyor. İlk sonuçlar zayıfsa sorguyu değiştirmesi, sözcük aramasıyla vektör araması arasında seçim yapması ve yeterli bilgiye ulaştığında durması gerekiyor. AWS’nin SageMaker AI örneği bu kararların tamamını aynı eğitim döngüsüne alıyor. Qwen3.6-27B ile çalışan ajan, bütün arama dizisinin sonunda ilk on sonucun sıralama kalitesine göre ödüllendiriliyor. Tur veya belirteç bütçesini aşarsa eksi bir ödül alıyor. Geliştiricinin tasarladığı ödül böylece hem neyin bulunacağını hem de aramanın nerede biteceğini etkiliyor.[1]

AWS’nin BrowseCompPlus tablosunda bu sonlandırma kararı özellikle görünür. Şirketin ölçümünde bütçeyle ilişkili başarısız işlemler yüzde 22,89’dan yüzde 0,68’e inerken nDCG@10 puanı 0,5136’dan 0,6354’e çıkıyor. Ortalama tur sayısı da 7’den 6,3’e düşüyor. Başarısız işlemin sıralama puanı sıfır sayıldığı için daha çok aramanın tamamlanması, bulunan belgeler hiç değişmese bile ortalama puanı yükseltebilir. Pratikte değerli olan, kullanılabilir sonuca ulaşmak; bakım ekibinin bilmesi gereken ise bu kazanımın hangi karardan geldiği.[1]

Bence geliştiriciye açılan önemli kapı, arama kalitesiyle işlem disiplinini aynı ajan üzerinde ayarlayabilmek. Ancak sonuçların en az iki makul açıklaması var. Eğitim daha iyi sorgular ve araç seçimleri öğretiyor olabilir; bütçe cezası da zaten işe yarayan aramaları taşmadan bitirmeyi öğretiyor olabilir. Eğitim verilerinin görevlere uyumu bu iki etkiyi ayrıca değiştirebilir. Bu yüzden toplam puanın yanında başarılı işlemlerdeki sıralama kalitesini ve bütçe nedeniyle yarıda kalan işlemleri ayrı izlemek, hangi davranışın gerçekten geliştiğini daha anlaşılır kılar.[1]

Göreve göre değişen durma sınırı

Diğer görevler, tek bir durma politikasının her yerde aynı sonucu vermediğini gösteriyor. AWS’nin WixQA puanı 0,5725’ten 0,6781’e yükseliyor ama ortalama tur sayısı 4,3’ten 4,5’e çıkıyor. Wands’ta da puan artarken turlar 2,2’den 2,9’a yükseliyor. FreshStack’te ise daha az turla birlikte puan 0,4112’den 0,4089’a hafifçe geriliyor. Daha kısa işlem ile daha iyi sonuç arasında görevden göreve değişen bir tercih var. Her aramayı aynı tur sınırına sıkıştırmak, bazı görevlerde ek aramanın sağladığı değeri kesebilir.[1]

Burada bakım işi sorgu metninden değerlendirme katmanına kayıyor. Geliştirici araçları ve ödülü tanımlarken SageMaker eğitim işlerini, eşzamanlı denemeleri ve kesintiden devam etmeyi yönetiyor; MLflow işlem izlerini inceleme olanağı veriyor. İzlerde aracın seçimi, yeni sorgu ve sonlandırma kararı birlikte okunmalı. Model aynı adla kalsa da eğitim sonrasında davranışı değişiyor; kazancı yalnızca bir yönlendirme katmanına yazmak yanıltıcı olur. Ödülün pahalı ama yararlı aramaları cezalandırıp cezalandırmadığını bulmak, yeni sistemin ayar işlerinden biri.[1]

Ben bu ajanı devralan küçük bir ekibin ilk denemesini dar tutardım: kendi işlerinden aynı sorular, aynı araçlar ve aynı tur bütçesiyle eğitim öncesi ve sonrası iki sürüm. Sıralama puanının yanına tamamlanan işlem oranı, harcanan belirteç, gecikme ve insanın düzeltmek zorunda kaldığı sonuçlar konmalı. AWS’nin tabloları bu son inceleme yükünü ölçmüyor. Deneyin amacı tek bir kazanan puan seçmekten çok, ek aramanın hangi görevde maliyetini hak ettiğini bulmak olmalı. Arama ajanına nerede duracağını öğretmek, geliştiriciye bu sınırı kendi işi için yeniden belirleme sorumluluğunu da veriyor.[1]