Değerlendirme hangi anı ölçüyor?
TutorMoments gerçek özel ders dökümlerini yeniden oynatıyor ve öğretmenin bir seçim yapmak zorunda olduğu anlarda duruyor: soruyu kolaylaştırıp öğrenciyi ilerletmek mi, yoksa öğrenciyi daha derin düşünmeye itmek mi. Veri kümesi Amerika Birleşik Devletleri'nde birebir matematik dersinden alınmış, kimliği gizlenmiş 462 dökümden oluşuyor; dersler ikinci ile yedinci sınıflar arasında. Toplam 27 öğretmen 1.500'den fazla kritik anı işaretledi; işaretlemeler 738 destekleme ve 260 derinleştirme anı içeriyor.[1]
Yedi model iki istemle sınandı: biri düz, öteki ölçülen ödünleşimi açıkça anlatan bir istem. İnsan öğretmenlerin aldığı skorlar da yayımlandı: destekleme için 0,458, derinleştirme için 0,182, aşırı desteklemeden kaçınma için 0,496. Üçüncü rakam işin zorluğunu gösteriyor, çünkü insan öğretmen de bu ölçekte yüksek puan almıyor.[1]
İstem skoru neden yükseltiyor?
Her model, ödünleşimi anlatan istemle düz isteme göre daha yüksek puan aldı. Ölçülen şeyin modele söylenmesi ölçümü yükseltiyorsa, skorun bir bölümü yönergenin özelliği oluyor; öğretmenlik yeteneğinin değil. Buna karşı ciddi bir açıklama var: açıklayıcı istem, gerçek bir öğretmenin hiç karşılaşmadığı bir belirsizliği ortadan kaldırıyor olabilir. O durumda düz istemin skoru kötümser sınır sayılır. İkisini ayırmanın yolu, yönergenin içeriğini değil yalnızca ayrıntı düzeyini değiştiren ara koşullar denemek.[1]
Bu çalışmanın kuramadığı şeyler de açık. Teknik rapor hakem denetiminden geçmedi ve bir dökümü yeniden oynatmak, gerçek öğrencilerle ileriye dönük bir deneme sayılmaz; hiçbir öğrenme çıktısı ölçülmüş değil. İşaretlemeler 27 öğretmenin kararına dayanıyor, yani ölçüt onların uzlaşısını temsil ediyor. Güveni artıracak iki adım belli: aynı anların bağımsız bir işaretleyici kümesiyle yeniden puanlanması ve modelin seçiminin öğrencinin bir sonraki adımını gerçekten değiştirip değiştirmediğini ölçen ileriye dönük bir çalışma. Ai2 veri kümesini ve kodu açık yayımladığı için ilk adım bugün atılabilir.[1]