Aynı Soru Farklı Sözcüklerle Sorulunca Büyük Dil Modelleri TutarsızlaşıyorSame Question, Different Answers: Evaluating LLM Reliability Beyond AccuracyHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummaryYazarlar, dört kıyaslama ve 13 model üzerinde büyük dil modellerinin (LLM) soru yalnızca yeniden ifade edildiğinde doğru ve yanlış cevaplar arasında sık sık gidip geldiğini gösteriyor. Toplam doğruluk oranı yalnızca mütevazı bir şekilde değişse de, örnek düzeyinde tutarsızlık oranları %23'ü aşıyor. |
Neden ÖnemliWhy it mattersBir modelin cevabı kararlı bilgiye değil de yüzeysel ifadelere bağlıysa, tek seferlik doğruluk kıyaslamaları gerçek dünya güvenilirliğini abartır. Kullanıcıların sorguları doğal olarak yeniden ifade ettiği her devreye alma senaryosunda bu durum kritik önem taşır. Bu bulgu, değerlendirme hatlarında doğruluğun yanı sıra tutarlılık metriklerinin de kullanılmasını gerektirir. Bilginin genellikle mevcut olduğu ancak tutarsız bir şekilde geri getirildiği gözlemi, salt mimari değişiklikler yerine çıkarım anında uygulanabilecek pratik çözümlere işaret ediyor. |
Öne ÇıkanlarHighlights
|
EleştiriCritical take%23'lük rakam bir ortalama değil, bir üst sınırdır ('%23'ü aşan'). Çalışma, doğruluğun ikili olduğu alanlara, yani olgusal soru-cevap ve matematiksel akıl yürütmeye sınırlıdır. Bu nedenle, açık uçlu üretimde görünecek olan kararsızlık burada daha keskin görünür. Ayrıca, yeniden ifadelerin gerçekten anlamı koruduğunu garanti etmek de başlı başına kolay değildir. Kendi kendine yeniden ifadeleme düzeltmesinin yalnızca kısmi olduğu açıkça belirtilmiştir; bu da çekirdek düzeydeki geri getirme tutarsızlığını çözmekten uzaktır. |