2026-07-28
AI Kritik
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

Aynı Soru Farklı Sözcüklerle Sorulunca Büyük Dil Modelleri TutarsızlaşıyorSame Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Yazarlar, dört kıyaslama ve 13 model üzerinde büyük dil modellerinin (LLM) soru yalnızca yeniden ifade edildiğinde doğru ve yanlış cevaplar arasında sık sık gidip geldiğini gösteriyor. Toplam doğruluk oranı yalnızca mütevazı bir şekilde değişse de, örnek düzeyinde tutarsızlık oranları %23'ü aşıyor.

Neden ÖnemliWhy it matters

Bir modelin cevabı kararlı bilgiye değil de yüzeysel ifadelere bağlıysa, tek seferlik doğruluk kıyaslamaları gerçek dünya güvenilirliğini abartır. Kullanıcıların sorguları doğal olarak yeniden ifade ettiği her devreye alma senaryosunda bu durum kritik önem taşır. Bu bulgu, değerlendirme hatlarında doğruluğun yanı sıra tutarlılık metriklerinin de kullanılmasını gerektirir. Bilginin genellikle mevcut olduğu ancak tutarsız bir şekilde geri getirildiği gözlemi, salt mimari değişiklikler yerine çıkarım anında uygulanabilecek pratik çözümlere işaret ediyor.

Öne ÇıkanlarHighlights

  • Genel doğruluk oranı neredeyse hiç değişmese de, anlamı koruyan yeniden ifadeler altında örnek düzeyinde cevap değişim oranları %23'ü aşıyor.
  • Orijinal istemdeki doğruluk, güvenilirliğin zayıf bir göstergesidir. Başlangıçta doğru olan sorulara odaklanıldığında, cevap değişim oranlarının daha da yüksek olduğu görülüyor.
  • Çıkarım anında uygulanan basit bir kendi kendine yeniden ifadeleme stratejisi, gizli kalan bilgiyi kısmen geri getirir ve performansı iyileştirir.

EleştiriCritical take

%23'lük rakam bir ortalama değil, bir üst sınırdır ('%23'ü aşan'). Çalışma, doğruluğun ikili olduğu alanlara, yani olgusal soru-cevap ve matematiksel akıl yürütmeye sınırlıdır. Bu nedenle, açık uçlu üretimde görünecek olan kararsızlık burada daha keskin görünür. Ayrıca, yeniden ifadelerin gerçekten anlamı koruduğunu garanti etmek de başlı başına kolay değildir. Kendi kendine yeniden ifadeleme düzeltmesinin yalnızca kısmi olduğu açıkça belirtilmiştir; bu da çekirdek düzeydeki geri getirme tutarsızlığını çözmekten uzaktır.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue