No. 47
2026-09-04
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

Yapay zeka çıkarımlarında hukuki mantığın güvenilirliliği sınanıyorLegal logic reliability tested in AI inferences

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Makale, yapay zekâ tabanlı ayrıştırıcıların kanun metinlerinden çıkardığı biçimsel mantıksal çıkarımların, iki bağımsız ayrıştırıcı farklı sonuçlar verdiğinde geçerli kalıp kalmadığını test eden istatistiksel bir “hayatta kalma sertifikası” öneriyor. Yöntem, Monte Carlo yeniden oynatma ve Wilson güven aralıklarını kullanıyor. Ön kayıt altına alınmış bir test seti, Missouri ve Hindistan kanun verilerinde başarıyla sonuçlanıyor. Ancak gerçekçi bir küresel hata modeli altında, test setindeki bölümlerin %93,2’i bilgilendirme eşiğinin altında kalıyor. Bu durum, sertifikanın uygulamada kırılgan olduğunu gösteriyor.

Neden ÖnemliWhy it matters

Büyük dil modelleri (LLM) ve doğal dil işleme (NLP) hatları, insan okuyuculardan önce giderek daha fazla yasa metnini ayrıştırıyor. Bu nedenle, makine tarafından çıkarılan bir kuralın ne zaman güvenilir olduğunu bilmek, herhangi bir hukuk teknolojisi devreye almasının ön koşuludur. Makalenin temel katkısı yeni bir ayrıştırma yöntemi sunmak değil, niceliksel bir hata sınırı belirlemektir. Çalışma, pratiğe yönelik olarak mantığın nerede çözüldüğünü (bölümler arası kalibrasyon oranı aktarımı) net biçimde gösteriyor; genel geçer bir garanti sunmuyor. Bu yaklaşım, risk yönetimi odaklı hukuki yapay zekâ için değerli. Ancak tek bir hata modeli altında %93,2’lik eşik altı sonuç, sertifikayı bir onay işaretinden çok bir uyarı etiketine benzetiyor.

Öne ÇıkanlarHighlights

  • Missouri kanunları üzerinde çalışan iki bağımsız ayrıştırıcı, sayısal eşik varlığında %0,43 yanlış negatif oranıyla farklılaşıyor. Bu durum, somut bir gürültü taban çizgisi oluşturuyor.
  • Sertifikasyon, 1.000 Monte Carlo denemesi üzerinde tek taraflı Wilson %95 alt sınırının 0,95 veya üzerinde olmasını gerektiriyor. Her sertifikalı çıkarım, önerme aralıklarını ve minimal bir karşı örneği içeriyor.
  • 2×2 faktöriyel analiz, %93,2’lik eşik altı hatayı seçimden ziyade kalibrasyon oranı aktarımına bağlıyor. Bu bulgu, spesifik ve giderilebilir bir zayıflığa işaret ediyor.

EleştiriCritical take

Makale, kendi sınırlılıkları konusunda taze bir dürüstlük sergiliyor. Denetim izinde geri çekilen bir iddiayı işaret ediyor ve sertifikayı açıkça “kullanılabilir ama kırılgan” olarak nitelendiriyor. Yine de, tek bir “küresel düzeyde devreye alınan hata modeli” altında %93,2’lik hata oranı, bu sertifikanın ayrıştırma doğruluğu üzerine iyi kalibre edilmiş bir güven aralığından çok daha fazlasını ekleyip eklemediği sorusunu gündeme getiriyor. Duquenne-Guigues tabanı matematiksel olarak temiz görünse de, doğası gereği koşullu, yargı alanına özgü ve bağlama bağımlı olan kanun diline uygulanacak aşırı katı bir merceğe dönüşebilir. Dolayısıyla, sertifikalandırılan “hayatta kalma” kavramı, iddia edilen hukuki akıl yürütme kapsamından daha dar olabilir.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue