No. 33
2026-08-21
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

Temel modellerin geometri çizim yeteneği sınanıyorFundamental models' geometry drawing ability is being tested

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Makale, temel modellerin yalnızca doğru cevaba ulaşmakla kalmayıp sorunu çözmek için gereken geometrik şekilleri de oluşturup oluşturamadığını test eden, 954 olimpiyat geometri sorusundan (297 soruluk zor bir alt küme dahil) oluşan açık kaynak bir kıyaslama sunuyor. Mevcut modellerde çarpıcı bir uçurum görülüyor: güçlü problem çözme becerisi, üretilen şekiller için yalnızca %36,14'lik ortalama Asymptote derleme başarı oranıyla bir arada var oluyor.

Neden ÖnemliWhy it matters

MathVista ve MathVerse gibi mevcut kıyaslamalar yalnızca cevabın doğruluğunu ölçüyor; şekil oluşturma becerisi ise ölçümsüz kalıyor. Bu çalışma, geometrik akıl yürütmede gizli bir darboğaz olabilecek bu yetkinliği izole ediyor. Her soruyu insan eliyle hazırlanmış, yüksek sadakatli bir Asymptote şekli ve çok modlu bir metrik seti (metin, kod, görsel, VLM, kısıt tabanlı) ile eşleştirerek 'matematik akıl yürütme' iddialarının nerede çözüldüğünü gösteren somut bir tanı aracı sunuyor. Açık kaynak olarak yayımlanması, çoktan seçmeli doğruluğun ötesinde uzamsal-geometrik sadakati zorlu test etmek isteyen model geliştiricileri için aracı hemen kullanılabilir kılıyor.

Öne ÇıkanlarHighlights

  • 954 soru + 297 zor alt küme; her biri doğru kabul edilen, insan eliyle hazırlanmış bir Asymptote şekliyle birlikte
  • Mevcut temel modellerde yalnızca %36,14'lik ortalama derleme başarı oranı
  • Metin, kod, görsel, VLM ve kısıt tabanlı kontrolleri kapsayan beş metrikli değerlendirme seti

EleştiriCritical take

Kıyaslama, doğru şekil temsilini yalnızca Asymptote'a bağlayarak geometrik anlayışı belirli bir DSL'de yetkinlikle karıştırıyor. Uzamsal akıl yürütmede başarılı ama Asymptote kodu yazmakta zorlanan bir model, bir doğrudan yanlış tanımlayan modelle aynı şekilde cezalandırılıyor. Ayrıca %36'lık derleme oranı kaba bir ortalama; soru bazlı hata sınıflandırmaları olmadan, hataların yanlış yapıdan, sözdizimi hatasından yoksa eksik yardımcı çizgilerden mi kaynaklandığını ayırt etmek zor. Bu durum, makalenin iddia ettiği tanısal hassasiyeti sınırlıyor.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue