No. 31
2026-08-19
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Bir adam karanlık bir odada bir masanın başında otururken, etrafı stilize beyinler içeren ve her birinde yüzde oranları gösterilen parlayan cam tüplerle çevrilidir.

Claude Fable 5, nanoGPT kıyaslamasında insan araştırmacıların %82'sini yakaladıClaude Fable 5 Captures 82% of Human Researchers in nanoGPT Benchmark

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Prime Intellect'ın Ağustos 2026 kıyaslamasında 18 sınır model, insan nanoGPT hız rekoru (2.600 adım) ile karşılaştırıldı. Claude Fable 5, yaklaşık 2.726 adımla bu farkın %82'sini kapattı; ancak hiçbir model, yayımlanmış literatürde bulunmayan bir teknik üretmedi.

Neden ÖnemliWhy it matters

Bu, bugüne kadar otonom yapay zekâ araştırmalarına yönelik en kapsamlı kamuya açık değerlendirmelerden biri. Mevcut modellerin sentez, hipotez odaklı deney ve uygulama gibi alanlarda ne kadar başarılı olduğunu, hâlâ yapamadıkları şeyden—gerçekten yeni bir fikir üretmekten—net biçimde ayırıyor. Sıfır yenilik bulgusu, etkileyici %82 rakamını sınırlıyor ve 'yapay zekâ araştırmacı' anlatısını ölçülebilir, somut bir tavan etrafında yeniden çerçeveliyor.

Öne ÇıkanlarHighlights

  • Claude Fable 5, yaklaşık 2.726 adıma ulaşarak 2.600 adımlık insan rekorunu geride bıraktı. Model, Opus 5'in (%54) ve GPT-5.5'in (%8) performansının önüne geçti.
  • 18 modelin hiçbiri, yayımlanmış literatürde zaten yer alan bir teknik dışında yeni bir yöntem sunmadı.
  • En başarılı modeller, hipotez odaklı deney tasarımı, tohum gürültüsü yönetimi ve daha önce başarısız sonuçların kalibre edilmiş biçimde yeniden değerlendirilmesi sayesinde öne çıktı.

EleştiriCritical take

'Farkın %82'si' ifadesi yanıltıcı olabilir. İnsan rekoru, internet erişimi, forum tartışmaları ve dinlenip düşünme imkânı gibi koşullar altında aylar içinde kuruldu. Modellerden bu koşullar açıkça esirgendi; bu yüzden karşılaştırma elma ile elmayı karşılaştırmak niteliğinde değil. Ayrıca makale, OpenAI Presence ve Claude Code'a yönelik tanıtım niteliğindeki atıfları metne serpiştirerek analitik odağını zayıflatıyor. Bu durum, titiz bir kıyaslama incelemesinden çok sponsorlu içerik gibi okunuyor.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue