No. 79
2026-10-06
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE
Görselde, "Google Research, Düzenlenmiş Özyinelemeli Uygulama ile Kendi Kendine Öğrenme Yeteneğini Sağlayan RRSI'yi Yayınladı" başlıklı bir haber başlığı yer almaktadır.

Google, ajanların test görevlerini ezberlemesini önleyen RRSI yöntemini tanıttıGoogle Introduces RRSI Method to Prevent Agents from Memorizing Test Tasks

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

Google araştırmacıları, ajan iskelelerinin özyinelemeli kendini iyileştirme sürecini düzenleyen RRSI adlı bir yaklaşım öneriyor. Sistem, daralan düzenleme bütçeleri ve katı bir eleştirmen kullanarak ajanların kıyaslama görevlerini ezberlemesini engelliyor. Bu yöntem, eğitim setindeki bazı kazanımlardan vazgeçerek görülmemiş görevlere anlamlı bir genelleme sağlıyor.Google researchers propose RRSI, an approach that regulates the self-reflective self-improvement process of agent scaffolds. By employing shrinking regulation budgets and a strict critic, the system prevents agents from memorizing benchmark tasks. This method sacrifices some gains on the training set to achieve meaningful generalization to unseen tasks.

Neden ÖnemliWhy it matters

Sektör, elle ayarlanmış ajan iskelelerinden büyük dil modeli (LLM) destekli öz-optimizasyon döngülerine geçiyor. Bu çalışmada tespit edilen ezberleme sorunu, gerçek ve yeterince takdir edilmemiş bir başarısızlık modu. Sorun, gerçek yetkinlik artmadan kıyaslama puanlarını sessizce şişirebilir. RRSI, diğer ekiplerin de benimseyebileceği somut ve açık kaynak bir koruma mekanizması sunuyor. Ayrıca iskele iyileştirmelerinin model katmanları arasında aktarılabilmesi (Gemini Flash’tan Flash Lite’a), daha ucuz ve dayanıklı ajan yığınlarına giden bir yol gösteriyor.The industry is shifting from manually tuned agent scaffolds to large language model (LLM)-driven self-optimization loops. The memorization issue identified in this study is a real and underappreciated failure mode that can silently inflate benchmark scores without improving actual competence. RRSI offers a concrete, open-source protection mechanism that other teams can adopt. Furthermore, the ability to transfer scaffold improvements across model tiers (from Gemini Flash to Flash Lite) points toward a path for building cheaper and more robust agent stacks.

Öne ÇıkanlarHighlights

  • Daralan düzenleme bütçeleri + sabit kodlanmış görev adlarını/çözümleri reddeden bir eleştirmen, temel anti-ezberleme mekanizmasıdır.Shrinking regulation budgets combined with a critic that rejects hardcoded task names/solutions form the core anti-memorization mechanism.
  • RRSI, tüm varyantlar arasında eğitim setinde en düşük kazanımı elde etti. Ancak görülmemiş kıyaslamalarda taban çizgisinin belirgin şekilde üzerine çıkan tek yöntem oldu (en fazla +4,7 puan).RRSI achieved the lowest gain on the training set across all variants. However, it was the only method to significantly outperform the baseline on unseen benchmarks (up to +4.7 points).
  • Gemini 3.5 Flash ile optimize edilen bir iskele, sıfır değişiklikle daha zayıf Gemini 3.1 Flash Lite’ı 11,2 puandan 14,6 puana çıkardı.A scaffold optimized with Gemini 3.5 Flash improved a weaker Gemini 3.1 Flash Lite model from 11.2 to 14.6 points with zero modifications.

EleştiriCritical take

“Özyinelemeli kendini iyileştirme” çerçevesi, aslında kural tabanlı bir düzenleme döngüsü olan sistemi abartıyor. Eleştirmenin reddetme kriterleri (sabit kodlanmış görev adları yok, kıyaslama özelinde hile yok) insan yazımı sezgisellere dayanıyor. Bu nedenle sistem, otonom kendini iyileştirmeden çok uzak. Üstelik görülmemiş görevlerdeki mutlak kazanımlar (≤4,7 puan) sınırlı. Çalışma donmuş modellere sınırlı ve dört karşılaştırma taban çizgisi adlandırılmamış “yakın dönemli yöntemler” olarak geçiyor. Bu durum, RRSI’nin üstünlüğünün gerçekten anlamlı mı yoksa zayıf rakiplerin bir sonucu mu olduğunu değerlendirmeyi zorlaştırıyor.The 'self-reflective self-improvement' framework overstates a system that is actually a rule-based regulation loop. The critic's rejection criteria (no hardcoded task names, no benchmark-specific cheating) rely on human-written heuristics. Consequently, the system is far from autonomous self-improvement. Moreover, the absolute gains on unseen tasks (≤4.7 points) are limited. The study is limited to frozen models, and four comparison baselines are labeled as unnamed 'recent methods.' This makes it difficult to assess whether RRSI's superiority is genuinely significant or merely a result of weak competitors.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue