No. 49
2026-09-06
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

CAG ve Uzun Bağlam: AI Modellerinin Bilgiyi Kullanma ve Hatırlama YöntemleriCAG vs Long Context: How AI Models Use and Remember Information

Türkçe altyazıyla izleWatch with Turkish subtitles

ÖzetSummary

Makale, büyük dil modellerine (LLM) harici bilgi kazandırmak için iki stratejiyi karşılaştırıyor. Bunlardan biri, tüm belgeleri bağlam penceresine sığdırmaya dayanan uzun bağlam istemidir. Diğeri ise Cache Augmented Generation (CAG) yöntemidir. CAG, transformer'ın anahtar-değer önbelleğini (KV cache) önceden hesaplayıp yeniden kullanır. Böylece tekrarlayan sorgular, aynı belgeleri yeniden okumadan yanıtlanır. Makale, CAG'ı sağlayıcı destekli pratik bir optimizasyon olarak konumlandırıyor. Bu yöntem, istem önbellekleme (prompt caching) üzerinden çalışır. Sabit bilgi tabanlarında çıkarım maliyetini %90'a kadar düşürebilir. Yanıt hızını ise 10-40 kat artırabilir.

Neden ÖnemliWhy it matters

Bağlam pencereleri milyonlarca token'a doğru büyüdükçe, 'her şeyi yapıştır' yaklaşımı artık sürdürülemez hale geliyor. Özellikle İK sohbet botları veya ürün dokümanı soru-cevap gibi yüksek hacimli iş yüklerinde bu yöntem hem çok pahalı hem de yavaş. KV durumunu ne zaman yeniden hesaplayıp ne zaman yeniden kullanacağınızı anlamak, artık temel bir mimari karar. Bu karar, gecikme bütçelerini ve API harcamalarını doğrudan etkiliyor. LLM tabanlı özellikler geliştiren her ekip için pratik bir öncelik haline geliyor.

Öne ÇıkanlarHighlights

  • Bağlam pencereleri, 2020'deki GPT-3'te yaklaşık 1K token'dan, 2024'teki Gemini 1.5 Pro'da 2M token'a kadar büyüdü. Bu artış, 'erişimi tamamen atla' stratejisini mümkün kıldı. Ancak her sorgu için token maliyeti, belge boyutuyla doğrusal olarak artıyor.
  • CAG'ın üç aşamalı hattı (hazırla → KV cache'i önceden hesapla → cache'i yükle ve yanıtla) küçük veri kümelerinde 10 kat, büyük veri kümelerinde ise 40 kata varan hızlanma sağlıyor. Bu rakamlar, her seferinde tüm bağlamı yeniden işleme yapmaya kıyasla elde ediliyor.
  • Büyük LLM sağlayıcıları artık istem önbellekleme özelliğini yönetilen bir hizmet olarak sunuyor. Bu, önbellekten okunan token'lar için yaklaşık %90 indirimle 'hizmet olarak CAG' anlamına geliyor. Böylece özel önbellek altyapısı kurma ihtiyacı ortadan kalkıyor.

EleştiriCritical take

Yazı, uzun bağlam ile CAG arasındaki ikili çerçeveye aşırı yaslanıyor. RAG'ın hâlâ üstün olduğu durumları göz ardı ediyor. Örneğin, tek bir pencereye sığmayan çok büyük veya hızla değişen korpüslerde RAG daha etkili. Ayrıca 40 kat hızlanma iddiası için kaynak gösterilmemiş bir 'araştırma' rakamına atıfta bulunuyor. 'Ortada kaybolma' (lost-in-the-middle) sorununu da bir dipnot olarak ele alıyor. Oysa bu, birincil bir doğruluk riski. 200K token'lık bir bağlamın tam ortasında kritik politika maddeleriniz varsa, bu durum hayati önem taşır.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue