![]() CAG ve Uzun Bağlam: AI Modellerinin Bilgiyi Kullanma ve Hatırlama YöntemleriCAG vs Long Context: How AI Models Use and Remember InformationTürkçe altyazıyla izleWatch with Turkish subtitles |
ÖzetSummaryMakale, büyük dil modellerine (LLM) harici bilgi kazandırmak için iki stratejiyi karşılaştırıyor. Bunlardan biri, tüm belgeleri bağlam penceresine sığdırmaya dayanan uzun bağlam istemidir. Diğeri ise Cache Augmented Generation (CAG) yöntemidir. CAG, transformer'ın anahtar-değer önbelleğini (KV cache) önceden hesaplayıp yeniden kullanır. Böylece tekrarlayan sorgular, aynı belgeleri yeniden okumadan yanıtlanır. Makale, CAG'ı sağlayıcı destekli pratik bir optimizasyon olarak konumlandırıyor. Bu yöntem, istem önbellekleme (prompt caching) üzerinden çalışır. Sabit bilgi tabanlarında çıkarım maliyetini %90'a kadar düşürebilir. Yanıt hızını ise 10-40 kat artırabilir. |
Neden ÖnemliWhy it mattersBağlam pencereleri milyonlarca token'a doğru büyüdükçe, 'her şeyi yapıştır' yaklaşımı artık sürdürülemez hale geliyor. Özellikle İK sohbet botları veya ürün dokümanı soru-cevap gibi yüksek hacimli iş yüklerinde bu yöntem hem çok pahalı hem de yavaş. KV durumunu ne zaman yeniden hesaplayıp ne zaman yeniden kullanacağınızı anlamak, artık temel bir mimari karar. Bu karar, gecikme bütçelerini ve API harcamalarını doğrudan etkiliyor. LLM tabanlı özellikler geliştiren her ekip için pratik bir öncelik haline geliyor. |
Öne ÇıkanlarHighlights
|
EleştiriCritical takeYazı, uzun bağlam ile CAG arasındaki ikili çerçeveye aşırı yaslanıyor. RAG'ın hâlâ üstün olduğu durumları göz ardı ediyor. Örneğin, tek bir pencereye sığmayan çok büyük veya hızla değişen korpüslerde RAG daha etkili. Ayrıca 40 kat hızlanma iddiası için kaynak gösterilmemiş bir 'araştırma' rakamına atıfta bulunuyor. 'Ortada kaybolma' (lost-in-the-middle) sorununu da bir dipnot olarak ele alıyor. Oysa bu, birincil bir doğruluk riski. 200K token'lık bir bağlamın tam ortasında kritik politika maddeleriniz varsa, bu durum hayati önem taşır. |
