Türkçe altyazı Turkish subtitles
0:00 Her yeni nesil öğrencinin, orijinal kitabı hiç açmadan, yalnızca bir önceki neslin notlarından öğrenmesini hayal edin. Imagine if every new generation of students learned only from the notes written by the previous generation of the students without ever opening the original textbook. 0:09 İlk nesil bazı hatalar yapabilir. The first generation might make some mistakes. 0:12 İkinci nesil bu hataları devralabilir. The second generation might inherit those mistakes. 0:18 Üçüncü nesil ise bu hataları muhtemelen büyütecek ve birkaç nesil sonra kimse orijinal gerçeğin nasıl göründüğünü hatırlamayacaktır. And the third generation is likely to amplify those mistakes and after a few generations, no one would remember what the original truth looked like. 0:28 Şimdi öğrencilerin yerine yapay zeka modellerini, notların yerine yapay zeka tarafından üretilen içerikleri ve ders kitaplarının yerine insan bilgisini koyun. Now, replace the students with AI models, replace the notes with AI-generated content, and replace textbooks with human knowledge. 0:38 Modern yapay zekanın karşı karşıya olduğu en önemli zorluklardan biri olan model çöküşüne hoş geldiniz. Welcome to one of the most important challenges facing modern AI, model collapse. 0:44 Bu, gelecekteki yapay zeka sistemlerinin daha akıllı hale gelip gelmeyeceğini ya da gerçeklikten yavaş yavaş uzaklaşıp uzaklaşmayacağını belirleyebilecek bir olgudur. It is a phenomenon that could determine whether future AI systems become smarter or slowly drift away from reality. 0:51 Oxford, Cambridge ve diğer kurumların ekiplerinden gelen son araştırmalar, yapay zeka modellerinin sürekli olarak yapay zeka tarafından üretilen içerikten öğrenmesi durumunda, nadir ama önemli bilgileri unutmaya başlayabileceklerini ve giderek daha tekrarlayan ve daha az doğru çıktılar üretebileceklerini gösteriyor. Recent research from teams at Oxford, Cambridge, and other institutions such as that if AI models continuously learn from AI-generated content, they can begin forgetting rare but important information producing increasingly repetitive and less accurate outputs. 1:08 Bugün, model çöküşünün tam olarak ne olduğunu anlayacağız. Today, we are going to understand what exactly model collapses. 1:15 Bunun neden olduğunu anlayacağız. We're going to understand why this happens. 1:19 Ve bunun neden önemli olduğunu, yani gelecek nesiller için neden önemli olduğunu da öğreneceğiz. And we are going to also learn why it is important, or why this matters for future generations. 1:26 Ayrıca araştırmacıların bunu nasıl önlemeye çalıştığını da göreceğiz. And we're also going to see how researchers are trying to prevent it. 1:32 Peki, model çöküşü nedir? Now, what is model collapse? 1:35 Temelinde, model çöküşü, yapay zeka modellerinin diğer yapay zeka modelleri tarafından üretilen verilerle tekrar tekrar eğitilmesi durumunda ortaya çıkar. At its core, model collapse occurs when AI models are repeatedly trained on data generated by other AI models. 1:43 Araştırmacılar bunu dejeneratif bir süreç olarak tanımlamıştır. Researchers have defined it as a degenerative process. 1:51 Sentetik çıktılarla gelecekteki eğitim verilerinin kademeli olarak kirletilmesine ve modellerin başlangıçta eğitildikleri gerçek dünya dağılımı hakkındaki bilgileri kaybetmesine neden olan dejeneratif bir süreç. A degenerative process where synthetic outputs gradually contaminate future training data, causing models to lose information about the real world distribution that they were originally trained on. 2:03 Bunu bir fotokopinin fotokopisini almak gibi düşünün. Think of it like making a photocopy of a photocopy. 2:06 İlk kopya iyi görünür. The first copy looks fine. 2:08 10. kopya bulanıktır. The 10th copy is blurry. 2:10 100. kopya ise orijinale neredeyse hiç benzemez. The 100th copy barely resembles the original. 2:13 Yapay zeka da çok benzer bir deneyim yaşar. AI experiences something very similar. 2:16 Her nesil, küçük kusurlar ortaya çıkarır. Every generation introduces tiny imperfections. 2:19 Bunları eksik bilgi, basitleştirilmiş kalıplar, halüsinasyon ve istatistiksel önyargılar olarak düşünün. Think of those as missing information, simplified patterns, hallucination, and statistical biases. 2:27 Gelecekteki modeller bu çıktılardan öğrendiğinde, kusurlar birikir. When future models learn from those outputs, the imperfections accumulate. 2:32 Araştırmacılar iki aşamadan bahsediyor. Researchers describe two stages. 2:36 İlk olarak erken çöküş var. First, we have early collapse. 2:42 Bu, modelin nadir olayları unutmaya başladığı aşamadır. So this is when the model begins forgetting rare events. 2:45 Sık görülen kalıplarda hâlâ iyi performans gösterir, ancak sıra dışı örnekler kaybolur. It still performs well on common patterns, but unusual examples disappear. 2:50 Örneğin, eğitim verisinin yalnızca %1'i nadir hastalıkları, tehlike altındaki dilleri veya niş bilimsel kavramları tartışıyorsa, bu örnekler genellikle ilk kaybolanlardır. For example, if only 1% of training data discusses rare diseases, endangered languages, or niche scientific concepts, these examples are often the first to vanish. 3:02 Sonraki aşama ise geç çöküştür. Next, we have late collapse. 3:09 Bu senaryoda model, gerçekliğin yapısını kaybetmeye başlar. Now, this is a scenario where the model starts losing the structure of reality itself. 3:15 Çıktılar tekrarlayan, genel ve orijinal veri dağılımından kopuk hale gelir. Outputs become repetitive, generic, and disconnected from the original data distribution. 3:20 Sonunda model akıcı görünse de, artık gerçek dünyayı yansıtmaz. Eventually, the model may appear fluent, but no longer reflects the real world. 3:25 Peki, model çöküşü neden gerçekleşir? Now, why does model collapse happen? 3:29 Bunu anlamak için önce insan bilginin normal dağılım eğrisini anlamalıyız. To understand that, we first need to understand the bell curve of human knowledge. 3:37 Çoğu bilgi bir dağılıma uyar. Most information follows a distribution. 3:40 Sık görülen gerçekler normal dağılım eğrisinin ortasında, nadir gerçekler ise kuyruklarda yer alır. Common facts sit in the middle of the bell curve, and the rare facts take up the tails. 3:51 Örneğin, milyonlarca belge köpekleri, pizzayı ve New York gibi popüler şehirleri tartışır. For example, millions of documents discuss dogs, pizzas, and popular cities like New York. 3:57 Çok daha az belge yerli dilleri, obskur tarihi olayları veya uzmanlaşmış bilimsel keşifleri ele alır. Far fewer documents discuss indigenous languages, obscure historical events, or specialized scientific discoveries. 4:05 Bu nadir örnekler, insan bilginin çeşitliliğini temsil ettikleri için hayati önem taşır. Those rare examples are crucial because they represent the diversity of human knowledge. 4:10 Yapay zeka sentetik veri ürettiğinde, düşük olasılıklı bilgilere kıyasla yüksek olasılıklı bilgileri doğal olarak daha sık yeniden üretir. When AI generates synthetic data, it naturally reproduces high probability information more often than the low probability information. 4:19 Bu yüzden... So... 4:20 Buradaki kuyruk kısalmaya başlar. The tail here gets compressed. 4:25 Bu da sıra dışı gerçeklerin veya sıra dışı bilgilerin genellikle unutulduğu anlamına gelir. That means the unusual facts or unusual information usually gets forgotten. 4:31 Bunu gerçek dünyadan bir örnekle anlayalım. Let's understand with a real world example. 4:34 Bir yapay zeka görüntü modeli eğitiyormuş gibi hayal edin. Imagine training an AI image model. 4:37 Orijinal veri seti 100.000 köpek, 100.000 kedi ve belki de sadece 500 albino tavus kuşu görüntüsü içeriyor. The original data set contains 100,000 images of dogs, 100,00 images of cats, and maybe just 500 images of albino peacocks. 4:52 İlk yapay zeka bu üçünü de öğreniyor. The first AI learns all three. 4:55 Şimdi, bir sonraki neslin büyük ölçüde o yapay zekanın ürettiği görüntüler üzerinde eğitildiğini varsayalım. Now, suppose the next generation trains mostly on the images generated by that AI. 5:01 Albino tavus kuşları nadir olduğu için, yapay zeka bunlardan daha az üretiyor. Since albino peacocks are rare, the AI generates fewer of them. 5:06 Bir sonraki nesil bunlardan daha azını görüyor ve ondan sonraki nesil ise neredeyse hiç görmüyor. The next generation sees even fewer, and the generation after that sees almost none. 5:12 Sonunda, model albino tavus kuşlarının hiç var olmadığı gibi davranıyor. Eventually, the model behaves as though albino peacocks never existed. 5:17 Gerçeklik değişmedi. Reality hasn't changed. 5:18 Değişen, modelin gerçekliğe ilişkin temsilidir. The model's representation of reality has. 5:21 Araştırmacılar, metin, görüntü ve üretken modelleri içeren kontrollü deneylerde tam olarak bunu gözlemledi. This is precisely what researchers observed in controlled experiments involving text, images, and generative models. 5:30 Nadir özellikler önce kaybolur, ardından art arda gelen nesillerde daha geniş çaplı bir bozulma yaşanır. Rare features disappear first, followed by broader degradation over successive generations. 5:36 Peki, neden model çökmesi önemli? Now, why does model collapse matter? 5:38 Başka bir deyişle, neden önemli? In other words, why is it important? 5:43 Şu an birçok kişi, model çökmesinin basitçe yapay zekanın kötüleşmesi anlamına geldiğini varsayıyor. Now many people assume that model collapse simply means that AI is getting worse. 5:49 Gerçeklik ise çok daha ince ve potansiyel olarak çok daha tehlikeli. The reality is much more subtle and potentially more dangerous. 5:53 Bunun nedeni, çeşitlilik kaybı yaşayabilme ihtimalimizdir. The reason for that is we could experience loss of diversity. 6:01 Bunun anlamı, gelecekteki modellerin giderek birbirine benzemesidir. What that means is that the future models become increasingly similar. 6:05 Yanıtlar genel geçer hale gelir ve yaratıcı çıktılar ortalama değere doğru yakınsar. Responses become generic and creative outputs converge towards the average. 6:10 İnternet, aynalarla dolu bir salona benzemeye başlar. The internet starts to look like a hall of mirrors. 6:13 Yapay zeka, yapay zekadan öğrenir. AI learns from AI. 6:15 Peki, yapay zeka kimden öğrenir? Which learns from Ai? 6:16 O da yapay zekadan mı öğrenir? Which in turn learns from AI? 6:18 Sonunda özgünlük azalır. Eventually, the originality declines. 6:22 Sıradaki aşamada bilgi çöküşü yaşarız. Next, we will experience knowledge collapse. 6:29 Bunun anlamı, modelin akıcı kalması, dilbilgisinin mükemmel kalması ve özgüvenin yüksek kalması, ancak gerçeklik güvenilirliğinin azalmasıdır. What that means is that the model remains fluent, the grammar remains excellent, and confidence remains high, but factual reliability decreases. 6:40 Başka bir deyişle, yapay zeka hiç olmadığı kadar zeki görünürken, gerçeklikle bağı giderek zayıflar. In other words, the AI sounds smarter than ever while becoming less grounded in reality. 6:46 Bunu tespit etmek çok daha zordur ve bu açık bir arıza değildir. That's much harder to detect and it's not an obvious failure. 6:51 Sıradaki konu önyargı amplifikasyonudur. Next, we have bias amplification. 6:57 Şimdi, bunun anlamı küçük önyargıların kalıcı hale gelebilmesidir. Now, what that means is that small biases can become permanent. 7:03 Erken dönem bir modelin belirli bir kültürü, dili veya demografik grubu hafifçe eksik temsil ettiğini hayal edin. Imagine an early model slightly under-represents a particular culture, language, or a demographic. 7:10 Gelecekteki modeller bu bozulmayı öğrenir, ardından onu büyütür. Future models learn that distortion, then amplify it. 7:14 Birden fazla nesil boyunca, az temsil edilen gruplar giderek görünmez hale gelir. Over multiple generations, under-represented groups become increasingly invisible. 7:19 Araştırmacıların azınlık dilleri ve uzmanlık alanlarındaki bilgiyi endişeyle takip etmesinin nedenlerinden biri budur. This is one reason researchers worry about minority languages and specialized knowledge domains. 7:25 Sonuncusu ama en az önemsiz olanı. Last but not least. 7:27 Yapay zeka ekosistemi geri bildirim döngüsüne sahibiz. We have the AI ecosystem feedback loop. 7:37 Bugünün interneti giderek daha fazla yapay zeka üretilmiş içerikle dolup taşıyor. Today's internet is increasingly filled with AI-generated content. 7:40 Tamamen yapay zeka tarafından üretilmiş makaleler, görseller, kodlar, videolar ve sosyal medya gönderileri var. We have articles, images, code, videos, and social media posts that are entirely AI- generated. 7:47 Sentetik içerikler arttıkça, gelecekteki eğitim veri kümeleri yapay zeka üretilmiş materyallerin daha büyük bir yüzdesini içerebilir ve bu potansiyel olarak sorunlu olabilir. As synthetic content grows, future training datasets may contain larger percentage of AI-generated and material, and that could be potentially problematic. 7:57 Peki model çöküşü zaten yaşanıyor mu? So is model collapse already happening? 8:01 İşte konuşmanın gerçekten ilginç hale geldiği yer burası. And this is where the conversation gets really interesting. 8:05 Cevap... The answer is... 8:07 Tam olarak değil. Not exactly. 8:09 Araştırmacılar, kontrollü ortamlarda modern çöküşü kanıtladılar. Researchers have demonstrated modern collapse in controlled environments. 8:13 Ancak, gerçek dünya koşullarında riskin ne kadar ciddi olduğu konusunda aktif bir tartışma var. However, there is active debate about how severe the risk is under real world conditions. 8:19 Nedeni? Why? 8:20 Çünkü büyük yapay zeka şirketleri basitçe ham yapay zeka çıktılarının üzerinde eğitim yapmıyor. Because major AI companies don't simply train on raw AI outputs. 8:25 Bunun yerine, insan geri bildirimlerini kullanıyorlar. Instead, they use human feedback. 8:32 Düzenlenmiş veri kümelerini kullanıyorlar. They use curated data sets. 8:39 Ayrıca, sizin RAG sisteminiz gibi arama sistemlerini de kullanıyorlar. They also use retrieval systems like your retrieval augmented generation systems. 8:48 Ve veri filtreleme ile kalite kontrol hatlarını kullanıyoruz. And we use data filtering and quality control pipelines. 8:59 Bazı araştırmacılar, en felaket senaryolarının gerçekçi olmayan eğitim uygulamalarını varsaydığını savunuyor. Some researchers argue that the most catastrophic collapse scenarios assume unrealistic training practices. 9:06 Yani sektör şu anda tam bir çöküş yaşamıyor, ancak altta yatan mekanizma gerçek ve deneysel olarak doğrulanmış durumda. So the industry is not currently experiencing full collapse, but the underlying mechanism is real and experimentally verified. 9:15 Bunu mevcut bir felaketten ziyade, uzun vadeli bir mühendislik zorluğu olarak düşünün. Think of it less like a current disaster and more like a long-term engineering challenge. 9:20 Peki, model çöküşünü nasıl önleriz? Now, how do we prevent model collapse? 9:27 İşte işlerin heyecan verici hale geldiği yer burası. This is where things get exciting. 9:29 Araştırmacılar çeşitli stratejiler geliştiriyor. Researchers are developing several strategies. 9:33 Bunlardan biri, insanları döngüde tutmak. One of them is keeping humans in the loop. 9:41 En etkili savunma şaşırtıcı derecede basit. The most effective defense is surprisingly simple. 9:44 Gerçek, insan üretimi verileri sürekli olarak enjekte etmeye devam edin. Continue injecting real human generated data. 9:47 Bile karşılaştırmalı küçük miktarda otantik insan verisi, modelleri gerçeğe çapalamak ve orijinal dağılımı korumak için yardımcı olabilir. Even a relatively small amount of authentic human data can help anchor the models to reality and preserve the original distribution. 9:56 Bunu pusulanın periyodik olarak yeniden kalibre edilmesi gibi düşünün. Think of it as periodically recalibrating a compass. 10:01 İkincisi, veri kökeni. Secondly, we have data provenance. 10:08 Bunun anlamı, gelecekteki yapay zeka sistemlerinin insan yapımı içerikleri, yapay zeka üretimi içerikleri ve doğrulanmış kaynakları tanımlayan mekanizmalara ihtiyaç duyabileceğidir. What this means is that future AI systems may need mechanisms that identify human-created content, AI-generated content, and verified sources. 10:20 Veri soyu giderek daha önemli hale geliyor. Data lineage becomes increasingly important. 10:23 Verinin nereden geldiğini bilirsek, kontrolsüz tekrarlı eğitim döngülerini önleyebiliriz. If we know where the data originated, we can prevent uncontrolled recursive training loops. 10:29 Üçüncüsü, yüksek kaliteli sentetik veri. Thirdly, we have high-quality synthetic data. 10:38 Şimdi, ilginç bir şekilde, sentetik verinin kendisi düşman değil. Now, interestingly, synthetic data itself is not the enemy. 10:42 Düşman, düşük kaliteli sentetik veri. Poor synthetic data is. 10:45 Birçok modern sistem zaten sentetik veriyi başarıyla kullanıyor. Many modern systems already use synthetic data successfully. 10:49 Sentetik veriyi kullanmanın anahtarı doğrulama, çeşitlilik, dış bağlam ve insan doğrulamasıdır. The key to using synthetic data is verification, diversity, external grounding, and human validation. 10:57 Araştırmacılar, dikkatle derlenen sentetik veri kümelerinin çöküş riskini önemli ölçüde azaltabildiğini buldular. Researchers have found that carefully curated synthetic data sets can significantly reduce collapse risk. 11:05 Sıradaki, Next, we have. 11:07 RAG yani Geri Getirme Destekli Üretim. RAG or Retrieval Augmented Generation. 11:12 Yani modeller, tüm bilgiyi içsel olarak saklamak yerine, sürekli olarak dış kaynaklara başvurabilir. So instead of storing all the knowledge internally, models can continuously consult external sources. 11:19 Bu, geri getirme destekli üretim fikri veya yaygın olarak bilinen adıyla RAG. This is the idea behind retrieval augmented generation or as it's commonly known, RAG. 11:25 Model, yalnızca öğrenilmiş kalıplara güvenmek yerine, cevap vermeden önce güncel bilgileri kontrol eder. Rather than relying solely on learned patterns, the model checks fresh information before answering. 11:32 Bu, özyinelemeli olarak üretilen bilgilere olan bağımlılığı azaltır. This reduces dependence on recursively generated knowledge. 11:37 Sıradaki konu, çoklu ajan doğrulamasıdır. Next we have multi-agent verification. 11:47 Gelişen bir yaklaşım, birden fazla yapay zeka sisteminin birbirinin çıktısını inceleyip doğrulamasını içerir. An emerging approach involves multiple AI systems reviewing and validating one other's output. 11:55 Modeller, sentetik verileri körü körüne tüketmek yerine, bunları gelecekteki eğitim hatlarına kabul etmeden önce doğruluğunu, tutarlılığını, yeniliğini ve dayanaklarını değerlendirir. Rather than blindly consuming synthetic data, models evaluate accuracy, consistency, novelty, and grounding before accepting it into future training pipelines. 12:06 Model çökmesi, zekâ hakkında derin bir şeyi ortaya koyar. Model collapse reveals something profound about intelligence. 12:09 Biyolojik olsun ya da yapay, zekâ yankı odası içinde gelişemez. Whether biological or artificial, intelligence cannot thrive inside an echo chamber. 12:14 Öğrenme, gerçeklikle temas gerektirir. Learning requires contact with reality. 12:17 İnsanlar için bu gözlem ve deneyimdir, ancak yapay zekâ için yüksek kaliteli veridir. For humans, that's observation and experience, but for AI, it's high quality data. 12:23 Yapay zekânın geleceği, daha büyük modellerle, daha büyük GPU'larla veya daha fazla parametreyle belirlenmeyebilir. The future of AI may not be determined by bigger models, larger GPUs, or more parameters. 12:29 Çok daha temel bir şey tarafından belirlenebilir. It may be determined by something far more fundamental. 12:32 Yapay zekâ ile gerçek dünya arasındaki güvenilir bağlantıyı koruyabilir miyiz? Can we preserve a reliable connection between AI and the real world? 12:36 Çünkü gelecekteki yapay zekâ ağırlıklı olarak yapay zekâdan öğrenirse, sorun makinelerin nasıl düşüneceğini öğretmek olmayacak. Because if future AI learns mostly from AI, the challenge won't be teaching machines how to think. 12:43 Sorun, gerçekliğin nasıl göründüğünü unutmalarını engellemek olacak. It will be preventing them from forgetting what reality looks like. 12:47 Bu da model çökmesini, muhtemelen duyduğumuz en önemli yapay zekâ sorunlarından biri haline getiriyor. And that makes model collapse one of the most important AI problems we've probably ever heard of. 12:53 Bu bilginin işinize yaradığını umuyoruz. We hope you found this information helpful. 12:55 Düşüncelerinizi aşağıdaki yorumlarda bizimle paylaşın. Please let us know what you think about it in the comments below. Altyazı bilgisayarımda üretildi ve videoyla ilerler; bir satıra tıklayın, o ana atlasın. Subtitles generated on my computer; they follow the video — click a line to jump there.
AI modellerinin sürekli olarak yapay zeka tarafından üretilen verilerle eğitilmesi, nadir bilgilerin kaybolmasına ve çıktılarının tekrarlayıcı hale gelmesine neden olan 'model çökmesi' olgusunu açıklar. The phenomenon of "model collapse," which causes rare knowledge to be lost and outputs to become repetitive, is explained by the continuous training of AI models on data generated by artificial intelligence.
Bu video youtube.com üzerinde yayımlandı; buradaki oynatıcı YouTube’undur. Türkçe özet ve altyazı AiPulse için hazırlanmıştır. This video is published on youtube.com ; the player here is YouTube’s. The Turkish summary and subtitles are prepared for AiPulse .
YouTube’da izle Watch on YouTube AI Kritik → AI Critique →