Türkçe altyazı Turkish subtitles
0:00 Farklı görevler üstlenen ve birbirine bilgi aktaran ajanlardan oluşan bir çoklu ajan uygulaması çalıştırıyorsunuz. You're running a multi-agent application with agents taking on different tasks and passing information to one another. 0:10 Ve bir şeyler bozuluyor. And something breaks. 0:12 Belki kullanıcınız yanlış bir cevap alıyor ya da hiç cevap alamıyor. Maybe your user gets a wrong answer or no answer at all. 0:16 Ve her zamanki gibi yapıp izleme panelinizi açıyorsunuz. And so you do what you've always done, and you open up your monitoring dashboard. 0:20 Her şey yolunda görünüyor. Everything looks fine. 0:21 HTTP istekleri, hata oranları, yanıt süreleri. HTTP request, error rates, response times. 0:25 Muhtemelen şuna benzer bir şey görüyorsunuz. You probably see something like this. 0:33 Bu ajana CEO ajanı adını verelim. We're going to name this agent our CEO agent. 0:39 Ve 200 OK diyor, ardından 2,3 saniye sürdü. And it says 200 OK, and then it took 2.3 seconds. 0:46 Ama kullanıcınız yanlış cevabı aldı. But your user got the wrong answer. 0:49 Ve burada bir istek gerçekleştiğini bilmek tek başına yeterli değil. And so just knowing that a request happened here is not useful enough. 0:53 Çoklu ajan sistemlerinde, ajanınızın yanlış bir aracı çağırıp çağırmediğini ya da bir MCP sunucusunun boş veri döndürüp döndürmediğini, bu yapay zeka çağrısına özgü birçok diğer endişeyle birlikte görebilmeniz gerekir. With a multi-agent system, you need to be able to see if your agent maybe called the wrong tool or if an MCP server returned empty data, along with many other concerns new to this AI era. 1:07 Örneğin, beş LLM çağrısından üçü, aylardır kimse bakmadığı bir istem için token harcadı. Like, did three out of my five LLM calls, burned tokens on a prompt that nobody's looked at in months. 1:14 Bugün istek seviyesindeki izlemenin ötesine geçip çoklu ajan sistemleri için doğru LLM gözlemlenebilirliğine bakacağız. So today we're going to go beyond request level monitoring and into proper LLM observability. 1:29 Çoklu ajan sistemleri için. For multi-agent systems. 1:31 Bunu yapmak için MLflow'u kullanacağız. And to do that, we're going to use MLflow. 1:35 MLflow, kullanıcımızın buradan gönderdiği istek sonrasında gerçekleşen her adımdaki girdileri, çıktıları ve meta verileri yakalayan, açık telemetriyle uyumlu bir platformdur. So MLflow is an open telemetry compatible platform that captures inputs, outputs, and metadata from every step of a request that occurs after our user here. 1:49 İsteği gönderdikten sonra. Sends in the request. 1:51 Bu videonun sonunda, izlemenin nasıl çalıştığını ve LLM yargıçları kullanarak ajan kalitesini nasıl değerlendireceğinizi bileceksiniz. By the end of this video, you'll know how tracing works, how to evaluate agent quality using LLM judges. 1:57 Ve sonunda, bir demoyu üretim seviyesinde bir dağıtımdan ayıran birkaç yapılandırma seçeneğini paylaşacağım. And in the end, I'll share a few configuration choices that separate a demo from a production level deployment. 2:03 Bunu bir örnekle somutlaştıralım. Let's ground this in an example. 2:05 Bir konut kredisi uygulama geliştirdiniz. You've built a mortgage lending application. 2:10 Kullanıcılar ihtiyaçları hakkında sohbet edebilir ve sistem onlara hangi krediler için uygun olduklarını söyler. Users can chat about their needs and the system tells them what loans they qualify for. 2:18 Ve perdenin arkasında, hızlı bir API çalışır. And under the hood, it's a fast API. 2:24 Bu API, farklı kişiliklere sahip beş farklı ajana yönlendirme yapar. Routing to five different agents that all have different personas. 2:32 Bir keşifçi, bir borçlu, bir kredi memuru, bir kredi onaylayıcısı ve iç analizler için bir CEO asistanı. A prospector, a borrower, a loan officer, an underwriter, and a CEO assistant for internal analytics. 2:39 Bu ajanlar, veritabanları gibi farklı araçları çağırabilir. These agents can call on different tools like databases. 2:48 LLM'ler, MCP sunucuları ve tüm bunlar kullanıcının yanıtı almadan önce gerçekleşir. LLMs, MCP servers, and all of this happens before our user gets a response back. 2:58 Şimdi, yakalamaya çalıştığımız, bu boşluklarda gizlenen şeylerden bahsedelim. Let's talk about what hides in the gaps here that we're trying to catch. 3:02 Öncelikle sessiz araç hataları var; burada bir MCP aracı boş veri döndürür ve ajan yine de ilerleyerek eksik bilgilerden emin bir şekilde yanıt verir. First up, silent tool failures, where an MCP tool returns empty data and the agent proceeds anyways and confidently answers from incomplete information. 3:11 Vay canına. Yikes. 3:13 Sıradaki. Next. 3:13 Kademeli gecikme; burada yavaş bir veritabanı sorgusu bir LLM çağrısını geciktirir, bu da yanıtı geciktirir ve zincirdeki hangi halkanın darboğaz olduğunu anlayamazsınız. Cascading latency, where a slow database query delays an LLM call, which delays the response, and you can't tell which link in the chain is the bottleneck. 3:25 Sıradaki, bağlam taşması. Next, context overflow. 3:27 Ajan, bir isteme çok fazla şey sığdırır. The agent stuffs too much into a prompt. 3:29 Çağrı anlaşılmaz bir hata ile başarısız olur ve kullanıcı genel bir zaman aşımı görür. The call fails with a cryptic error, and the user sees a generic timeout. 3:35 Ve son olarak, en büyük sorun, belirsizlik. And then finally, the big one, nondeterminism. 3:40 Aynı soru çalıştırma çalıştırma farklı sonuçlar üretir, bu yüzden hata dizüstü bilgisayarınızda kendini tekrarlamaz. The same question produces different results run to run, so the bug won't reproduce itself on your laptop. 3:46 Belirsizlik, ajanlarınızın tutarlı ve doğru yanıtlar verdiğini kanıtlamak için bir kalite tabanının olmaması anlamına gelir. Nondeterminism means no quality baseline, proving that your agents give consistent and accurate answers. 3:52 Ve kredilendirme gibi düzenlenmiş bir alanda, bu bir uyumluluk sorunudur. And in a regulated domain like lending, that's a compliance problem. 3:56 MLflow'un temel gözlemlenebilirlik birimi izdir. MLflow's core observability primitive is the trace. 4:00 İz, tek bir isteğin eksiksiz kaydını oluşturur. The trace is a complete record of one request. 4:04 İz, bireysel aralıklardan oluşur. Now the trace is composed of individual spans. 4:07 Bu aralıklar... Now, these spans... 4:09 Tek bir LLM çağrısı, bir araç etkinleştirmesi veya bir veritabanı sorgusudur; neyin neyi, hangi girdilerle, hangi çıktılarla ve her adımın ne kadar sürdüğüne dair ebeveyn-çocuk ağacına organize edilir. Are a single LLM call, a tool invocation, a database query organized into a parent-child tree that shows what called what with what inputs, with what outputs, and how long each step took. 4:23 Ayrıca token sayıları, adım başına gecikme, araç parametreleri, istem-tamamlama çiftleri ve veritabanı sonuçlarını alırsınız. Plus, you'll get token counts, per-step latency, tool parameters, prompt completion pairs, and database results. 4:31 Bu izleri bireysel kullanıcı ve oturum kimlikleriyle etiketleyebilirsiniz. You can tag these traces with the individual user and session IDs. 4:37 Böylece belirli kullanıcıların oturumlarını açabilir ve bir ajanın karar yolunu yeniden oynatabilirsiniz. So you can pull up individual users' sessions and replay an agent's decision path. 4:42 Ancak o noktaya ulaşmadan önce, yapay zeka geliştirmenin iç döngüsünde, kullanıcıların sisteminize erişmeden önce hızlı geri bildirim alarak istemleri ayarlayıp değerlendirmeler çalıştırmanıza olanak tanıyan bir defterde çalışabilirsiniz. But before you even get to that point, during the inner loop of AI development, you can work in a notebook that allows you to tweak prompts, run evals, etc, with fast feedback before you actually get to users hitting your system. 4:56 Şu ana kadar MLflow'un deterministik puanlarından bahsettik. So far, we've talked about MLflow's deterministic scores. 5:00 Bunlardan bazıları düzenli ifade kontrolleri, tam eşleşme ve gecikme eşikleridir; ancak belirsiz çağın modern bir değerlendirme çerçevesi de LLM hakem puanlarıdır. Some are regex checks, exact match, latency thresholds, but another modern evaluation framework for the non-deterministic era is LLM as a judge scores. 5:15 MLflow ile ikinci bir model kullanarak ajanınızın çıktısını tanımlı kriterlere göre puanlayabilirsiniz. Now, you can use a second model with MLflow to grade your agent's output against defined criteria. 5:22 Bu kriterler araç çağrısı doğruluğu olabilir. This criteria could be tool call correctness. 5:26 Ajan, soru için doğru araçları seçti mi? Did the agent pick the right tools for the question? 5:28 Çağrı verimliliği. To call efficiency. 5:32 Ajan, minimum sayıda adımda veya çağrıda oraya ulaştı mı yoksa dolaştı mı? Did the agent get there in a minimal number of steps or in calls, or did it wander? 5:38 İlgililik, yanıt gerçekten kullanıcının sorduğunu ele aldı mı? Relevance, did the response actually address what the user asked? 5:43 Güvenlik, yanıt uygun mu? Safety, is the response appropriate? 5:47 Ve son olarak, yönergeler. And then finally, guidelines. 5:50 Uyumluluk gereksinimlerinizi yönergeler aracılığıyla doğal dil talimatları olarak yazabilirsiniz. You can write your compliance requirements as natural language instructions via the guidelines. 5:57 İpot kredi asistanımız için bu, "yardımcı ol, asla faiz oranı vaadi verme" şeklinde olabilir. For our mortgage assistant, that might say, be helpful, never promise a rate. 6:01 Profesyonel kal. Keep it professional. 6:03 Bir diğer harika özellik de istem kayıt defteri. Another cool feature is the prompt registry. 6:06 Yani, A+ değerinde bir sistem istemi bulursanız, bunları Git gibi düşünebileceğiniz, sürüm kontrolüyle kayıt altına alabilirsiniz. So if you find a system prompt that's worth an A+, you can register it with version control for these system prompts that you can think of like Git. 6:15 Artık güçlü bir kavramsal anlayışa sahip olduğumuza göre, bir notebook demosunu üretim dağıtımından ayıran dört hızlı ipucunu konuşalım. Now that we have a strong conceptual understanding, let's talk about four rapid fire tips that separate a notebook demo from a production deployment. 6:24 Birincisi. First. 6:26 İzleme sunucusuna gerçek bir veritabanı verin. Give the tracking server a real database. 6:29 Varsayılan dosya tabanlı arka uç, dizüstü bilgisayarınızda sorun olmaz ama eşzamanlı yazarlarla karşılaştığında çöker. The default file-based backend is fine on your laptop and falls over with concurrent writers. 6:36 Ekibiniz bir örneği paylaşmadan önce --backend-store-URI bayrağını Postgres veya MySQL'e yönlendirin ve artefaktları nesne depolamaya koyun. Point --backend-store-URI at Postgres or MySQL before your team shares an instance and put artifacts on object storage. 6:48 Kubernetes veya OpenShift kullanıyorsanız, bunu bir kimlik doğrulama vekili (auth proxy) arkasında çalıştırın. If you're on Kubernetes or OpenShift, run it behind an auth proxy. 6:53 MLflow, kendi kimlik doğrulama mekanizması olmadan gelir. MLflow ships with no authentication story of its own. 6:57 Asenkron iz kayıt tutmayı (async trace logging) açın. Turn on async trace logging. 7:00 Üretim ortamında, iz dışa aktarmalarının istek yolunda beklemesini istemezsiniz. In production, you don't want trace exports sitting in your request path. 7:04 MLflow asenkron kayıt tutmayı destekler, böylece span'lar arka planda gönderilir ve her kullanıcı yanıtına gecikme eklenmez. MLflow supports asynchronous logging, so spans ship in the background instead of adding latency to every user response. 7:11 Yoğun trafik altında, örnekleme ekleyin. Under heavy traffic, add sampling. 7:13 Sistem kararlı hale geldiğinde izlerin %100'üne nadiren ihtiyaç duyarsınız, ancak %100 hata kaydına her zaman ihtiyacınız olur. You rarely need 100% of traces once the system is stable, but you always want 100% errors. 7:20 Üçüncüsü. Third. 7:21 Teşekkürler. Thank you. 7:22 Yargıç modelinizi bilinçli olarak seçin. Pick your judge model deliberately. 7:24 LLM yargıçları varsayılan olarak barındırılan bir OpenAI modelini kullanır, ancak kurumsal veya hava boşluklu (air-gapped) ortamlarda bu genellikle mümkün olmayabilir. LLM judges default to a hosted OpenAI model, but in enterprise or air-gapped environments, that can often be a non-starter. 7:32 Bunun yerine yargıcı kendi uç noktanıza yönlendirin. So point the judge at your own endpoint instead. 7:34 Ve unutmayın, her yargı çağrısı bir LLM çağrısıdır. And remember, every judge call is an LLN call. 7:38 Yani 500 örneklik bir veri setini beş yargıyla puanlarsanız, 2.500 çıkarım isteği yapmış olursunuz. So if you score a 500 example dataset with five judges, you've made 2,500 inference requests. 7:45 Bunu bütçelemeye alın ve bir düzenli ifade işe yarayacaksa deterministik puanlara güvenin. Budget for it, and lean on deterministic scores wherever a regex would do. 7:51 Dördüncüsü, değerlendirme ve CI'ı sadece defterlerde değil, her yerde yapın. Fourth Evaluate and CI, not just in notebooks. 7:56 İç döngü, tekrarlamalar yaptığınız yerdir, ancak asıl kazanç, aynı puanların her istem veya ajan değişikliğinde otomatik olarak çalıştığındadır. The inner loop is where you iterate, but the payoff comes when the same scores run automatically on every prompt or agent change. 8:04 Birim testleri gibi tam bir kalite kapısı. A quality gate, exactly like unit test. 8:06 İstem kayıt defteri ve sürümleme değerlendirme çalıştırımları, denetim izini sağlar. The prompt registry plus versioned eval runs gives the audit trail. 8:11 mlflow.genai.evaluate parantezlerini hattınıza bağlamak, uygulamayı sağlar. Wiring mlflow.genai.evaluate parentheses into your pipeline gives you the enforcement. 8:18 MLflow izleme, endüstri standardı olan açık telemetri üzerine inşa edilmiştir. MLflow tracing is built on open telemetry, the industry standard. 8:22 Diğer araçlarla çok iyi uyum sağlar. It plays very nice with others. 8:24 İzleriniz kilitlenmiş değildir. Your traces aren't locked in. 8:25 İzlerinizi, platform ekibinizin zaten çalıştırdığı Jaeger, Grafana Tempo veya herhangi bir arka uca çift olarak dışa aktarabilirsiniz. You can dual export to Jaeger, Grafana Tempo, or whatever backend your platform team already runs. 8:32 MLflow, onlarca LLM sağlayıcısı ve ajan çerçevesiyle de entegre olur. MLflow integrates with dozens of LLM providers and agent frameworks as well. 8:36 Ve desteklenen çerçeveler için tek satırlık bir işlemdir. And for supported frameworks, it's one line. 8:42 Mlflow.langchain.autolog çağrısını bir kez yaptığınızda, her langchain ve langgraph işlemi, LLM çağrıları, araç çağrıları ve ajan kararları otomatik olarak yakalanır. Mlflow.langchain.autolog Call that once it's start up, and every lane chain and lane graph operation, LLM calls, tool invocations, agent decisions, gets captured automatically. 8:59 Ajanınızın mantığında değişiklik yapmanıza gerek yok. No changes to your agent's logic. 9:01 Dolayısıyla çerçeveler arasında özel Python yapıştırıcı kodunuz varsa, onu at mlflow.trace ile süsleyin. So if you've got custom Python glue code between frameworks, decorate it with at mlflow.trace. 9:14 Ve aynı ağaca düşer. And it lands in the same tree. 9:16 Umarım bu faydalı olmuştur. Hope this was helpful. 9:17 Öyleyse beğen ve abone ol. If so, like and subscribe. 9:18 Ve bilmek istiyorum, bir ajanın izleme sisteminizden en tuhaf şekilde sessizce geçtiği hata neydi? And I wanna know, what's the weirdest silent failure an agent has ever gotten past your monitoring? 9:24 Yorumlara yazın. Drop it in the comments. 9:25 Teşekkürler. Thanks. Altyazı bilgisayarımda üretildi ve videoyla ilerler; bir satıra tıklayın, o ana atlasın. Subtitles generated on my computer; they follow the video — click a line to jump there.
MLflow, çoklu ajan sistemlerinde istem düzeyindeki izlemenin ötesine geçerek büyük dil modeli gözlemlenebilirliğini sağlar. MLflow provides large language model observability by going beyond prompt-level monitoring in multi-agent systems.
Bu video youtube.com üzerinde yayımlandı; buradaki oynatıcı YouTube’undur. Türkçe özet ve altyazı AiPulse için hazırlanmıştır. This video is published on youtube.com ; the player here is YouTube’s. The Turkish summary and subtitles are prepared for AiPulse .
YouTube’da izle Watch on YouTube AI Kritik → AI Critique →