![]() MLflow ile Yapay Zeka Ajanlarını ve Büyük Dil Modeli İş Akışlarını İzlemeTracing AI Agents and Large Language Model Workflows with MLflowTürkçe altyazıyla izleWatch with Turkish subtitles |
ÖzetSummaryMLflow'un izleme ve LLM-as-judge değerlendirme özelliklerini kullanarak, çoklu ajan LLM sistemlerinde HTTP düzeyi izlemenin ötesine geçip adım adım gözlemlenebilirliğe ulaşmanın adım adım anlatımı. Örnek olarak beş ajanlı bir ipotek kredisi senaryosu kullanılıyor.A step-by-step guide on achieving step-by-step observability in multi-agent LLM systems by leveraging MLflow's tracing and LLM-as-judge evaluation features, going beyond HTTP-level monitoring. A five-agent mortgage loan scenario is used as an example. |
Neden ÖnemliWhy it mattersÇoklu ajan boru hatları, sessiz araç dönüşleri, kademeli gecikme, bağlam taşması ve çalıştırma arası belirsizlik gibi hata modlarını beraberinde getiriyor. Standart APM panoları bu sorunları tespit edemiyor. Kredi gibi düzenlemeye tabi alanlarda bu kör nokta bir uyumluluk riskine dönüşüyor. MLflow'un OpenTelemetry tabanlı izleme ağacı ve sürüm kontrolü altındaki istem kayıt defteri, ekiplere bir ajanın karar yolunu yeniden oynatıp istem değişikliklerini CI'da kontrol etme imkânı sunuyor. Bu, çoğu LLM devreye alma sürecinde hâlâ giderilmemiş operasyonel bir boşluk.Multi-agent pipelines introduce failure modes such as silent tool returns, cascading latency, context overflow, and inter-run ambiguity. Standard APM dashboards fail to detect these issues. In regulated domains like lending, this blind spot becomes a compliance risk. MLflow's OpenTelemetry-based tracing tree and version-controlled prompt registry allow teams to replay an agent's decision path and control prompt changes in CI. This addresses an operational gap that remains unresolved in most LLM deployment processes. |
Öne ÇıkanlarHighlights
|
EleştiriCritical takeVideo, belirsizliği 'en büyük sorun' olarak öne çıkarıyor. Ancak birincil çözüm olarak LLM-as-judge değerlendirmesini öneriyor. Oysa bu değerlendirme de kendi başına belirsiz bir LLM çağrısıdır. Makale, yargıcın kendi puanlarındaki değişkenliği ele almadan, bir yeniden üretilebilirlik sorununu daha pahalı bir sorunla takas ediyor. 'Üretim ipuçları' bölümü, gerçek veritabanı, kimlik doğrulama vekili ve asenkron günlük tutma gibi genel operasyonel bir kontrol listesini MLflow'a özgü yönlendirme gibi sunmuş. Ayrıca makale, MLflow'u LangSmith, Arize veya ham OpenTelemetry dışa aktarıcıları gibi alternatiflerle kıyaslamıyor. Okuyucu, tek satırlık LangChain otomatik günlüğünün dikkate değer tek entegrasyon yolu olduğunu varsaymak zorunda kalıyor.The video highlights ambiguity as the 'biggest problem.' However, it proposes LLM-as-judge evaluation as the primary solution. Yet, this evaluation is itself an ambiguous LLM call. The article swaps one reproducibility issue for a more expensive one without addressing the variability in the judge's own scores. The 'production tips' section presents a generic operational checklist—such as real databases, authentication proxies, and asynchronous logging—as if it were MLflow-specific guidance. Additionally, the article does not compare MLflow with alternatives like LangSmith, Arize, or raw OpenTelemetry exporters. Readers are left to assume that single-line LangChain auto-logging is the only notable integration path. |
