2026-09-19
AI Kritik
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

MLflow ile Yapay Zeka Ajanlarını ve Büyük Dil Modeli İş Akışlarını İzlemeTracing AI Agents and Large Language Model Workflows with MLflow

Türkçe altyazıyla izleWatch with Turkish subtitles

ÖzetSummary

MLflow'un izleme ve LLM-as-judge değerlendirme özelliklerini kullanarak, çoklu ajan LLM sistemlerinde HTTP düzeyi izlemenin ötesine geçip adım adım gözlemlenebilirliğe ulaşmanın adım adım anlatımı. Örnek olarak beş ajanlı bir ipotek kredisi senaryosu kullanılıyor.A step-by-step guide on achieving step-by-step observability in multi-agent LLM systems by leveraging MLflow's tracing and LLM-as-judge evaluation features, going beyond HTTP-level monitoring. A five-agent mortgage loan scenario is used as an example.

Neden ÖnemliWhy it matters

Çoklu ajan boru hatları, sessiz araç dönüşleri, kademeli gecikme, bağlam taşması ve çalıştırma arası belirsizlik gibi hata modlarını beraberinde getiriyor. Standart APM panoları bu sorunları tespit edemiyor. Kredi gibi düzenlemeye tabi alanlarda bu kör nokta bir uyumluluk riskine dönüşüyor. MLflow'un OpenTelemetry tabanlı izleme ağacı ve sürüm kontrolü altındaki istem kayıt defteri, ekiplere bir ajanın karar yolunu yeniden oynatıp istem değişikliklerini CI'da kontrol etme imkânı sunuyor. Bu, çoğu LLM devreye alma sürecinde hâlâ giderilmemiş operasyonel bir boşluk.Multi-agent pipelines introduce failure modes such as silent tool returns, cascading latency, context overflow, and inter-run ambiguity. Standard APM dashboards fail to detect these issues. In regulated domains like lending, this blind spot becomes a compliance risk. MLflow's OpenTelemetry-based tracing tree and version-controlled prompt registry allow teams to replay an agent's decision path and control prompt changes in CI. This addresses an operational gap that remains unresolved in most LLM deployment processes.

Öne ÇıkanlarHighlights

  • İzlemeler, her LLM çağrısını, araç çağrısını ve veritabanı sorgusunu token sayıları ve adım bazlı gecikmelerle yakalayan ebeveyn-çocuk aralıklarına ayrılıyor. Tüm bu veriler, yeniden oynatma için kullanıcı veya oturum kimliğiyle etiketlenebiliyor.Traces are broken down into parent-child spans that capture every LLM call, tool invocation, and database query with token counts and step-by-step latency. All this data can be tagged with user or session IDs for replay purposes.
  • LLM-as-judge puanlaması, araç çağrısının doğruluğunu, adım verimliliğini, ilgiliyeti, güvenliği ve doğal dil uyumluluk kurallarını değerlendirebilir. Ancak her yargı çağrısı kendi başına bir çıkarım isteğidir. 500 örnek × 5 yargıç = bütçelendirilmesi gereken 2.500 çağrı demektir.LLM-as-judge scoring can evaluate tool call accuracy, step efficiency, relevance, security, and natural language compliance rules. However, each judge call is itself an inference request. 500 examples × 5 judges means 2,500 calls that need to be budgeted.
  • Üretim ortamı için güçlendirme büyük ölçüde standart operasyonel işlemlerden ibaret: Dosya tabanlı arka uyu Postgres/MySQL ile değiştirin, artefaktları nesne depolamaya taşıyın, asenkron aralık günlüğünü etkinleştirin, yük altında izlemeleri örneklerken hata yakalamayı %100'de tutun ve mlflow.genai.evaluate işlevini CI'da bir kalite kontrolü olarak kullanın.Hardening for production is largely standard operational work: replace file-based backends with Postgres/MySQL, move artifacts to object storage, enable asynchronous span logging, maintain 100% error catching while sampling traces under load, and use the mlflow.genai.evaluate function as a quality check in CI.

EleştiriCritical take

Video, belirsizliği 'en büyük sorun' olarak öne çıkarıyor. Ancak birincil çözüm olarak LLM-as-judge değerlendirmesini öneriyor. Oysa bu değerlendirme de kendi başına belirsiz bir LLM çağrısıdır. Makale, yargıcın kendi puanlarındaki değişkenliği ele almadan, bir yeniden üretilebilirlik sorununu daha pahalı bir sorunla takas ediyor. 'Üretim ipuçları' bölümü, gerçek veritabanı, kimlik doğrulama vekili ve asenkron günlük tutma gibi genel operasyonel bir kontrol listesini MLflow'a özgü yönlendirme gibi sunmuş. Ayrıca makale, MLflow'u LangSmith, Arize veya ham OpenTelemetry dışa aktarıcıları gibi alternatiflerle kıyaslamıyor. Okuyucu, tek satırlık LangChain otomatik günlüğünün dikkate değer tek entegrasyon yolu olduğunu varsaymak zorunda kalıyor.The video highlights ambiguity as the 'biggest problem.' However, it proposes LLM-as-judge evaluation as the primary solution. Yet, this evaluation is itself an ambiguous LLM call. The article swaps one reproducibility issue for a more expensive one without addressing the variability in the judge's own scores. The 'production tips' section presents a generic operational checklist—such as real databases, authentication proxies, and asynchronous logging—as if it were MLflow-specific guidance. Additionally, the article does not compare MLflow with alternatives like LangSmith, Arize, or raw OpenTelemetry exporters. Readers are left to assume that single-line LangChain auto-logging is the only notable integration path.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue