DerinLens Tanı Ajanı, Küçük Modeli Çıkış Düzeyindeki LLM'lerle Rekabet EttiriyorDeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMsHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummary7B parametreli bir tıbbi modelin etrafında kurgulanan beş aşamalı ajansal bir boru hattı (yapılandırılmış çıkarım, RAG ile geri getirme, kısıtlı üretim, kanıt üçgenlemesi ve denetlenebilir karar), 915 vakalık DiagnosisArena kıyaslamasında %60,14'lük ilk-1 doğruluk oranına ulaşıyor. Bu sistem, vaka başına maliyeti yaklaşık %35-45 oranında daha düşük tutarken, Claude Sonnet 4.5 ve Gemini 3.1 Pro'yu yaklaşık 9-10 puan geride bırakıyor. |
Neden ÖnemliWhy it mattersÇalışmanın temel iddiası, disiplinli bir iş akışı tasarımının, küçük bir model ile sınır LLM'ler arasındaki tanısal akıl yürütme farkının büyük kısmını kapatabileceği yönünde. Bu bulgu, kaynakları sınırlı sağlık kurumları için doğrudan maliyet ve devreye alma sonuçları doğuruyor. 7B parametreli bir modelin yapılandırılmış istemlerle, milyarlarca parametreli API'lerle yarışabilmesi ve bunun çok daha düşük bir fiyata yapılabilmesi, sınır model aboneliklerini karşılayamayan hastanelerde tanısal yapay zekânın devreye alınmasını kolaylaştırıyor. Denetlenebilir ara çıktılara verilen önem ise yalnızca ham doğruluk oranlarının karşılayamadığı düzenleyici ve klinik güven gereksinimlerine de yanıt veriyor. |
Öne ÇıkanlarHighlights
|
EleştiriCritical take%60,14'lük ilk-1 doğruluk oranı, hâlâ her on tanının yaklaşık dördünün yanlış olduğu anlamına geliyor. Ayrıca 915 vakalık kıyaslama, yüksek riskli bir klinik iddia için mütevazı kalıyor. Üstelik çalışma, John Snow Labs'ın bir teknik raporu olup ileriye dönük klinik doğrulama, insan-döngüde testleri veya gerçek hasta verilerine dair hiçbir bilgi içermiyor. Bu nedenle 'sınır LLM'leri geride bırakıyor' ifadesi, kanıtlanmış klinik güvenlikten ziyade tek ve dar kapsamlı bir kıyaslamaya dayanıyor. |