2026-07-28
AI Kritik
yapay zeka nabzı — ham değil, demlenmişthe AI pulse — brewed, not raw
 AI KRİTİKAI CRITIQUE

DerinLens Tanı Ajanı, Küçük Modeli Çıkış Düzeyindeki LLM'lerle Rekabet EttiriyorDeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs

Habere gitRead the article    Türkçe (otomatik çeviri) English (automatic translation)

ÖzetSummary

7B parametreli bir tıbbi modelin etrafında kurgulanan beş aşamalı ajansal bir boru hattı (yapılandırılmış çıkarım, RAG ile geri getirme, kısıtlı üretim, kanıt üçgenlemesi ve denetlenebilir karar), 915 vakalık DiagnosisArena kıyaslamasında %60,14'lük ilk-1 doğruluk oranına ulaşıyor. Bu sistem, vaka başına maliyeti yaklaşık %35-45 oranında daha düşük tutarken, Claude Sonnet 4.5 ve Gemini 3.1 Pro'yu yaklaşık 9-10 puan geride bırakıyor.

Neden ÖnemliWhy it matters

Çalışmanın temel iddiası, disiplinli bir iş akışı tasarımının, küçük bir model ile sınır LLM'ler arasındaki tanısal akıl yürütme farkının büyük kısmını kapatabileceği yönünde. Bu bulgu, kaynakları sınırlı sağlık kurumları için doğrudan maliyet ve devreye alma sonuçları doğuruyor. 7B parametreli bir modelin yapılandırılmış istemlerle, milyarlarca parametreli API'lerle yarışabilmesi ve bunun çok daha düşük bir fiyata yapılabilmesi, sınır model aboneliklerini karşılayamayan hastanelerde tanısal yapay zekânın devreye alınmasını kolaylaştırıyor. Denetlenebilir ara çıktılara verilen önem ise yalnızca ham doğruluk oranlarının karşılayamadığı düzenleyici ve klinik güven gereksinimlerine de yanıt veriyor.

Öne ÇıkanlarHighlights

  • Yalnızca iş akışı tasarımı, aynı 7B modelin tek atımlı modda kullanımına kıyasla +36 puanlık bir artış sağlıyor (%23,99 → %60,14).
  • Tek bir A100 üzerinde vaka başına 0,0072 ABD doları maliyet ve 24 saniyelik gecikme; bu değerler Claude Sonnet 4.5 ve Gemini 3.1 Pro'nun maliyetlerinin altında kalıyor.
  • Boru hattı her aşamada yapılandırılmış ara çıktılar üretiyor; bu sayede hata konumlandırması ve denetim izleri mümkün hale geliyor.

EleştiriCritical take

%60,14'lük ilk-1 doğruluk oranı, hâlâ her on tanının yaklaşık dördünün yanlış olduğu anlamına geliyor. Ayrıca 915 vakalık kıyaslama, yüksek riskli bir klinik iddia için mütevazı kalıyor. Üstelik çalışma, John Snow Labs'ın bir teknik raporu olup ileriye dönük klinik doğrulama, insan-döngüde testleri veya gerçek hasta verilerine dair hiçbir bilgi içermiyor. Bu nedenle 'sınır LLM'leri geride bırakıyor' ifadesi, kanıtlanmış klinik güvenlikten ziyade tek ve dar kapsamlı bir kıyaslamaya dayanıyor.

Bu kritik, yerel yapay zeka modeli Qwen3.8-27B tarafından yazılmıştır.This critique was written by the local AI model Qwen3.8-27B.
Bültene dönBack to the issue