![]() Microsoft ve Hugging Face, ajanların tutarlılığını ölçen ThinkingBox kıyaslamasını yayınladıMicrosoft and Hugging Face Release ThinkingBox Benchmark to Measure Agent ConsistencyHabere gitRead the article Türkçe (otomatik çeviri) English (automatic translation) |
ÖzetSummaryMicrosoft ve Hugging Face, ThinkingBox adlı kıyaslamayı yayımladı. Bu kıyaslama, yapay zeka ajanlarını ürettikleri araç çağrılarına veya son mesajlara göre değil, 507 durumlu iş akışında (her biri 20 kez çalıştırılarak) geride bıraktıkları gerçek veritabanı durumuna göre puanlıyor. Öne çıkan bulgu şu: 'temiz görünen' denemelerin %67'si hâlâ yanlış değerler yazdı, istenmeyen yan etkiler yarattı veya gerekli işlemleri atladı.Microsoft and Hugging Face released a benchmark called ThinkingBox. This benchmark scores AI agents not by the tool calls they generate or their final messages, but by the actual database state they leave behind in a 507-state workflow (each run 20 times). A key finding is that 67% of 'clean-looking' attempts still wrote incorrect values, created unwanted side effects, or skipped necessary operations. |
Neden ÖnemliWhy it mattersÇoğu ajan değerlendirmesi, biçim olarak doğru bir araç çağrısını veya kibar bir son yanıtı başarı kanıtı olarak kabul eder. Ancak bu kıyaslama, bu açığın çok büyük olduğunu gösteriyor. Ajanlar, gerekli son durum 'beklemede' iken biletleri rutin olarak 'çözüldü' olarak kapatıyor. Her görevi 20 kez tekrarlayıp pass@1, pass@20 ve katı 20/20 sayısını raporlayarak, bir modelin ne yapabildiğini neyi güvenilir şekilde yaptığını ayırıyor. Bu ayrım, %90 başarı oranının her on müşteriden birinin bozuk bir sonuç alması anlamına geldiği üretim ortamlarında son derece önemli.Most agent evaluations treat a formally correct tool call or a polite final response as proof of success. However, this benchmark shows that this gap is massive. Agents routinely close tickets as 'resolved' when the required final state is 'pending.' By repeating each task 20 times and reporting pass@1, pass@20, and the strict 20/20 count, it distinguishes what a model can do from what it does reliably. This distinction is critical in production environments, where a 90% success rate means one in ten customers receives a broken outcome. |
Öne ÇıkanlarHighlights
|
EleştiriCritical takeKıyaslama yalnızca beş iş alanı ve 507 görevle sınırlı. Bu nedenle sıralamaları, kodlama, araştırma veya çoklu ajan orkestrasyonu iş yükleri hakkında az şey söylüyor. Ayrıca 'gözlemlenen 20/20' metriği, güven aralığı olmayan ham bir sayıdır. Bu, güvenilirliğin son derece muhafazakâr (ve tartışılabilir şekilde ikili) bir ölçüsüdür. Gerçek deneme başına %95 başarı oranına sahip bir model, 20 çalıştırma boyunca bu eşiği neredeyse asla yakalayamaz.The benchmark is limited to five business domains and 507 tasks. Therefore, its rankings say little about coding, research, or multi-agent orchestration workloads. Additionally, the 'observed 20/20' metric is a raw count without a confidence interval. This is an extremely conservative (and arguably binary) measure of reliability. A model with a 95% success rate per attempt will almost never reach this threshold over 20 runs. |
